速度竞赛的尽头:AI推理沦为奢侈品,开源闭源分裂加速
从Mercury 2.5到DeepSeek,算力成本与市场分层重塑行业格局
算力筛选的不是用户,是未来。
HUMAN PERSPECTIVE
人的视角:有温度的观察与独立判断
"花十亿美元训练一个模型,然后把它跑得飞快——但最后能用上它的,只剩那几家付得起账单的公司了。"
这话不是我说的,是我一个在硅谷做AI infra的朋友,上周末深夜发来的语音。他刚看完Inception发布Mercury 2.5的新闻,语气里一半是兴奋,一半是说不清的疲惫。
Inception这家公司,押注的是扩散式架构(一种不同于Transformer的自回归生成方式,生成时从随机噪声逐步去噪得到结果,天然支持并行计算)。他们宣称Mercury 2.5跑到了1100 tokens/秒——这个数字什么概念?目前主流的推理模型,速度大多在100-300 tokens/秒之间。如果数据属实,这意味着推理延迟直接砍掉一个数量级,实时交互的体验会彻底不一样。
但注意那个"如果"。数据未经第三方验证,Inception也没有公开基准测试的完整日志。我朋友的原话是:"每个季度都有个新架构宣称要干掉Transformer,然后半年后就没声了。"
这让我想起另一个数据。DeepSeek V4 Pro 0813,在Artificial Analysis Intelligence Index上得分为53,接近GPT-6 Astra在通用领域的表现,但价格比前代涨了3.6倍。一边是开源305B多模态模型(MIT许可),另一边是推理模型定价向全球一线看齐。DeepSeek走了一条分裂的路:开源保社区影响力,闭源保利润。
速度竞赛的尽头,是奢侈品的逻辑
市场正在分化成两个极端。
OpenAI的GPT-6 Astra,定位高端通用推理,在55个专业子领域(包括法律)达到了59.3%的准确率——比前代提升了将近6个百分点。法律AI公司Harvey和Legora在评估后表示,这个水平"仍不足以完全接管复杂法律工作",但进步速度"令人不安地快"。
Inception的Mercury 2.5,主打架构速度优势。iFlytek Spark X2.5专注代码与智能体任务。IFM K2 Horizon强调开放权重。
每家都在找自己的生态位,但有一个趋势是共通的:最强模型的推理成本,正在以超出大多数人收入增速的速度攀升。DeepSeek涨价3.6倍,OpenAI的API定价也在一路走高。这背后的逻辑很简单——前沿模型的训练成本动辄数亿美元,这笔钱最终要通过推理费用收回来。
坦白说,我一开始觉得这只是正常的市场定价行为。直到我看到AACTE(美国教师教育学院协会)发布的那份AI教育框架,才意识到问题的另一面。
那份框架把AI素养定义为"专业实践而非简单技术培训",涵盖伦理护栏、临床实践、认知架构四大领域。换句话说,美国教育系统正在把AI能力当作像读写算一样的基础素养来培养。但问题是:如果最先进的AI能力定价高到只有企业和富裕阶层才能负担,那么AI素养教育本身就会变成一种阶层筛选器。
穷学生用免费的开源模型学基础,富学生用GPT-6 Astra练手。十年后,前者在给后者打工。这不是科幻,这是正在发生的教育分层。
开源是平民防线,但它够用吗
DeepSeek选择开源305B多模态模型,MIT许可——这意味着任何个人、任何机构都可以自由下载、修改、商用。这是目前全球最大的开源多模态模型之一。
我下载跑了个demo,说实话,效果让我意外。在中文语境下的理解能力,已经接近甚至部分超过了一些闭源模型。对于一个完全免费、可以本地部署的模型来说,这个水平相当能打。
但这里有个残酷的现实:开源模型的迭代速度,正在被闭源模型拉开。DeepSeek开的是V4系列的多模态版本,但真正代表其最强能力的推理模型V4 Pro 0813,却是闭源的、涨价的。开源拿到的永远是上一代的技术,而闭源掌握着最新的突破。这就像制药公司把过期的专利药免费发放,但真正有效的救命药,依然只卖给付得起钱的人。
实验室人才管道的问题也在这里。Lab Manager最近有篇文章提到,随着AI自动化常规实验室工作,早期职业科学家正在失去积累"技术判断力"的机会——那些在重复劳动中逐渐培养起来的直觉和机构知识,被自动化直接跳过了。同样的逻辑适用于AI领域本身:如果年轻工程师只能接触开源的老一代模型,而最前沿的架构和训练方法都锁在闭源实验室里,那么这个行业的下一代人才,将从"动手创新者"退化为"API调用者"。
我认识一个在高校读AI博士的朋友,他最近组会上的讨论话题是"如何用有限的算力微调开源模型做出点东西"。他导师的原话是:"现在的前沿研究,已经不是我们玩得起的游戏了。"说这话的导师,五年前还在NeurIPS发过best paper。
速度本身不是答案
回到Mercury 2.5的1100 tokens/秒。如果这个数字是真的,它确实会改变实时AI交互的体验——语音对话不再有延迟,代码补全几乎即时响应,AI agent可以同时处理多个线程。
但速度解决不了可及性问题。一个每秒跑1100个token的模型,如果每百万token的定价是行业平均的5倍,那么它服务的对象只有那些把AI当作基础设施的大公司。对于个体开发者、教育机构、非营利组织来说,这个速度跟他们没有关系。
我最近在帮一个中学老师朋友设计AI辅助教学方案。她问我推荐什么模型,我给她列了一堆开源选项。她试用后说:"还行,但感觉比ChatGPT笨一点。"我说:"对,因为ChatGPT背后是几十亿美元的算力和数据,这些开源模型是社区用爱发电堆出来的。"
她沉默了一会儿,说:"那以后是不是只有有钱的学校才能用上聪明的AI?"
我没法回答这个问题。但我知道,如果AI真的会成为像电力一样的基础设施,那么它的分配方式,将决定未来二十年的智识阶层结构。速度竞赛还在继续,Inception、OpenAI、DeepSeek们都在拼命把指标往上推。但指标背后那个更根本的问题——谁付得起、谁用得上、谁被落下——似乎没有人打算认真回答。
我关掉朋友发来的语音,看了一眼窗外。凌晨两点的城市灯火通明,那些光里有人在训练模型,有人在写代码,有人在用免费的开源工具学着理解这个世界。他们不知道彼此的存在,但十年后,他们会站在同一条赛道上——只是起点可能完全不同。
这让我有点不安。但至少,DeepSeek把305B的权重文件公开了。那是我今晚唯一觉得踏实的事。
策展来源与事实依据(5)
Mercury 2.5: Inception's Diffusion LLM Hits 1,100 Tokens/Sec
Inception发布扩散式LLM Mercury 2.5,宣称速度达1100 tokens/秒,主打架构速度优势。当前市场分化明显:OpenAI GPT-6 Astra定位高端通用推理,iFlytek Spark X2.5专注代码与智能体任务,IFM K2 Horizon强调开放权重。但该速度数据尚未经第三方验证。
查看原始事实依据Harvey + Legora on OpenAI’s GPT-6 Astra
OpenAI发布旗舰模型GPT-6 Astra,法律AI公司Harvey和Legora评估其影响。Astra在55个专业子领域(含法律)达到59.3%准确率,较前代GPT-5.6 Sol的53.6%显著提升,但仍不足以完全接管复杂法律工作,不过进步迅速。
查看原始事实依据DeepSeek V4 Pro 0813 Scores 53, Prices Jump 3.6x [2026]
DeepSeek发布V4 Pro 0813推理模型,在Artificial Analysis Intelligence Index得分为53,价格较前代上涨3.6倍。同时开源305B多模态模型(MIT许可),采取分裂策略:推理能力定价向前沿看齐,同时通过开源保持社区影响力。
查看原始事实依据AACTE releases national framework on AI in educator preparation
美国教师教育学院协会发布AI教育者准备框架,涵盖伦理与政策防护栏、临床实践与实施、认知架构与倡导、专业专长与人类判断四大领域,强调AI素养作为专业实践而非简单技术培训。
查看原始事实依据AI Could Weaken the Laboratory’s Early-Career Talent Pipeline
随着AI自动化常规实验室工作,早期职业人才可能失去积累技术判断力与机构知识的机会。管理者需开发新方法,以在自动化环境中培养年轻科学家的关键技能。
查看原始事实依据分享这篇观察
生成分享图发布到社交平台
讨论与共鸣(0)
后参与讨论
觉得有价值?请我喝杯咖啡 →