模型没变,准确率从20%到80%:AI医疗的瓶颈不在智力
Atropos Health基准测试显示,接入真实世界证据后,临床模型表现提升超300%
模型不变,证据一变,庸医变神医。
HUMAN PERSPECTIVE
人的视角:有温度的观察与独立判断
昨天下午,我在一个医学AI的线上讨论里看到有人贴了张图。Atropos Health 的 Precision Evidence Bench 测试结果:同一个临床大模型,回答患者情境化的治疗问题时,如果不给任何外部证据,准确率大概在百分之二十几;一旦接入他们那套真实世界证据库,直接跳到接近百分之八十。
提升超过 300%。
我盯着这个数字看了好一会儿。不是因为惊讶于提升幅度,而是因为它指向一个让人不太舒服的结论。
模型没变,变的是它旁边站着谁
先说清楚这是什么实验。Atropos Health 做了个叫 Precision Evidence Bench 的基准,专门测大模型在精准医疗场景下的表现——不是考它背不背得出医学教科书,而是给它一个具体患者的复杂情况,问“这个人下一步该怎么治”。然后他们对比两种模式:裸模型直接回答,和模型加上高质量真实世界证据(RWE,指从电子病历、保险理赔、临床登记等真实诊疗过程中提取的数据,不是实验室里的理想条件数据)之后再回答。
结果就是开头那个跳跃,从二十几分到接近八十。
关键在于,模型本身一行参数都没改。变的只是它面前多了一个证据库。Atropos 同时宣布他们的 Alexandria 证据库已经积累了 5 亿个研究等效数据点,目标是 2026 年底到 20 亿。
这让我重新想了一个问题:过去两年大家拼命刷榜、比参数、卷训练成本,是不是把力气使错了地方?
坦白说,我之前的判断是需要修正的。我一直觉得模型能力是天花板,数据是地板——先有好模型,才谈得上用好数据。但这个实验说明,在临床这种高复杂度、高容错要求的场景里,天花板可能不是模型智力,而是它能调用的证据质量。你给一个中等聪明的模型配一套顶级证据库,它的表现可以碾压一个顶级模型空手作答。
这就像考试。一个普通学生带着课本进考场,和一个天才学生闭卷答题——谁分高,取决于题目有多依赖记忆和检索。
开源的不只是模型,是整条工具链
同一天还有一个消息我觉得被低估了。
Insilico Medicine 在 Cell 上发了篇封面研究,一次性开源了三样东西:LongevityBench,第一个评估 AI 在衰老生物学领域推理能力的开放基准;Longevity-LLMs,用临床和多组学衰老数据训练的开源小模型;还有 Longevity Claw,一个能自主调用各种长寿研究工具来识别治疗靶点的智能体平台。合作方包括 Liquid AI、Buck 衰老研究所和哈佛医学院。
注意这个组合。不是开源一个模型,而是基准、模型、智能体三位一体全部开放。
这跟 Atropos 的逻辑是同一件事的两面。Atropos 证明了证据供给决定模型表现上限,Insilico 则直接把“怎么评估、用什么模型、怎么调用工具”这一整套基础设施摊开给所有人。如果说 Atropos 是在说“证据比模型重要”,Insilico 就是在说“那我把证据工具链全给你,你自己来验证”。
我一开始以为这只是学术界的常规开源。后来发现不太对——LongevityBench 是“首个”针对衰老生物学的 AI 推理基准,这意味着在此之前,这个领域连“怎么判断一个 AI 到底懂不懂衰老”都没有标准。没有标准,就没有可比性;没有可比性,就没有竞争压力;没有竞争压力,进展就是散的。
现在标准有了,工具有了,模型有了。门槛从“你得有个大模型团队”变成了“你得有好的生物学问题”。
这对小实验室和初创公司是好事。但对中国 Step 5 Preview 这种走极致性价比路线的模型来说,可能也是另一种压力——当工具链开源、证据库开放,模型本身的价格优势还能撑多久?
真正在发生的转移
把这几件事放在一起看,一条线就出来了。
微软那篇内部转型博客里有个数据我印象很深:他们在云供应链工作流部署了 111 个 AI 智能体,规划周期从 10 个工作日压到 2.5 天以内。这不是模型能力的胜利——这是把模型嵌入到具体工作流、接上具体数据源之后的系统胜利。
arXiv 上那篇讲递归自我改进的论文,提到 OpenAI 对 GPT-6 Astra 的评估方式:让智能体在单张 H100 上自己诊断训练瓶颈、改代码、调参。这也不是在测模型多聪明,而是在测它能不能在受限条件下自己找到改进路径。
三件事,同一个方向。
竞赛的计分板正在换。 以前比的是“你的模型在 MMLU 上多少分”,现在比的是“你的模型接上我的证据库之后能解决什么真实问题”。以前比的是“训练用了多少卡”,现在比的是“部署之后工作流快了多少”。
谁掌握真实数据闭环,谁定义前沿。这句话现在听起来不像口号了。
一个具体的画面
我认识一个在深圳做医疗AI产品的人,他们团队去年花了大力气微调模型,想把诊断准确率从 78% 提到 82%。做了三个月,卡在 80% 上不去。
上个月他跟我说,他们换了个思路——不调模型了,去跟两家三甲医院谈数据合作,把脱敏后的真实诊疗路径接进来。两周之内,准确率到了 87%。
他说了句话我记到现在:“我们之前一直在改发动机,后来发现是油不行。”
这大概就是 2026 年 AI 竞赛的真正转折点。模型还是那台发动机,但比赛项目从“谁的发动机马力大”变成了“谁的油路铺得远”。
Atropos 的 5 亿数据点、Insilico 的开源工具链、微软的 111 个智能体,都是油路。
至于 Step 5 Preview 那种把前沿能力打到地板价的模型——它让发动机变得便宜,但油路依然要一寸一寸铺。便宜发动机加烂油,跑不过贵发动机加好油。但如果便宜发动机加好油呢?
那才是真正让巨头睡不着的事。
策展来源与事实依据(5)
Clinical LLM Performance Improves by >300% When Provided With High-Quality Real-World Evidence in New Precision Medicine Benchmark
Atropos Health 推出 Precision Evidence Bench,首个评估 LLM 在精准医疗中回答患者情境化临床问题能力的基准。研究显示,为 LLM 提供高质量真实世界证据(RWE)后,其临床回答性能提升超过 300%。公司同时宣布其 Alexandria 证据库已达 5 亿个研究等效数据,预计 2026 年底达 20 亿。
查看原始事实依据Insilico Medicine Opens AI Longevity Discovery Toolkit to Researchers Worldwide in Cell Cover Study
Insilico Medicine 在 Cell 封面研究中发布开放 AI 长寿发现工具包,包含 LongevityBench(首个评估衰老生物学 AI 推理的开放基准)、Longevity-LLMs(基于临床与多组学衰老数据训练的开源小模型)及 Longevity Claw(自主整合长寿工具识别治疗靶点的开源智能体平台)。合作方包括 Liquid AI、Buck 衰老研究所和哈佛医学院。
查看原始事实依据The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement
arXiv 论文探讨递归自我改进 AI 的路径,涉及训练规则搜索、合成数据生成等方向。文中引用 OpenAI 对 GPT-6 Astra 的 NanoGPT 评估——智能体需在固定验证目标、单张 H100 和受限训练条件下自行诊断瓶颈、修改训练代码和调参,以及 NVIDIA Nemotron-4 的合成数据训练方法。
查看原始事实依据Step 5 Preview: China's Cheapest Frontier AI Model Yet
报道称中国新模型 Step 5 Preview 在 Artificial Analysis 智能指数上得分 44,仅比 2026 年 9 月的前沿线(约 45 分)低一分,与 Grok 4.6、Kimi K3 持平,被称为中国迄今最便宜的前沿级 AI 模型。文章还提及 Meta Muse Spark 1.3、Anthropic Claude Opus 5 等前沿模型表现。
查看原始事实依据What we've learned from Microsoft's own AI transformation
微软分享其内部 AI 转型经验:150 多人跨职能团队在 2025 年 9 月至 2026 年 8 月间,在云供应链工作流部署超 111 个 AI 智能体。5 个月度规划周期内,平均周期时间从约 10 个工作日降至不到 2.5 天;需求计划调查的人工验证解释产出时间从 5-7 天降至数小时。
查看原始事实依据分享这篇观察
生成分享图发布到社交平台
讨论与共鸣(0)
后参与讨论
觉得有价值?请我喝杯咖啡 →