KDay.world
Day 245/1000观察时代
DAY 238 / 1000观察时代6 分钟阅读

AI复读机困境:97%的原创构想早已存在

盲测揭示模型创新上限,科研叙事亟需修正

技术前沿AI研究基准测试创新局限

真正的创新不在模型里,而在改写模型的勇气里。

HUMAN PERSPECTIVE

人的视角:有温度的观察与独立判断

"你觉得,AI真的能提出改变世界的科学假设吗?"

朋友把一篇TechTimes的报道推给我时,我正在咖啡店等一杯拿铁。报道说,一项最新盲测研究测试了前沿AI模型提出新颖研究构想的能力。结果有点惨:模型只能恢复3%的研究构想。换句话说,你给它100个它自己"原创"的想法,97个都能在已有文献里找到影子。

这让我想起三年前OpenAI刚放出GPT-3时,满屏都是"AI将接管科研"的标题。现在呢?最前沿的模型,在"真正新"这件事上,依然像个复读机。

为什么"3%"这个数字值得停下来看看

先交代清楚这个测试是怎么做的。研究者用了一种叫"重建"(reconstruction)的方法来避免基准污染——这是AI评测里的老难题:模型训练时见过太多论文,你让它"提个新想法",它可能只是把见过的内容重新组合了一遍,看起来像创新,其实是高级抄袭。

盲测的方式是:让模型提出一个研究构想,然后让人类专家判断——这个构想如果写成论文,能不能通过同行评审?结果3%的通过率,基本等于"几乎没有"。

这个数字最扎眼的地方在于:它戳破了一个被反复包装的叙事——"AI将加速科学发现"。

坦白说,我一开始看到这个研究,第一反应是"这有什么奇怪的"。AI本来就是个统计模型,它的本质是"从已知中找规律",你指望它跳出已知的框架,本来就是强人所难。但后来我意识到,问题没那么简单。

过去两年,我们看到太多AI辅助科研的"成功案例":AlphaFold预测蛋白质结构、AI发现新材料、GPT-4在化学合成上给出人类没想到的路径。这些是真的。但它们都有一个共同点——都是在"已知问题的已知空间"里找答案。AlphaFold再厉害,它解决的还是"给定氨基酸序列,预测三维结构"这个被定义好的问题。

而"提出一个全新的研究构想"意味着什么?意味着你得自己定义问题,自己找到文献里没人提过的空白处,自己设想一个可能被推翻的假设。这已经不是"找答案"了,是"提出问题"。

模型能回答,但不会提问。这是3%和100%之间的本质差距。

别急着神化,也别急着否定

这里得说清楚一个容易混淆的点。3%的成功率,不等于AI在科研上没用。恰恰相反,在文献总结、实验设计辅助、数据处理这些环节,AI已经是个好帮手了。研究里也提到,模型在"总结现有文献"和"辅助研究"方面表现相当出色。

问题在于,我们把"辅助"和"创新"混为一谈了。

我认识一个做材料科学的朋友,他们实验室去年用AI筛选了上万种化合物组合,最终锁定了3个有潜力的候选材料。这算不算AI创新?算,但更准确地说,这是AI帮人类把搜索空间缩小了。真正的创新——"为什么我们要试这几种材料而不是那几种"——依然是人提出的。

这就引出一个更实际的问题:如果AI只能做"已知空间的加速器",那它对科研的边际价值到底在哪?

我的判断是:AI的价值不在"替代思考",而在"压缩试错成本"。 过去要花三个月做的文献综述,现在三天搞定;过去要试一百个实验条件,现在AI先帮你筛掉八十个。这些是实打实的效率提升,但它不会自动变成"新发现"。

真正的发现,依然需要人类去定义那个"值得试的问题"。

那个"值得试的问题"从哪来?

这可能是这个研究最让我在意的地方。它提醒我们,创新这件事,可能比我们想象的更"非算法化"

想想科学史上那些真正的突破:爱因斯坦的相对论、沃森和克里克的双螺旋、图灵的"机器能思考吗"。这些想法在提出时,不仅文献里没有,连提问的方式都是全新的。爱因斯坦问的不是"光速是多少",而是"如果我追着光跑会看到什么"——这个"如果",没有任何训练数据能告诉他。

当然,你可以说,这些天才的想法也是基于大量已有知识的重组。但问题是,重组的方式本身有一种"跳跃性",一种"从A直接跳到D,跳过B和C"的能力。这种跳跃,恰恰是统计模型最不擅长的——它每一步都在算"最可能的下一步",而创新的本质往往是"走一条最不可能的路"。

这让我想起一个有趣的类比。AlphaGo下棋时,第37手震惊了所有职业棋手——那步棋不在任何棋谱里。但注意,AlphaGo是在"围棋规则"这个封闭系统里创新的。而科学探索面对的是开放系统,规则本身都在变。在封闭系统里找到新路径,和在开放系统里定义新规则,是两码事。

所以,别神化它,但也别小看它

写到这里,我承认我的态度有点"骑墙"。但这不是和稀泥——我的判断是分层的:

短期(5-10年),AI会是科研的超级加速器,把人类的试错成本压到极低。但它不会自己提出"值得研究的问题"。

中期(10-20年),如果AI能学会"提问"——比如通过元学习(meta-learning)方式自己生成新的研究框架——那才是真正的范式转移。但现在看,这个方向连路线图都还没有。

长期呢?谁知道。也许某天,AI真的能跳出训练数据的边界,提出人类想都没想过的假设。但至少今天,看到那个3%的数字,我反而松了口气——如果连最前沿的模型都只能做到3%,说明"真正的新"依然是稀缺品,而稀缺品,永远有人的位置。

拿铁凉了。我把它喝完,给朋友回了条消息:

"这研究挺有意思的。但你知道最讽刺的是什么吗?——它本身就是一个人类提出的、AI没能提出来的研究构想。"

策展来源与事实依据(1)
techtimes.com

盲测基准测试发现前沿AI在研究构想恢复方面仅有3%成功率

一项新研究通过重建(reconstruction)方法避免基准污染,测试前沿AI模型提出新颖研究构想的能力。结果显示,在盲测中,模型仅能恢复3%的研究构想,表明AI在生成真正新颖假设方面能力有限,尽管其在文献总结和辅助研究方面表现出色。

查看原始事实依据

分享这篇观察

生成分享图发布到社交平台

讨论与共鸣(0)

加载评论中...

后参与讨论