WAIC2026:王坚院士称大模型“无前途”?数据才是AI的“隐形天花板”!

创建时间:2026-07-21 09:00
浏览量:0

 

 
就在2026世界人工智能大会(WAIC)上,阿里云创始人、中国工程院院士王坚抛出了一枚“重磅炸弹”。
他直言不讳地指出,当前行业根深蒂固的思维惯性,是将“大模型”直接等同于“大语言模型”。然而,人工智能下一轮真正的革命驱动力,不会是更大参数、更强Agent的语言模型,而是科学数据
这一论断,直接击中了当下AI产业的痛点:如果AI理解世界的边界,只局限于人类写出来的论文、代码和文字,那科学创新的天花板将被彻底锁死。

 

 

 

 

 

AI透过玻璃观察数据

文本内卷的尽头:AI“隔着一层玻璃”看世界

回顾AI发展史,每一次真正改变行业范式的突破,核心从来不是模型架构,而是数据。
2012年深度学习的爆发,根源在于ImageNet这套标准化图像数据集的诞生;Transformer统一赛道,是因为人类首次把文本数据的分词、序列化处理做到了标准化。可以说,大语言模型只是把人类几千年来处理文本的能力,用算力放大到了极致。
但这里存在一个巨大的瓶颈:绝大多数真实世界的科学信息,根本不以文字形式存在。
以地学为例,地球70%以上的核心科研信息,存储在光谱、地震波、地磁原始信号里,这些从未被写进任何一篇论文。一段完整的光谱数据,其价值甚至超过千万张图像。然而,现在的AI无法直接读取这类原生科学数据,只能依靠人类将其“翻译”成文字,模型才能间接读懂。
这相当于让AI隔着一层玻璃观察世界,永远触碰不到自然规律的本源。

旧数据与新范式:150万个天体的发现启示

为什么科学数据如此重要?王坚院士举了一个震撼的天文案例。
一颗早已退役的小行星观测卫星,其最初的设计目标根本不是搜寻未知天体。但后来,科研团队用全新的AI模型,重新解析它留存几十年的原始观测数据,最终识别出150万个从未被人类编目、发现过的天体。
这个案例印证了科学研究的新逻辑:重大科学发现,不一定需要新设备、新实验,旧数据搭配新AI范式,就能诞生颠覆性结论。
目前业界热议的AI4S(科学智能),被称为科研第五范式。但全球行业对这一概念至今没有统一标准,这种认知上的分歧,恰恰说明我们正处在范式变革的起点。
长远来看,AI终将和数学一样,成为全学科通用的基础科研工具。过去十年,大语言模型教会机器读懂人类;未来十年,搭载科学数据能力的科学基础模型,将教会机器读懂自然。

企业AI的下一站:从“读人”到“读世界”

王坚院士呼吁打造科学基础模型,让科学数据成为模型里的“一等公民”,实现文本、代码、光谱、波形、观测原始数据在同一模型空间的统一建模与理解。
这对企业构建AI能力有着深刻的启示:企业缺的不是AI模型,而是“可用 + 敢用”的高质量数据。
当行业还在文本世界里内卷参数时,真正的机会在于那些未被文字记录的“暗数据”。对于企业而言,无论是研发数据、工业传感数据,还是历史业务数据,如何将这些多模态、非结构化的原生数据,转化为AI可直接理解的“燃料”,将是决胜未来的关键。
在这个过程中,数据的安全治理与资产化变得前所未有的重要。科学数据往往涉及企业的核心知识产权与商业机密,如何在开放共享与严格保护之间找到平衡,是构建科学基础模型的前提。
在AI数据安全领域,闪捷信息已构建覆盖智能体安全、数据分类分级、内容风控及备份数据资产化的完整产品体系,助力企业在释放数据价值的同时,筑牢安全防线。