9月3日,OpenAI发布新一代旗舰模型GPT-6 Astra,总裁格雷格·布罗克曼随即高调宣告:“欢迎来到AGI时代。”
几天后,英伟达CEO黄仁勋也在社交平台发文附和:“AGI已经到来。”所谓AGI,就是通用人工智能,被认为是AI超过或者完全赶上人类的标志。
Astra被描述为一款能直接操作电脑的持久性智能体,能自主填写表格、在线研究、编写代码,甚至在网络安全评估中达到关键级,能发现此前未知的零日漏洞。面对这样一份亮眼的成绩单,似乎AGI已至成了不争的事实。
但事情远没有那么简单。
如果我们稍加审视,就会发现“宣布AGI”本身更像一场商业叙事,而非科学共识。AGI至今没有一个公认的统一定义。OpenAI自己的章程里写的是“在大多数具有经济价值的工作上超越人类的高度自主系统”;
图灵奖得主本吉奥强调“人类级学习与推理能力”;而谷歌DeepMind则提出了分等级的认知评估框架。
定义五花八门,判据各不相同。正因如此,OpenAI首席执行官奥特曼在发布前两天还公开表示,AGI充其量只是“一个定义非常糟糕的营销术语”。总裁与CEO在同一个问题上口径不一,这种场面在硅谷并不多见。
更耐人寻味的是数据背后的水分。OpenAI宣称Astra在ARC-AGI-3基准测试中拿下了99.9%的分数,近乎完美。但当出题方ARC Prize Foundation用统一的“标准测试环境”重新评估时,同一模型的得分从99.9%骤降至62.7%。
同一个模型,同一套题,差出37个百分点。评测机构的态度很干脆:即便Astra拿了近满分,他们也不认为这足以证明AGI已经实现。
黄仁勋的宣告就更是搞笑了,因为这已是他半年内第三次宣称“AGI已来”。每次宣告之后,都说自己的芯片扮演了关键作用,供不应求,这同样完全是带货的话术。
学术界的判断则冷静得多。图灵奖得主Bengio联合全球多家机构,参照心理学CHC理论,将通用智能拆解为10个可量化认知领域,采用百分制评估。按这套标准,AGI还有很远的路要走,而这套标准本身,其实也并非大家都认可的真理。
回到根本:一个能考高分、能写代码、能发现漏洞的超级工具,与一个像人类一样拥有连续自我意识、真正理解世界、具备通用常识的思考者之间,依然横亘着巨大的鸿沟。
神经科学家Erik Hoel在2026年初的论文中指出,现有大模型缺乏持续学习能力,从原理上无法拥有意识。
我们欢呼技术进步,但不必被商业话术裹挟。当“AGI已来”被当作市场营销的标签反复张贴时,保持一份清醒,追问一句“按谁的定义、用什么尺子量的”,或许比盲目相信更有价值。
发表评论 取消回复