一觉醒来被GPT-6进入AGI时代刷屏。AGI是什么?怎么才算AGI?
这个词到今天也没有一个大家都认的定义,所以才吵得起来
北京时间9月4日凌晨,OpenAI发布新模型GPT-6 Astra。发布会最后,总裁Greg Brockman说了一句"欢迎来到AGI时代",接着补了一句:对我个人而言,我认为我们已经到了。
一觉醒来,满屏都是这句话。
同一天,给这个模型出考题的机构也发了篇文章,说的是另一个意思:这套题被跑满,也不等于证明了AGI。
一边说到了,一边说没到。问题出在,AGI这个词本身就没有一个大家都认的定义。
AGI是什么:关键在"通用"两个字
AGI是artificial general intelligence的缩写,中文叫通用人工智能。
现在的AI都是专才。会下棋的那个不会开车,会写文案的那个不会看CT片。你让它干练过的活,它比人强;换一件没见过的事,它常常连门都摸不着。
AGI说的是另一种东西:什么活都能上手。丢给它一件从没做过的事,它自己琢磨琢磨就会了,跟一个成年人换份工作差不多。
所以难点从来不在强不强,在换一件事还行不行。
怎么才算:从1950年到现在,尺子换了四把
第一把是图灵的,1950年。你隔着屏幕跟对面聊天,分不出是人还是机器,就算它会思考。今天的聊天机器人早就过了这一关,可谁也没因此宣布AGI来了。这把尺子量的是像不像人,不是能不能干活,现在没人再拿它说事了。
第二把是OpenAI自己的。它章程里的定义是:世上大部分能挣钱的活,它干得比人好。这是拿工作当尺子。麻烦在"大部分"怎么数,全世界几千种职业,数哪些、怎么算,谁也说不清。
第三把是出题那家的。ARC Prize的说法是,人能学会的本事它也能学会,而且不比人多费劲。重点在"没见过"三个字上。做见过的题不算本事,第一次见就能摸出路子才算。这跟我们看孩子做题是一个道理:刷过八百遍的题型做对了说明不了什么,给一道从没见过的,能自己想出办法,那才叫会。
第四把在学术界。2025年10月有篇论文叫《A Definition of AGI》,把心理学里最成熟的那套人类智力模型搬了过来,拆成十项打分,常识、数学、推理、记性、视觉、听觉、反应速度都在里头,每项占十分之一。GPT-5的成绩是十项平均58分,但换成不许偏科的算法重算,只剩24分。有几项接近人,有几项差得远,而这把尺子不让强项去补弱项。
四把尺子,量的根本不是同一件事。所以同一个模型,有人说到了,有人说没到。
这次吵起来,是因为同一个模型考出了两个分数
ARC Prize那套题叫ARC-AGI,一共出过三代,一代比一代难。最新的第三代,考法是把AI丢进一个它没玩过的小游戏,不给说明书,看它要试多少步才能摸清规则。
这一代,Astra考了两次。
用大家通用的那套考法,62.7%。用OpenAI自己配的考法,99.9%。
模型是同一个,一个字都没改。变的是考试怎么组织。比如它做题时随手记下的东西,下一题还能不能带着;上一轮想到哪儿了,还记不记得住。就这点差别,分数从62跳到99,而且后一次花的钱反而更少。
争论就卡在这里:这99.9%,是它真的更聪明了,还是考场给它铺得太顺。
出题方自己的结论写得很直白:把这套题跑满,不构成达成AGI的证明。理由是他们的题目规则固定、边界清楚,真实世界不长这样。
在OpenAI那套考法里,Astra有96%的关卡比人用的步数还少,平均每关少一半。这个成绩也是ARC Prize自己测出来公布的。同一家机构,一边说它比人做得好,一边说这不算AGI。
你觉得,我们算是进入AGI时代了吗?