现在订阅CCCF 12期纸质刊,随刊赠送CCCF 20周年纪念帆布包一只,数量有限,赠完即止。
本文首先介绍了学术界对“通用人工智能”的不同定义和人工智能通用性的测试标准;然后讨论了通用人工智能何时才能实现、目前的机器学习技术路线能否构建出AGI;最后指出发展AI的主要目标不是LLM-AGI,而是“可信可用AI”,我们更需要“有边界的智能”,更平衡的AI发展策略是“数据中心AGI +专用 AI”双轨并行发展模式。
通用人工智能是发展AI的初衷,1956年提出“人工智能”的目标就是发展通用人工智能。2007年前后,Ben Goertzel、Shane Legg、Pei Wang(王培)等学者编辑出版论文文集Artificial General Intelligence,给出AGI的形式化定义,创建专门的期刊Journal of Artificial General Intelligence,提出非公理推理系统,推动通用人工智能(AGI)成为大众关注的研究方向。自2022年ChatGPT问世以后,“AGI”一词已被产业界重新定义。本文要讨论的不是要不要发展AGI,而是AGI是不是人工智能的主要发展方向,AGI在两三年内会不会实现。
学术界对“通用人工智能”的不同定义
人工智能已经研究了几十年,但对于什么是通用人工智能,学术界还没有形成一致公认的定义,但已经有一些基本的共识。下面列出著名的人工智能学者对通用人工智能的不同看法(按发表观点的时间排序)1
Alan Turing(1950):“当一台机器的智能行为无法与人类区分时,我们可以称它为智能。”
John McCarthy(1959):“人工智能的目标是让机器做任何人类能够做的智力工作。”
Newell & Simon(1976):“物理符号系统具有执行一般智能行动的必要和充分条件。”
Shane Legg (2007):“智能是个体在广泛环境中达成目标的能力。”
Ben Goertzel(2007):“通用人工智能是一种能像人类一样理解、学习并在各种领域灵活应用知识的系统。”
王培(美国天普大学,2008):“通用人工智能是在知识与资源不足的情况下适应其环境的能力”
Yoshua Bengio(蒙特利尔大学,2022): “通用人工智能是具备人类级学习与推理能力、能在分布外泛化并构建高级世界模型的系统。”
Demis Hassabis(DeepMind,2022):“AGI是能够自主学习任何复杂任务并把知识迁移到新任务上的系统。”
Sam Altman(OpenAI,2023):“AGI是能在多数经济上有价值的工作中超越人类的系统。”
李飞飞(斯坦福大学,2023):“真正的通用人工智能,应该像人类一样,不仅能感知世界,还能理解、推理,并以社会化的方式参与其中。”
朱松纯(北京通用人工智能研究院,2023):“通用人工智能的目标,是生成完成任务的通用智能体,使其具备自主的感知、认知、决策、学习、执行和社会协作能力,并符合人类的情感、伦理与道德观。”
埃隆·马斯克(Tesla,2023):“通用人工智能就是那种比任何人类都聪明的数字心智。”
Hinton(多伦多大学,2023):“通用人工智能是一种能像人类一样灵活地理解、学习并推理世界的系统。
Yann LeCun(Meta,2024):“AGI不是单一模型,而是一整套能自主学习、规划、推理并在物理世界中行动的系统架构。”
对比归纳这些观点,可以发现对通用人工智能的定义在目标上有两方面的追求,一是“像人”,即具有与人类水平相当的认知功能,二是能解决复杂的任务,不一定要模仿人类的行为。在通用性上也有两个维度的追求,一是能完成各种不同的类人任务(任务通用性),二是在完成一项任务时能适应各种不同的环境(环境通用性)。这两个维度分别对应任务空间的广度和环境空间的鲁棒性,也就是认知能力的广度和智能适应的深度。真正的通用人工智能必须同时具备二者:既能做各种工作,又能在各种复杂的环境中做得好。不同的学者由于学术背景不同,对人工智能通用性的侧重点可能不一样,但离不开任务多样性和环境适应性这两个本质要求。总的来讲,20世纪的通用人工智能重视逻辑符号推理,强调模仿人类和任务通用性,21世纪的通用人工智能重视机器学习,更强调环境通用性。
值得指出的是,目前的人工智能通用性测试侧重于多任务AGI,测试目标主要是在不同类型任务上展现人类水平的“理解”与推理能力,如问答、编程、文字和图像理解等,评价维度主要是智能系统“知道的多”,“会做的事多”。GPT系列与多模态大模型目前占据AGI研究的主流,它们天生是“跨任务系统”。“多任务AGI”容易做成标准化考试,可打分、可比较、符合学术论文要求,因此受到学术界偏爱。但对于人工智能在各行业落地而言,多环境AGI的价值更高,需求更迫切。自动驾驶、机器人、工业控制、医疗设备、军用系统等应用,不一定要求一个智能系统做很多种任务,但都对系统的环境适应性有很高的要求。AGI的全面衡量应当是“在动态开放环境中自主学习并实现跨任务迁移的能力”。尽管“多环境AGI”的适应性测试常需高成本仿真或物理实验,很难考试打分,但这是实现真正的AGI不可或缺的关键环节,决不可轻视。
人工智能通用性的测试标准
通过什么测试才能认为AGI已经实现?
目前学术界对AI性能的测试正在从“单一测试”转向“多维度、动态化、任务导向”的评估框架。以下是几种较受学术界重视的AI通用性标准测试。
(1)CHC-AGI十大核心能力框架。2025年10月16日,基于心理学中实证最充分的人类智力模型—Cattell-Horn-Carroll(CHC)认知理论,图灵奖得主约书亚·本吉奥(Yoshua Bengio)领衔的27人国际研究团队发表重要论文“A Definition of AGI”,提出“AGI十大核心能力”框架(见表1)。此标准定义AGI是可以匹配或超过受过良好教育的成年人的认知多功能性和熟练程度。这是目前最可量化的AGI定义与测试框架,首次将AGI从哲学概念转化为可操作、可测评的科学标准。CHC-AGI测试结果揭示,当前大模型(如GPT-5)存在明显的“偏科”问题:阅读、写作和数学能力强(10分),但长期记忆能力严重缺失(MS得分为0),视觉推理、即时因果推理等关键维度也存在显著短板,见图1和表2。此评估标准每项能力权重相等,都为10%,总分100%。目前GPT-4的总分为27%,GPT-5总分为57%,离CHC-AGI定义的通用人工智能还有较大距离。
表1 Bengio等人提出的“AGI十大核心能力”框架
核心能力 | 测试方式 | 说明 |
一般知识(K) | 世界常识、文化、历史问答 | 非孤立知识,需关联使用 |
阅读与写作(RW) | 复杂文本理解与创作 | 如写一篇有深度的社论 |
数学能力(M) | 从算术到微积分的灵活应用 | 能建模现实问题 |
现场即时推理(R) | 面对新问题的灵活应对 | 如解决未见过的谜题 |
工作记忆(WM) | 多任务并行处理 | 如边听讲边记笔记 |
长期记忆存储(MS) | 持续学习新经验 | 如记住用户偏好并应用 |
长期记忆检索(MR) | 准确回忆,避免幻觉 | 关键瓶颈 |
视觉处理(V) | 理解复杂图像/视频 | 如分析监控画面 |
听觉处理(A) | 理解语音、音乐、节奏 | 如听懂方言对话 |
速度(S) | 快速执行认知任务 | 如即时反应 |
图1 GPT-4和GDP-5的CHC-AGI测试得分
表2 GPT-4 (2023) 和GPT-5 (2025) 的CHC-AGI分数汇总
(2)抽象推理挑战测试(Abstraction and Reasoning Corpus – Artificial。General Intelligence,ARC-AGI)。Fran?ois Chollet(Google DeepMind研究员)2019年提出ARC-AGI测试标准,其目标是AI系统在从未见过的任务上进行抽象推理和泛化的能力,其核心理念是真正的智能不在于记住多少知识,而在于面对一个全新的谜题时,能否通过观察少量示例,推断出背后的规则并正确应用。测试形式是每个任务提供3-5对输入/输出网格图(通常是5×5到13×13的彩色方格),AI必须从这些示例中推断出潜在的转换规则(例如:旋转、对称、颜色替换、路径追踪等),然后将该规则应用于一个新的输入网格,生成正确的输出。图2是最简单ARC-AGI测试示例。
图2 最简单ARC-AGI测试示例
2026年3月24日,ARC Prize基金会发表文章,公布人类基线与主流大模型对比的ARC-AGI-3盲测结果:人类可以解决100%的环境问题,而截至 2026年3月,前沿人工智能系统的得分低于1%。ARC-AGI-3计分采用效率平方惩罚公式:得分 =(人类最优步数÷AI步数)2,如果AI的步数是人类的10倍以上,得分就降到1%以下。这次测试戳破了“大模型接近AGI”的炒作泡沫,用事实说明当前的LLM还不具备人类的流体推理能力,推动AGI研究路线转向世界建模、内在好奇心探索和少样本交互式学习。
过去采用的AGI benchmark测试,顶尖的LLM模型的分数已逼近人类,不能有效对比智能体真实泛化能力。ARC Prize基金会称,ARC-AGI-3是目前唯一未饱和、面向通用智能体能力的评测基准。ARC-AGI-3测试结果表明:探索(能不能通过主动与环境互动来获取关键信息)、建模(能不能把零散的观察凝聚成一个可以预测未来状态的世界模型)、目标获取(能不能自己判断出“我应该以什么为目标”)、规划与执行(能不能规划出行动路径并根据环境反馈随时修正目标)是AGI的主要特征。AGI有多个维度的追求目标,ARC-AGI-3不是AGI的唯一测试标准,但至少说明实现真正的AGI还有较长的路要走。
(3)人类最后的考试(Human Last Exam,HLE)。此测试标准由多位AI安全与评估研究者2024年提出,测试目标是衡量AI是否具备与受过高等教育的人类相当的综合认知能力,覆盖知识、推理、创造力、伦理判断、跨学科整合等多个维度,强调真实世界应用能力,而非封闭选择题。测试内容包含多个模块:多学科知识整合、复杂阅读理解、创造性写作、伦理困境决策、数学建模、开放问题求解、反事实推理等。例如要求AI系统回答以下问题:“根据城市交通数据,建立优化红绿灯时长的模型”,“如何减少青少年抑郁症?(需提出可行方案并论证)”,“如果二战没有原子弹,世界会怎样?(要求逻辑自洽的推演)”。此测试由人类专家小组(教授、作家、科学家等)进行盲评,采用李克特量表(1–5分)评估,包括准确性、深度、创造性、逻辑性、人文关怀等维度,总分达到人类平均水平即视为“通过”。斯坦福2025人工智能指数报告指出:2025上半年无多模态、无联网检索的纯文本模型成绩得分率仅为8.80%。2026年初带多模态、长推理链的旗舰模型分数已提升至20%–37%。
通用人工智能何时才能实现?
争论通用人工智能何时实现是没有意义的,因为这是一个伪问题,不同人心目中的AGI的目标不一样,实现目标的时间当然不一样。这是就如同射箭,有人认为,只要箭射到靶上,就算射中;也有人认为,只有射中10环才算射中。所以是否射中,就看你怎么定义了。当然,不同人对人工智能的困难程度和技术发展速度的判断也不同,所以有各种不同的预测。
对何时能实现AGI的不同判断
不同背景的人对AGI何时实现有不同的判断,表3列出了若干知名企业家和学者对AGI何时到来的看法2。从表3可以看出,对AGI的到来最乐观的是企业家,多数人工智能学者的看法比较谨慎,而认知科学家和经济学家对短期内就能实现AGI的观点持批判态度。
表3 对何时能实现AGI的不同判断
姓名 | 身份 | 对AGI到达时间的观点 |
Elon Musk 马斯克 | xAI / 特斯拉CEO | 2026年底AI将超越单个人类的智能水平 |
孙正义 | 软银CEO | 2027–2028年可实现AGI |
黄仁勋 | NVIDIA CEO | 2029年AI可通过几乎人类所有测试 |
Ray Kurzweil | 谷歌首席研究员 | 2029 年达到完整人类水平智能, |
Sam Altman | OpenAI CEO | AGI会比大多数市场预期更早到来 |
Demis Hassabis | DeepMind CEO | 2030–2035年高概率实现完整AGI |
Geoffrey Hinton | 图灵奖得主 | 5–20年内会出现全面超越人类的超智能 |
Yoshua Bengio | 图灵奖得主 | 10–15年,AGI尚需重大突破 |
Yann LeCun | 图灵奖得主 | 也许“几十年”,仍需重大范式突破 |
Andrew Ng吴恩达 | 深度学习先驱学者 | 严格定义下的AGI 距离人类还有几十年 |
Gary Marcus | 认知科学家 | 需要数十年研究才能实现AGI |
Robin Hanson | 经济学家 | AGI成本极高,2050年以前不可能实现 |
其实,大多数工作在第一线做研究的人工智能学者,对AGI什么时候实现并不关心。斯坦福大学李飞飞教授对于AGI的看法有代表性。她多次表示,“坦白说,我甚至不知道AGI是什么意思。人们常说,‘当你看到它时,你就知道了。’我想我还没看到它。”“我不会花太多时间思考AGI这个术语。因为我还有很多重要的工作要做”。换言之,她倾向于把注意力放在AI的实际应用、安全、伦理等方面,而不是为“哪一年实现AGI”下注。
马斯克、黄仁勋、奥特曼、孙正义等企业巨头和投资人都对AGI做出非常乐观的预测,不一定是他们看到了“我们还没看到”的AI能力。从商业逻辑来看,利好的消息主要是为了融资。OpenAI公司以AGI为目标,通过万亿美元级融资信号,向全球资本市场与政府表明“AGI近在眼前”,以吸引国家级资金参与。只有抛出“5年内实现AGI”的技术目标,让OpenAI的融资理由具有强烈的时间紧迫感,才能促使投资方支撑如此巨额的融资计划。AGI何时实现已经不完全是一个对未来技术的认识问题,而是与数万亿美元挂钩的市场竞争策略。
目前的机器学习技术路线能否构建出AGI?
现代大模型,不管是国外的GPT-5、Claude 3、Llama 3,还是国内的DeepSeek,文心一言、通义千问,已从实验室成果开始走向真实应用,已具备一定程度的工程可用性和商业价值。斯坦福《AI Index Report 2025》指出,领先大模型在MMLU和 HumanEval等基准测试上的得分已超越人类专家水平。MMLU测试结果显示:OpenAI 2024年9月推出的o1-preview 模型得分92.3%,超越人类专家水平(89.8 %)。Anthropic公司2024年6月推出的Claude 3.5 Sonnet 在HumanEval基准测试中获得满分(100%),远超人类平均水平。
尽管机器学习特别是大语言模型取得了重大进展,已表现出较强的通用性,但仅靠基于Transformer的机器学习范式几乎不可能构建出真正的AGI。这是因为人们追求的AGI不仅仅是能做很多事情,而是要像人类一样灵活学习、推理、适应新任务,AI系统必须真正嵌入到人类生活的核心流程,满足人类的“刚需”。但现在的大模型可信性不足,许多行业还不敢用,不放心。“AGI”应当是“真正可用AI”的代名词,不仅仅是指基于大语言模型的通用性。所谓通用人工智能必须从“单一模型的广度”向“系统级智能的深度与灵活性”演进,从‘能不能做’的初级阶段进入‘做得多可靠、多安全、多高效’的新阶段。人们心目中的AGI应当是一个像操作系统那样可靠、集成、可扩展、可信任的AI基础设施。
不论是对上面讲的广义的AGI而言,还是只针对能实现任务迁移的狭义的AGI,目前的以大模型为标志的主流机器学习技术还存在原理性的缺陷。LLM 缺乏真正的“理解”能力和因果推理能力,未内建因果图或干预演算,没有稳定的、一致的概念表征,在需要干预、反事实、策略规划的任务中,泛化能力就会骤降。目前的大模型长期一致性与状态保持能力弱,在长对话或多步任务中易“遗忘”早期设定,产生矛盾,即使引入外部记忆,也缺乏对自身信念状态的动态更新与冲突检测机制。理想的AGI应该是在线持续学习系统,而当前模型是“静态”系统,训练完成后知识就冻结了。AGI需要自主探索、主动提问、从失败中学习的能力,现有框架做不到。通用人工智能必须“知之为知之,不知为不知”,但当前的大模型不知道自己错了,也不知道为什么错了,更做不到知错就改。解决大模型的“幻觉”问题不仅仅是技术上改进,需要对产生“幻觉”的机理有更深刻的认识。
总之,当前的机器学习主流范式是AGI的“必要条件”而不是“充分条件”,它提供了强大的感知和语言能力,但缺乏认知的“骨架”,单纯扩大模型规模无法解决核心问题。AGI需要超越“数据驱动”的范式,引入认知科学、神经科学、符号AI的成果,融入对世界的主动理解与规划,探索“世界模型”和具身智能等新架构。否则,AI可能陷入“局部智能”的陷阱,无法实现真正的通用性。
基于LLM的通用人工智能是发展AI的主要方向吗?
发展AI的主要目标不是LLM-AGI而是“可信可用AI”
人工智能发展表面上很红火,但是落地并不理想,对经济增长还没有起到显著作用。造成这种雷声大雨点小的局面主要不是因为AI的通用性不足,而是缺乏实用性。通用性 ≠ 实用性。虽然目前的大语言模型已初步具备跨领域能力,但多数AI是“插件式”工具,停留在“PPT智能”或“报表自动化”阶段,缺乏场景深度融合,只能“提供建议”,无法形成“执行+反馈+迭代”的完整流程,未融入用户核心工作流。AI平台生态未成型,没有类似“iOS + App Store”的标准化开发-分发-盈利闭环。当前AI产品和服务大多是辅助工具,而非不可替代的基础设施。导致的结果是,企业不敢将核心业务完全交给AI,个人也不愿让AI做重大决策。由于不能解决用户的痛点问题,AI就不能成为“非用不可”的技术
要让AI能解决各行业的“刚需”,主要的努力方向不是增强AI的通用性,而是可信度、成熟度、可用性和系统设计。目前的AI技术泛而不精,在专业场景(如医疗诊断、法律判决、工业控制)中,准确率、可靠性、合规性不足,缺乏闭环能力。在金融、医疗、司法等高风险领域,“宁可不用,也不能出错”是用户的普遍心态,因此新技术的可信度是能否大规模推广的关键。由于存在难以克服的幻觉,模型会自信地编造数据和事实,提供错误医疗建议、虚假法律条款,可能导致严重后果。大模型是黑箱决策机制,缺乏可解释性,用户无法理解“为什么这样推荐”,也就难以建立信任。影响AI落地的主要问题不是一个模型能做的事不够多,而是事情没有做到位,不可信,不放心。因此人工智能的可信度、真正可用才是重点发展方向,近期主攻目标不是基于大语言模型的“通用人工智能(LLM-AGI)”,而是“可信可用人工智能”(Trustworthy and Usable AI),要把AI嵌入到人们真正感到‘痛’的地方。
2025年,诺贝尔得主Bengio等人发表“Scientist AI”研究纲领,提出在在可预见的未来,应当优先发展“以科学理解与因果建模为目标、受强约束、不可自主行动的AI”,回避以“自主代理、目标驱动、长期行动”为核心的AGI路线,强调AI是“认知工具”,而不是“行动主体”。Bengio对AGI的谨慎观点和重点发展可信可用AI的建议值得重视。
我们更需要“有边界的智能”
过去十年,“通用人工智能(AGI)”成为AI领域的至高愿景。然而,无限通用性是一种不经济的技术幻想,现实世界并不需要“万能AI助手”,而是“有边界的智能”。通用性是有代价的,大模型的训练成本随着参数量的扩大而指数级增长,如果小任务也用大模型推理,不但响应慢而且能效低。太多功能耦合在一起,边界模糊,难以隔离攻击路径,安全性会降低。模型规模无限扩大,全局行为不可控,错误更难定位与纠正,可靠性问题会更加突出。
从另一个角度考虑,专用模型也有其不可替代的优势。一是性能更高,在具体任务上,专用模型往往精度、鲁棒性、收敛速度都优于通用模型。二是资源消耗更低。通用模型在大多数任务上是过度配置的;三是可解释性和可控性更强,专用模型能针对问题建模,提升因果性与可审查性,利于监管和部署。历史经验告诉我发展:技术发展从来都是“通用-专用”周期性交替演进,最终形成灵活组合的平台分层架构。有边界的通用性更有利于节约成本、增强可控性。我们可以用“特定领域可迁移性”来定义模型泛化能力的价值边界,逐步走向“广域适应性智能”。真正的智能,不是能做一切,而是知道自己在哪些问题上可以做得最好。与其追求幻想中的AGI,不如脚踏实地构建“高效、协同、安全”的人工智能系统生态。
我们可以从三个维度合理限制人工智能的“通用性”。一是限制模型的功能边界,明确任务域与能力域,降低越界操作的风险;二是限制模型的泛化范围,注重数据分布外的表现与误差分析,避免跨领域泛化时误导性高风险;三是限制模型的资源开销,以高性价比为导向,合理选择通用架构。
更平衡的AI发展策略是“数据中心AGI+专用AI”双轨并行发展模式
主张拼命发展LLM-AGI的一个理由是,专业性小模型都是由通用大语言模型蒸馏出来的,大语言模型规模越大,通用性就越强,蒸馏出来的专业模型的性能就越高。这种看法不完全正确。从信息论和表示学习角度来看,模型规模 ∝ 内部表征容量 ∝ 可蒸馏知识的上限。也就是说:大模型通过更宽的上下文窗口、更深层参数空间,能学到更丰富的跨任务语义结构。蒸馏时学生模型能在教师模型的分布平滑概率中获得更丰富的“暗知识”。因此理论上讲:扩大教师模型的规模会提升蒸馏性能的上限,教师模型越强,学生模型在相同规模下性能越好。但现实的表现并非教师模型“越大越好”,存在明显的边际递减规律。通用大模型的参数从数十亿扩大到数千亿,确实能捕获更丰富的语言模式与世界知识,但参数从千亿扩展到万亿,性能提升开始趋缓,超过万亿参数以后,已无法再有效蒸馏。教师知识过于稠密,学生模型的容量已不足以表达。当教师的暗知识分布超出学生的函数空间可表达范围,学生只能近似捕获浅层模式,无法吸收深层的推理能力。
AGI不会凭空到来,而是要从一个个垂直领域的突破逐步积累。每一个“专用AI”的成功落地,都会推动方法、算力、数据和生态的积累,最终才可能收敛到更强的通用智能。“通用→专用→更高层次通用”的螺旋上升规律同样适用于AI。专用AI的成功为AGI提供了数据、算力与算法基础;而AGI的突破又将催生新一代专用系统,使其更智能、更高效。因此,从实际部署与效益来看,多模态通用模型作为平台 + 专用微调模型作为接口,可能是更合理的形态。将来,绝大多数行业与应用不会部署自己的AGI,而是调用数据中心AGI + 各自的专用AI组件。未来90%的应用依然是专用AI,不是AGI。每个设备像“一个器官”,连接到“云端AGI的中枢神经系统”。AGI是一个“中心智能体”,不是一万个分身。
通用灵活的AI操作系统(AI-OS)是实现AGI的前提
AGI要真正发挥作用,还必须构建通用、灵活的AI操作系统(AI-OS)。 GPT-5之类 的大模型是“强预测引擎”,不会主动执行任务,不会保存或组织长期记忆、不具备长期目标,无法与其他模型协作、无法管理权限和风险、无法像人类智能那样在现实世界中持续运作。AI-OS正是用来补齐这些能力的基础设施层。AI-OS是分布在每个设备上的“身体接口”,处理 I/O、权限、工具调用、局部推理,实现云AGI的调用与协作。因此,没有AI-OS,就无法承载真正的AGI。AI-OS可提供感知、执行、记忆、资源管理、安全边界与多智能体协作能力,是智能系统赖以存在与运转的保证体系。
AGI是一个宏伟的目标,不是单一技术,AGI的真正实现是人类进入智能时代的标志。目前人类社会处在向智能时代过渡的转折期,有许多艰巨的任务需要我们完成。建更多的智算中心和发电站只是走向AGI的可能道路之一,未必保证成功,还需要探索其他的道路。但有一点可以肯定,不管将来AGI走那一条技术道路,AI-OS和AI原生网络等智能基础设施必须先行。
注:
1 以下引用是对各位学者学术观点的归纳,不一定是学者发表文章的原话
2 表中引用的观点是精简归纳,不一定是每位学者的原话。
李国杰
CCF名誉理事长、会士,CCCF前主编。中国工程院院士,中国科学院计算技术研究所研究员。主要研究方向为计算机体系结构、并行算法、人工智能、计算机网络、信息技术发展战略。lig@ict.ac.cn
更多阅读
点击“阅读原文”,加入CCF。
