现在订阅CCCF12期纸质刊,随刊赠送CCCF20周年纪念帆布包一只,数量有限,赠完即止。
本期专题依托第41期CCF秀湖会议,邀请了与会的6位青年学者围绕“数据智能”主题,从不同角度、不同维度、不同路径撰写了专题文章,涵盖数据智能的理论分析、技术分解、历史回顾和未来展望,以期对推动我国人工智能的发展起到前瞻引领作用。
从文本编译到多智能体交互,从代码生成到数学推理,大模型在越来越多的任务上展现出超人类预期的能力,推动着现代人工智能技术革命性的突破。总的来说,大模型建立在3个底层框架之上:系统架构的图灵计算体系,下个词元的概率预测模式,以微积分、线性代数和统计推断为基础的机器学习算法。那么智能来自哪?它的边界又在哪?
数据孕育智能。数据在算法编程中压缩,信息在权重计算中凝结,价值在环境交互中对齐。神经网络编码智能,统计推断解码智能,模型训练演化智能。现代人工智能面对3个基础性的问题。第一,什么样的架构能够赋予数据表示、处理、聚合的运行途径?第二,什么样的范式能够赋予机器与外部世界对齐的方式?第三,什么样的准则能够定义算法学习能力和效率的含义?深度学习和强化学习分别为第1个和第2个问题提供了成功的答案,并驱动了人工智能预训练和后训练技术的突破性发展。而概率论、信息论、统计决策论、博弈论、控制论、系统论等为回答第3个问题提供了基础工具。
人工智能正成为经济发展的重要引擎和国家安全的基石。基于这一背景与国家战略需求,中国计算机学会秀湖会议组织了“数据智能的能与不能:理论上限与应用边界、模型系统与人机协同”专题研讨,本期专题以此为契机,邀请了与会的6位我国计算机科学、应用数学和统计学等领域的优秀青年学者从不同角度、不同维度、不同路径撰写了专题文章。本期专题内容涵盖了数据智能的理论分析、技术分解、历史回顾和未来展望,文章观点新颖、富有深刻洞见,将对推动我国人工智能的发展起到前瞻引领作用。
上海财经大学教授、青年理论计算机科学专家陆品燕指出大模型可视为函数逼近器、概率采样机、信息压缩器和通用图灵机“四位一体”的对象,提出了大模型机理研究应构建分别对应定理证明、实验定律、结构解剖和行为分析的数学、物理学、生物学和心理学连续方法论谱系。清华大学教授、青年理论计算机科学专家李建从计算复杂性、信息论和统计学习3个视角系统阐述了大模型的理论边界,提出大模型能力边界应被理解为计算可表达性、信息可压缩性与统计可学习性共同作用的结晶。
西安交通大学教授、青年应用数学家孟德宇团队从深度学习工程先行但理论滞后的困境出发,梳理了从统计学习、深度学习到大模型时代的理论演进;围绕大模型能力上限、可靠边界、架构机理等关键科学问题,提出融合数据、架构和算法三要素的新一代机器学习数理体系的研究方向。清华大学副教授、青年统计学家李赛从系统论的视角定位大模型为人机协同控制系统,提出在生成模块之上利用基于统计学习的后处理技术构建一个控制层,把系统建模为一个由生成与控制两部分组成的可控且可部署的范式。
南京大学教授、青年人工智能专家俞扬及其团队总结了解决深度神经网络存在的灾难性遗忘问题的传统持续学习方法,以及大模型时代基于预训练模型的持续学习技术跃迁;提出了大模型持续学习面临的关键挑战和基于学件范式的应对洞见。中国人民大学教授、青年人工智能专家赵鑫梳理了大模型能力扩展的技术演进图,从预训练阶段的规模法则,到后训练阶段的强化学习和环境交互,再到应用阶段的推理时计算、经验与工具整合和多智能体协同;指出须在架构创新、效率优化与环境设计等方向寻求新突破。
著名统计学家和机器学习主要奠基人利奥·布雷曼(Leo Breiman)在2001年提出了2种建模文化的观点。一种是数据建模,强调数据的随机生成机制;另一种是算法建模,强调如何从数据中设计一个性能良好的预测算法。前者代表了传统统计学的推断思维,后者则代表机器学习的算法思维。而在20年后,著名统计学家布拉德利·埃弗龙(Bradley Efron)再次反思了统计学和机器学习的关系。而现代人工智能正是源于这2种文化深度融合的数据科学文化。
计算机视觉的奠基者戴维·马尔(David Marr)早在20世纪80年代就把视觉系统视为一个信息处理系统,提出了理解该系统的3个不同层次:第1个层次是物理和执行,第2个层次是算法和表示,第3个层次是计算。他的合作者托马索·波吉奥(Tomaso A. Poggio)认为在计算层次上面应该再加上一个学习层次。Marr关于视觉系统的三层次思想同样适用于人工智能,我们同样可以把人工智能理解为模拟人类行为和思维的信息处理系统。
回溯20世纪统计学的两位主要奠基者罗纳德·费希尔(Ronald A. Fisher)和耶日·奈曼(Jerzy Neyman)关于归纳推断和归纳行为的辩论——费希尔?奈曼论战(The Fisher-Neyman Controversy):Fisher相信概率理论可以具有从样本到数据的归纳推理能力,即外推性;而Neyman则认为只能从数据中进行演绎推断,即内插性。该辩论与当今大模型是否存在智能涌现的讨论相吻合,Fisher和Neyman辩论的本质可能源于他们对贝叶斯方法和频率论的看法不同,拥有贝叶斯学派和频率学派双重属性的机器学习方法正引领生成式人工智能的发展。
现代人工智能技术正像当初计算机科学技术一样,在深刻地改变科学、教育、社会的发展。我们研发人工智能技术不仅是寻找通向智能的路径和了解智能的边界,更是为了服务民生福祉和国家安全。人工智能是自然世界的数字模拟。我们从感知、认知和理解自然世界中发现知识、创造思想,我们必将仍然发现知识、创造思想。
张志华
北京大学教授。主要研究方向为机器学 习、人工智能、统计学和应用数学。
zhzhang@math.pku.edu.cn
本文发表于2026年第8期《计算》。
相关阅读
点击“阅读原文”,加入CCF。
