首页 > 最新动态 > 电脑新传(1):大模型 | CCCF精选
最新动态
电脑新传(1):大模型 | CCCF精选
2026-10-066




大模型经历了20多年的发明和优化历程。2000年约书亚·本吉奥率先采用词向量和自回归路线训练语言模型,2014年提出自注意机制,2017年底谷歌发明只需要注意机制的Transformer神经网络架构,2018年OpenAI训练出大语言模型GPT,实现了智能涌现,引爆智能革命。


模型


模型的含义广泛,如日常的车模、航模、产品原型、数学模型、经济模型等,都是对事物或现象的精炼表示。其中,以“自然哲学数学原理”为代表的数理模型,被奉为人类智慧的圭臬。数理模型以简洁为美,根本理念是还原论,即希望用较少的参数来刻画复杂现象背后的规律:万有引力定律适用于宏观世界,基本粒子标准模型则适合微观领域。但是,复杂的世界最终能否精简为数理模型?就现实情况来看,数理模型还不够完善,例如万有引力定律描述了两体相互作用,但无法预测三体相互作用下的复杂运动过程。

智能面对的就是这样一个多体相互作用并不断演化发展的复杂世界。人类是生命进化的最高智能物种。作为智能中枢的人类大脑,是由大量神经元相互连接形成的大规模复杂网络,神经元连接点(突触)的数量刻画了这个复杂网络的规模。大模型基于人工神经网络,由采用人类语言及其他模态的海量数据训练而成,其智能水平随着网络规模和训练数据增长而不断涌现,未来也会通过传感器直连客观世界实时训练。

与数理模型相反,大模型与人类大脑类似,遵循生成论的基本逻辑。它承认自然、生命、智能、社会和生态系统会演化得越来越复杂,因此,若要获得更加准确的表达,则需要使模型规模越来越大。大模型以大为美,它既蕴含简洁优美的数理模型,也能表达数理模型无法表达的情感等复杂现象。大模型最终能否简化为数理模型?我认为不能,因为这与它蕴含无穷、演生万物的本性背道而驰。

符号


1956年人工智能的概念被提出,符号主义率先登场,基本思想是用算法描述智能,这确实符合人工智能的字面含义,也是很多人想象中的人工智能。但实践表明,符号主义并未达到预期效果。1980年美国学者约翰·塞尔(John Searle)提出“中文房间”(Chinese Room)的思想实验,认为计算机虽然可以模仿人类心理过程,但它只是形式上的,并不真正理解符号的含义,因此从根本上讲计算机没有智能。1990年斯蒂文·哈纳德(Stevan Harnad)正式提出“符号接地问题”(The Symbol Grounding Problem),即符号如何获得意义。

人类获得符号意义的方式总体而言有2种。一种是直接体验,例如:“红”(red)是特定频谱的光刺激视觉感受器的结果,“苹果”(apple)是一种可观可食的水果,“北京”是一座可以深入体验的城市。符号是对体验对象共识的名签。第二种来自符号之间的关系。1954年,语言学家泽立格·哈里斯(Zellig Harris)提出分布假说:上下文相似的词,其语义也相似。1957年,约翰·鲁珀特·弗斯(John Rupert Firth)进一步总结得出:词的语义由其上下文确定。异曲同工的是,卡尔·马克思(Karl Marx)早在19世纪中叶就提出过:人的本质不是单个人所固有的抽象物,在其现实性上,它是一切社会关系的总和。在数学领域,塞缪尔·艾伦伯格(Samuel Eilenberg)和桑德斯·麦克莱恩(Saunders Mac Lane)在1945年共同创立范畴论,这一理论聚焦各类数学结构,以及不同结构之间的映射关系,其核心思想可概括为“一个对象完全由它与其他对象的关系来定义”。因此,词的含义可以从大量上下文关系即语境中学习到。

最近的认知实验表明,承载概念关联与逻辑关系的内在语义认知图谱,是人类生产发明创造的绝对前提;一旦失去语义指引,人类创新行为就会沦为盲目随机试错,即使能够接入社会学习网络,表现也不及未经校准的机器。

词向量


1992年第14届国际计算语言学会议(COLING)上,卫真道(Jonathan J. Webster)与揭春雨(Chunyu Kit)提出:词元(token)切分是自然语言处理的初始阶段。这里的词元可以是单词、词组或词根,也可以是标点符号或人工定义的标记。之后,词义问题就归结为词元的意义问题。

采用向量方式表示词元,最早可追溯至独热(one-hot)编码。假定一种语言的词元数量为N,把词元按照一定规则(如词典序)编号,则第i个词元的独热编码是长度为N的二进制数,其中第i位为1,其余各位都是0。这意味着构造了一个N维数学空间,第i个词元位于第i条坐标轴、距离原点单位长度的位置。各词元相互正交,也就是说它们相互独立、互不关联。

根据语义的上下文语境学说,词义不可能完全独立,而是相关的,因此语义空间维度应小于词汇总数N。假如语义空间维度为m,m<<N,则每个词元均可对应该m维空间内的一个坐标点,即一条m维向量,称作词向量,亦称作词嵌入(word embedding,描述空间映射关系的数学概念)。通过将离散的词元映射到m维的连续语义空间中,词元之间的语义分析便可以通过词向量计算来进行。

为了计算出词向量,2000年的神经信息处理系统会议(NIPS)上,约书亚·本吉奥(Yoshua Bengio)提出了神经概率语言模型(2003年发表为期刊论文),通过“预测下一个词元”(next token prediction,NTP)的自回归技术路线来训练神经网络:把自然语言序列中前n–1个词向量连接起来作为输入,把第n个词向量作为输出,采用反向传播算法,同时训练神经网络参数和词向量。这种方法巧妙地把自然语言转换为训练所需的“样本–标签”对,省去了人类标注的步骤,可以充分利用已有的海量文本数据。实验用词表规模约1.6万,词向量维度设置为60,网络参数量达百万级。采用百万和千万词规模语料训练出的模型,其续写困惑度(对应模型预测能力)优于传统非神经网络方法。

2013年,谷歌团队开源词到向量(Word2Vec)算法工具包。词表大小超过10万,向量维度达数百,训练语料达百亿词汇量级。计算当前词向量最简单的算法就是用上下文词向量求和再取平均值。通过迭代计算,得到词对(例如英语基数词one, two, …, five和西班牙语基数词uno, dos, …, cinco)在2种语言语义空间中的分布,发现两者的分布相似性极高,这说明词向量确实捕捉到了词的含义。通过此方法,研究人员发现传统双语词典中有约15%的词可以优化改进。

注意力


词义的向量计算取得突破后,人们很快尝试将其用于机器翻译。每种语言都训练一对编码器和解码器,编码器把源语句转换成语义向量,解码器再把语义向量翻译为目标语句。初期使用的循环神经网络(recurrent neural network, RNN)或长短时记忆网络(long short term memory, LSTM)方法,取得了一定效果,但是难以表达超越一维词序的语义关系。

为了刻画词之间复杂的多维语义关系,2014年迪米特里·巴赫达努(Dzmitry Bahdanau)和约书亚·本吉奥等提出,在解码器中为每个词元增加一个表达上下文的向量,用以表征不同词对当前词元的影响。该向量的计算方法为对上下文词向量加权求和,其中权重用于量化各上下文词语对当前词元的影响程度,这一机制即为注意力(attention)机制。2017年4月,本吉奥团队又在国际学习表征会议(ICLR)的参会论文中提出语句内部的自注意力(self-attention)机制,用权重矩阵表达语句中各词之间的语义关系,并把权重矩阵和神经网络参数一起训练。在同年12月的NIPS会议上,谷歌发文提出:注意力机制就足够了,没必要使用RNN或LSTM,并设计了以自注意机制为核心的变换器(Transformer)神经网络。Transformer由多层语义计算模块堆叠而成,每个模块主要包括2部分:自注意力机制计算和全连接神经网络。

自注意力机制计算的目的是借助上下文词元对目标词分配注意力权重,更新该词的原始向量,输出融合上下文语义信息的词向量。计算方法就是著名的自注意力机制核心公式:

这个公式的核心是词与词之间的注意力关系是可以训练的,具体表达为3个权重矩阵:查询矩阵Wq、索引矩阵Wk和值矩阵Wv。

查询矩阵Wq和索引矩阵Wk尺寸相同,列数都等于词向量长度(dk),行数并无规定。实践中采用的多头注意力机制中,头数和行数相乘等于dk。查询矩阵Wq乘以当前词向量得到查询向量Q,是当前词向上下文所有词伸出的“主动合作之手”;索引矩阵Wk和上下文各词向量分别相乘,得到各自的索引向量K,可视为各上下文词的“等待合作之手”;Q和K相乘,即当前词元伸出的“主动合作之手”与上下文各词元的“等待合作之手”一一相握(点乘),得到一系列标量值(个数等于上下文长度),代表当前词元和各上下文词元之间的注意度;这些注意度采用softmax函数归一化(Transformer先除以dk的平方根进行缩放),得到概率形式的上下文所有词对当前词的影响度。

值矩阵Wv和词向量相乘得到值向量V。Wv的尺寸可以选择dk×dk,但规模过大。典型做法是采用互为转置的2个矩阵,其中1个矩阵尺寸与Wq相同。上下文所有词的值向量V通过前述注意影响度加权求和,再与当前词向量相加,得到上下文词向量。

接下来将自注意力机制计算输出的上下文词向量送入经典的全连接神经网络,进行抽象综合。全连接神经网络有3层,输入层和输出层均为词向量,中间层宽度为词向量的数倍(典型选4倍),这样的总参数量就是注意力权重矩阵总参数量的2倍,可承载更多语义记忆任务。

提出Transformer的最初目的是解决机器翻译任务,因此Transformer由编码器和解码器2部分组成,并采用双语语料训练,以潜在语义空间为桥梁。它在2014年机器翻译研讨会(WMT 2014)英德机器翻译任务上取得了最佳性能。在提出Transformer的原始论文中,编码器和解码器都由6层语义计算模块堆叠而成,后来发展到上百层乃至更深。

大语言模型


虽然Transformer是为机器翻译而设计的,它的语义表征能力却有普适性,对这一点,OpenAI比谷歌看得更透彻。在提出Transformer的论文发表后半年,OpenAI就采用Transformer训练出了生成式预训练语言模型(generative pre-training language model,GPT),并于2018年6月发布。它的网络规模达1.1亿,智能却并不明显。2019年,GPT-2发布,网络架构和训练方法不变,智能水平明显提升。

从技术角度看,可以说OpenAI没有创新:Transformer来自谷歌;自注意力机制是本吉奥提出的;OpenAI宣传的“预测下一个词元”,只是18年前本吉奥“用前n–1个词预测第n个词”的翻版,GPT技术上用的都是别人的方法。

换个角度来看,也可以说OpenAI洞见深刻:谷歌提出Transformer是为了机器翻译,所训练的基于Transformer的双向编码器表征(bidirectional encoder representations from Transformers, BERT)模型使用双向预测(本吉奥2014年发表的关于注意力机制的论文也是采用双向循环神经网络)。GPT的不同之处在于只用半个Transformer(解码器部分),坚持“预测下一个词元”单向预测,训练出浓缩了海量语料、丰富语义的通用模型,能够支持多种下游应用,开启了通用人工智能的大门。

在网络架构和训练方法不变的情况下,GPT-2的智能水平明显高于GPT-1,这个现象引起了约翰斯·霍普金斯大学杰瑞德·卡普兰(Jared Kaplan)和萨姆·麦坎德利什(Sam McCandlish)的关注,他们联合OpenAI开展系统性研究,于2020年1月发表论文“Scaling Laws for Neural Language Models”(神经语言模型的规模定律),发现模型性能提升和网络结构(深度、宽度、注意力头数、前向传播网络维度)几乎无关(相关性小于3%),和网络规模N(不含词向量的网络参数量)、训练用的数据规模D以及算力C中的任何一个(其他2个不构成限制瓶颈情况下)都存在明显的幂律关系。如果算力不限,网络规模提升8倍,数据规模只要提升5倍,就能稳定提升模型性能,即N和D的合理比例是D∝N0.74,即符合指数为0.74的幂律(两年后,DeepMind发文纠正,固定算力下,参数量N和训练词元数D应当等比例缩放,经验配比是1∶20)。

这篇论文还首次使用了“Large Language Model”(大语言模型)这个词。4个月后,GPT-3发布,它的网络规模提升百倍,参数量达到1750亿,确如规模定律所预测,GPT-3涌现出明显的通用智能。文献“Language Models Are Few-Shot Learners”的结尾预测:超大语言模型(very large language models)可能是开发自适应、通用型语言系统的重要一环。事实表明,GPT-3的确引爆了大语言模型革命,所采用的“预测下一个词元”路线,开辟了生成式人工智能方向。

大语言模型的智能来自语言数据。据统计,全球图书累计1.7亿种,对应词元总量170万亿(trillion, T);学术论文1.8亿篇,对应词元1.1T;网页2700亿页(索引),对应词元3100T;其他文本词元总量约200T~500T;所有公开文本合计约3500T词元。其中适合训练大语言模型的高质量干净文本占5%~15%,即200T~500T。

与自然语言相比,计算机代码逻辑更为严谨,对大语言模型性能提升意义更大。据统计,计算机代码总量10万亿~30万亿行,每行代码平均包含2个词元,对应词元数总体为20T~60T。据估计,2026年Anthropic最新大语言模型Claude训练使用了12T词元,其中代码为4.2T行,性能超越了OpenAI的GPT。

计算机代码是理性符号,自然语言也是。言者把情感转换为语言符号,听者把符号转换为情感共鸣,情感只存在于双方,而不在理性符号。大语言模型用高维向量表达词义,仍属于理性范畴,还须向感性演进。

大模型


2018年11月,GPT-1发布半年后,北京智源人工智能研究院(简称智源研究院)成立,汇集了上百位智源学者研讨人工智能发展方向。2020年5月,GPT-3发布,迅速成为关注焦点。经过数轮讨论,2020年10月,智源研究院做出“集中力量办大事”的决定,迅速召集了上百位技术人员,主攻大模型方向。

由于GPT-3的大语言模型已经珠玉在前,智源研究院决定转攻视觉和其他模态。研究人员兵分四路,同时探索中文模型、多模态模型、认知模型与蛋白质模型,依次由刘知远、文继荣与唐杰(后两项)牵头带领团队攻关,并按《四库全书》的4座藏书楼分别将各团队命名为文源、文澜、文汇与文溯,整体命名为悟道团队。

为了攻克大模型难关,悟道团队全力出击。2020年12月,文源团队发布了全球首个中文开源模型CPM,参数量达26亿;2021年1月,文澜团队发布百亿参数文图模型;2021年3月,文汇百亿参数中英双语大模型GLM-10B与多模态模型CogView 1.0的训练完成。此时,4个模型合体,悟道1.0发布。

悟道1.0包括多种模态,超出了语言范畴,如何统一命名呢?笔者时任智源研究院院长,在发布会上创造了“大模型”这个词,提出“人工智能发展已经从‘大炼模型’转入‘炼大模型’的新阶段”,“大模型”一词从此登上历史舞台。

3个月后,2021年智源大会推出悟道2.0,包括文澜团队的50亿参数图文检索大模型BriVL 2.0(当时全球参数量最大、训练数据最多的多模态模型),文源团队的2个百亿参数模型(110亿参数的中文模型和110亿参数的中英双语模型)与1个千亿模型(1980亿参数的中英双语混合专家模型),文汇团队的全球最大的1.75万亿参数的GLM-1750B模型。中国的大模型从此全球瞩目。

“大模型”这一概念在中文世界里广泛传播,成为涵盖语言、视觉、多模态等各类大模型的通称。但在英文世界里,并无对应的“large model”概念。2021年8月,斯坦福大学发布综合报告“On the Opportunities and Risks of Foundation Models”(论基础模型的机遇与风险),建议用“foundation models”(基础模型)一词对应“大模型”概念。2022年11月ChatGPT爆火,large language model(大语言模型)的缩写LLM开始广泛传播,后来LVM(large vision model,大视觉模型)和LMM(large multimodal model,大多模态模型)这些缩写相继流行,但仍很少使用“large model”来表述“大模型”。确须统称时,会使用“large AI models”,完全不像中文世界中用“大模型”一词一统江湖。

多模态大模型


英文世界里未出现统一表示“大模型”的词汇,重要原因是研究人员对技术路线的认知差异。

GPT语言大模型“预测下一个词元”的自回归路线是只适合语言,还是能够统一所有数据模态?如果是前者,英文中将LLM、LVM和LMM分开命名是合理的,因为不同模型采用了不同技术路线;如果是后者,那么中文世界中“大模型”这一命名更合理。

OpenAI最先把自回归路线推广到图像领域,在2021年1月发布文生图模型DALL-E,模型规模达120亿,训练使用了2.5亿个图像–文本对,采用离散变分自编码器(discrete variational autoencoder, dVAE)把图像局部卷积特征矢量量化为32×32个词元,文本转化后不超过256个词元,2类词元拼接在一起,采用GPT自回归方式联合训练文、图、词元间的注意力关系。DALL-E能够根据文本描述生成图像,同期智源研究院的悟道·文汇CogView模型采用类似路线,也实现了类似功能。

除自回归路线外,在2021和2022年,多模态模型分化出多种路线。重大转折发生在2022年8月,潜在扩散图像生成大模型Stable Diffusion在传统深度神经网络U-Net基础上,采用扩散模型模仿物理扩散过程,先在数据中不断增加噪声并迫使神经网络掌握背后的规律,再通过受控条件一步步去噪,重建高逼真图像视频。OpenAI的DALL-E2改弦易张,先把文图在隐空间对齐,再使用扩散模型进行图像生成,显著提升了视觉效果;DALL-E3则采用纯Transformer架构,用大语言模型把提示词转换成详细视觉描述,再用扩散模型生成图;而Sora把DALL-E3的二维图像块升级为三维时空块,实现了高质量视频生成。另外,Midjourney、Vidu等视觉生成模型纷纷涌现,扩散模型一跃成为图像视频生成主导路线。

智源研究院的研究人员坚持认为GPT自回归路线具有通用性,符合“大道至简”哲学理念,也符合“物有本末,事有终始,知所先后,则近道矣”的大学之道。但这只是信念,正确与否只能靠实践证明。

智源研究院研究团队坚持仅采用自回归路线,将图像、文本和视频统一离散化到同一个表示空间中,在混合数据上联合训练单一Transformer、EMU系列通用多模态大模型。2024年发布的EMU3模型,不仅文生图效果达到扩散模型水平,而且视觉理解水平可同时比肩融合图文对比预训练模型(contrastive language-image pre-training, CLIP)和大语言模型的主流方案,还能实现因果视频生成与延展,展现出对物理世界中环境、人类与运动行为的初步模拟。EMU3模型参数量和训练数据量呈现了稳定的幂律缩放关系,且在文生图、图文理解、文生视频三大任务上均成立。所有任务数据缩放指数β=0.55,文生图/图文理解模型缩放指数α=0.25,文生视频模型缩放指数α=0.35。

2025年,智源研究院发布EMU3.5,进一步通过大规模长时序视频训练,学习时空与因果关系,观察到随着模型规模扩展,物理建模能力不断提升的现象,并自然将其扩展到机器人操作新任务。2026年2月,叙述EMU技术路线论文登上Nature,证明自回归路线可以作为生成式人工智能统一路线。

回到大模型的“大”,它不仅仅是指神经网络规模参数量大,更重要的是指模型具有了智能涌现特性,这是生成式人工智能的核心。生成式人工智能的“生成”,也不单指“生成”高质量的文本内容、图像或视频,更重要的是指先要“理解”数据的结构和含义,从而得到“演生万物”的潜力。扩散模型只是增强“生成”效果,并不解决更基本的“理解”问题,因此只是大模型生成技术的辅助。EMU技术路线的实践进一步证明,自回归路线才是统一理解和生成、目前唯一通过实践验证的通用人工智能技术路线。

智能


大模型是技术创新的最新进展。与科学发现不同,技术发明往往是不断优化改进的过程。从2000年本吉奥团队提出基本方法,到2017年底谷歌发明Transformer,再到2018年5月OpenAI训练出GPT-1,这些主要发明者当时都没意识到新发明的强大威力,这正是技术发明的常态。

大模型涌现出越来越强的智能,这也是技术的常态。很多人质疑大模型智能的真实性,这与质疑指南针指南、飞机会飞类似。每当大模型在参加面向人类的考试中获得高分时,批评者就会指责答案肯定已经在模型的训练数据里。其实即使只是根据浩如烟海的数据就能快速地给出正确答案,何尝不是智能?批评者还指责大模型存在幻觉,却把自己头脑中的天马行空称为猜想、学说或想象力,其实两者都是真正智能的必然表现——没有幻觉,就没有真正的智能。

幻觉也好,想象也罢,总是可以和已知进行对比验证。超出已知的,可以通过形式化验证证实或证伪;无法验证的,作为新可能继续探索,这就是智能的发展过程。

当然,我们希望大模型能够解决人类无法解决的重大数学问题,或者能涌现出类似万有引力定律、相对论级别的新发现,我认为这是可能的,而且很快。但归根结底,这只能靠技术发展来回答。这正是:

符号意何生?高维算语境;词义向量加,注意矩阵乘。

预测自回归,变换塔玲珑;规模藏幂律,涌现大模型。

悟道通幽径,悟界贯微宏;众智擎天地,悟空越鸿蒙。

黄铁军

CCF会士。北京大学教授,北京智源人工智能研究院理事长。主要研究方向为视觉信息处理与类脑智能。tjhuang@pku.edu.cn

本文发表于2026年第9期《计算》。

现在订阅CCCF12期纸质刊,随刊赠送CCCF20周年纪念帆布包一只,数量有限,赠完即止。





图片


图片


点击“阅读原文”,加入CCF。

点我访问原文链接