首页 > 最新动态 > 大规模强化学习:从理论基础到大模型与具身智能应用|CNCC Tutorial
最新动态
大规模强化学习:从理论基础到大模型与具身智能应用|CNCC Tutorial
2026-09-037


CNCC2026将于10月21-24日在成都举办。今年将继续推出Tutorial,本篇介绍的Tutorial是——大规模强化学习:从理论基础到大模型与具身智能应用




Tutorial是由领域内专家主讲,面向全体参会者开放的专题讲座或教学环节,旨在介绍研究领域的最新进展或基础知识,内容涵盖原理、挑战、方法等。可以帮助刚进入该方向的博士生、青年学者快速补齐知识短板,以便更好地参会后续的前沿报告理解与未来方向思辨。


今年Tutorial共设置11大主题板块:AI基础模型、机器学习理论与机理、强化学习与推理、视觉多模态与世界模型、AI安全与治理、数据科学与数据空间、机器人与具身智能、Agent智能体、新型计算与网络架构、AI4Science、AI+行业。

(扫码报名)

??Tutorial名称大规模强化学习:从理论基础到大模型与具身智能应用

??所属主题强化学习与推理

??日程安排:2026年10月21日下午

注:如有变动,请以官网(https://ccf.org.cn/CNCC2026)最终信息为准


模块

时长

内容

1. Introduction

30min

Overview of the role of RL in modem AI research and application, and the content of this tutorial.

2. RL Basics and Frontiers

60min

Basic RL concepts, (MDP, GPI, Function Approximation), typical RL algorithms (DQN, PPO), frontier RL challenges (Plasticity, scalability, etc).

3. RL for LLM Agents

60min

Key RL techniques for LLM RL (RLHF, RL post-training, OPD), and LLM agent applications.

4. RL for Embodied Intelligence

60min

RL training for embodied foundation model, RL for VLA/WAM, Sim2real policy learning for robot locomotion.

5. Q&A and Discussion

30min

Interactive discussion and future directions.


Tutorial简介

本Tutorial梳理RL从经典算法到前沿应用的发展脉络。内容涵盖三部分:(1)理论基础,包括MDP、GPI、策略与值函数拟合、PPO算法等经典内容,以及可塑性、可拓展性等前沿问题;(2)大模型强化学习,聚焦RLHF、后训练RL优化、OPD等核心技术;(3)具身智能强化学习,探讨具身基模能力RL训练、在线RL、仿真到现实RL等关键问题。


Tutorial目标

参与者将能够:

掌握强化学习的基本原理

掌握强化学习的基本概念与主要强化学习算法(如PPO),了解强化学习理论研究的前沿挑战。

掌握强化学习驱动的大模型训练与应用挑战

掌握强化学习在大模型训练中的作用与应用方式,了解代表性强化学习驱动的大模型智能体应用,了解大模型强化学习面临的挑战。

具备具身智能强化学习关键技术与多场景应用的实践能力

掌握具身智能中的关键强化学习技术,了解强化学习在具身基模训练、导航与操控、整身控制等问题中的不同角色,了解具身智能中强化学习研究的难点。


讲者介绍




郝建业



天津大学教授

博士,天津大学软件学院教授,国家优青。主要研究方向为强化学习、具身智能和多智能体系统。在Nature Communications和ICML/NeurIPS/ICLR等人工智能领域CCF-A类国际会议发表论文100余篇,专著3部。团队研究成果获国际会议最佳论文奖4次,NeurIPS大会竞赛冠军4次,中国图像图形学学会科技进步一等奖(第一完成人)、中国电子学会自然科学一等奖(第二完成人)等。先后担任华为决策与推理实验室主任、大模型算法实验室主任、华为医疗军团副总裁,负责华为公司决策和推理领域技术创新和产业落地,将强化学习技术在华为公司网络通讯、终端、芯片、自动驾驶、供应链等产品线广泛落地,以及在大模型后训练和各agent行业创新应用,并从0到1孵化了华为公司AI+EDA、具身智能、大模型agent等多个重要产业项目和创新方向。

汤宏垚



天津大学副研究员

博士,天津大学智能与计算学部副研究员。2023年博士毕业于天津大学智能与计算学部,2023年至2024年于Mila研究所/蒙特利尔大学担任博士后研究员。主要研究方向为强化学习、具身智能以及大模型智能体,发表NeurIPS、ICML、ICLR、TNNLS、TEVC等人工智能领域国际顶级会议和期刊论文30 余篇,曾获中国图象图形学学会科技进步奖一等奖。相关研究成果在游戏AI、药物发现、电子设计自动化、机器人等多个领域落地应用。

毛航宇



中国科学院微电子研究所AI中心副主任、研究员

中国科学院微电子研究所研究员、博士生导师、AI中心副主任。研究方向涵盖大语言模型、强化学习、智能体系统及AI芯片架构。提出ARPO(Agentic Reinforced Policy Optimization)和TPTU(Task Planning and Tool Usage)等大模型智能体训练新范式,有效提升智能体复杂推理和工具调用能力。主持多项国家级及省部级项目,累计获批经费超1亿元。本人和团队曾获全球数字经济大会大模型场景应用典型案例、国际人工智能会议NeurIPS强化学习竞赛冠军、中国计算机学会多智能体研究优博奖。曾于多家头部科技企业担任研发团队负责人,主导的智能体产品实现用户与月活均突破千万,达成规模化落地。他始终致力于打通“应用-算法-系统-芯片”的软硬协同全链路,推动AI智能体在真实场景中创造价值。

白辰甲



中国电信人工智能研究院具身智能研究中心主任、研究员

博士,中国电信人工智能研究院(TeleAI)研究科学家、具身智能研究中心主任。入选第十届中国科协青年“托举”人才,上海市青年科技英才“扬帆计划”,上海市徐汇区“光启”青年人才。围绕具身大小脑展开研究,构建了跨本体适配模型、灵巧操作任务规划平台、和数据合成平台;开源首个开源机器人全身仿人运动控制框架、文本驱动的通用小脑、感控一体人形机器人等。学术成果方面,已发表高水平论文60余篇,撰写强化学习专著和国内首篇《大模型驱动的具身智能:发展与挑战》综述,下载量2万余次。承担国家自然科学基金、国家重点研发计划课题、上海市科委项目等项目。获世界人工智能大会优秀论文提名奖、ICCV-2025多地形人形机器人挑战赛冠军等,相关成果受到MIT Technology Review、CCTV等媒体报道。



欢迎参加CNCC2026

CNCC是一个宏观论述技术趋势的大会,具有规格高、规模大、内容丰富等特点,会议形式包括大会特邀报告、大会论坛、专题论坛、特色活动及展览。大会汇聚两院院士、国内外顶尖学者、知名企业家等亲临大会,展望前沿趋势,分享创新成果。ACM、IEEE CS、IPSJ、KIISE等国际计算机组织的代表也多次获邀现场参加这一盛会。CNCC2026将于10月21-24日在四川省成都市举办,大会主题是“数聚驱动,智算未来”,欢迎各界前来参会。




图片


图片


点击“阅读原文”,加入CCF。

点我访问原文链接