CNCC2026将于10月21-24日在成都举办。今年将继续推出Tutorial,本篇介绍的Tutorial是——大规模强化学习:从理论基础到大模型与具身智能应用
Tutorial是由领域内专家主讲,面向全体参会者开放的专题讲座或教学环节,旨在介绍研究领域的最新进展或基础知识,内容涵盖原理、挑战、方法等。可以帮助刚进入该方向的博士生、青年学者快速补齐知识短板,以便更好地参会后续的前沿报告理解与未来方向思辨。
今年Tutorial共设置11大主题板块:AI基础模型、机器学习理论与机理、强化学习与推理、视觉多模态与世界模型、AI安全与治理、数据科学与数据空间、机器人与具身智能、Agent智能体、新型计算与网络架构、AI4Science、AI+行业。
(扫码报名)
模块 | 时长 | 内容 |
1. Introduction | 30min | Overview of the role of RL in modem AI research and application, and the content of this tutorial. |
2. RL Basics and Frontiers | 60min | Basic RL concepts, (MDP, GPI, Function Approximation), typical RL algorithms (DQN, PPO), frontier RL challenges (Plasticity, scalability, etc). |
3. RL for LLM Agents | 60min | Key RL techniques for LLM RL (RLHF, RL post-training, OPD), and LLM agent applications. |
4. RL for Embodied Intelligence | 60min | RL training for embodied foundation model, RL for VLA/WAM, Sim2real policy learning for robot locomotion. |
5. Q&A and Discussion | 30min | Interactive discussion and future directions. |
Tutorial简介
本Tutorial梳理RL从经典算法到前沿应用的发展脉络。内容涵盖三部分:(1)理论基础,包括MDP、GPI、策略与值函数拟合、PPO算法等经典内容,以及可塑性、可拓展性等前沿问题;(2)大模型强化学习,聚焦RLHF、后训练RL优化、OPD等核心技术;(3)具身智能强化学习,探讨具身基模能力RL训练、在线RL、仿真到现实RL等关键问题。
Tutorial目标
参与者将能够:
掌握强化学习的基本原理
掌握强化学习的基本概念与主要强化学习算法(如PPO),了解强化学习理论研究的前沿挑战。
掌握强化学习驱动的大模型训练与应用挑战
掌握强化学习在大模型训练中的作用与应用方式,了解代表性强化学习驱动的大模型智能体应用,了解大模型强化学习面临的挑战。
具备具身智能强化学习关键技术与多场景应用的实践能力
掌握具身智能中的关键强化学习技术,了解强化学习在具身基模训练、导航与操控、整身控制等问题中的不同角色,了解具身智能中强化学习研究的难点。
讲者介绍
天津大学教授
博士,天津大学软件学院教授,国家优青。主要研究方向为强化学习、具身智能和多智能体系统。在Nature Communications和ICML/NeurIPS/ICLR等人工智能领域CCF-A类国际会议发表论文100余篇,专著3部。团队研究成果获国际会议最佳论文奖4次,NeurIPS大会竞赛冠军4次,中国图像图形学学会科技进步一等奖(第一完成人)、中国电子学会自然科学一等奖(第二完成人)等。先后担任华为决策与推理实验室主任、大模型算法实验室主任、华为医疗军团副总裁,负责华为公司决策和推理领域技术创新和产业落地,将强化学习技术在华为公司网络通讯、终端、芯片、自动驾驶、供应链等产品线广泛落地,以及在大模型后训练和各agent行业创新应用,并从0到1孵化了华为公司AI+EDA、具身智能、大模型agent等多个重要产业项目和创新方向。
天津大学副研究员
博士,天津大学智能与计算学部副研究员。2023年博士毕业于天津大学智能与计算学部,2023年至2024年于Mila研究所/蒙特利尔大学担任博士后研究员。主要研究方向为强化学习、具身智能以及大模型智能体,发表NeurIPS、ICML、ICLR、TNNLS、TEVC等人工智能领域国际顶级会议和期刊论文30 余篇,曾获中国图象图形学学会科技进步奖一等奖。相关研究成果在游戏AI、药物发现、电子设计自动化、机器人等多个领域落地应用。
中国科学院微电子研究所AI中心副主任、研究员
中国科学院微电子研究所研究员、博士生导师、AI中心副主任。研究方向涵盖大语言模型、强化学习、智能体系统及AI芯片架构。提出ARPO(Agentic Reinforced Policy Optimization)和TPTU(Task Planning and Tool Usage)等大模型智能体训练新范式,有效提升智能体复杂推理和工具调用能力。主持多项国家级及省部级项目,累计获批经费超1亿元。本人和团队曾获全球数字经济大会大模型场景应用典型案例、国际人工智能会议NeurIPS强化学习竞赛冠军、中国计算机学会多智能体研究优博奖。曾于多家头部科技企业担任研发团队负责人,主导的智能体产品实现用户与月活均突破千万,达成规模化落地。他始终致力于打通“应用-算法-系统-芯片”的软硬协同全链路,推动AI智能体在真实场景中创造价值。
中国电信人工智能研究院具身智能研究中心主任、研究员
博士,中国电信人工智能研究院(TeleAI)研究科学家、具身智能研究中心主任。入选第十届中国科协青年“托举”人才,上海市青年科技英才“扬帆计划”,上海市徐汇区“光启”青年人才。围绕具身大小脑展开研究,构建了跨本体适配模型、灵巧操作任务规划平台、和数据合成平台;开源首个开源机器人全身仿人运动控制框架、文本驱动的通用小脑、感控一体人形机器人等。学术成果方面,已发表高水平论文60余篇,撰写强化学习专著和国内首篇《大模型驱动的具身智能:发展与挑战》综述,下载量2万余次。承担国家自然科学基金、国家重点研发计划课题、上海市科委项目等项目。获世界人工智能大会优秀论文提名奖、ICCV-2025多地形人形机器人挑战赛冠军等,相关成果受到MIT Technology Review、CCTV等媒体报道。
欢迎参加CNCC2026
CNCC是一个宏观论述技术趋势的大会,具有规格高、规模大、内容丰富等特点,会议形式包括大会特邀报告、大会论坛、专题论坛、特色活动及展览。大会汇聚两院院士、国内外顶尖学者、知名企业家等亲临大会,展望前沿趋势,分享创新成果。ACM、IEEE CS、IPSJ、KIISE等国际计算机组织的代表也多次获邀现场参加这一盛会。CNCC2026将于10月21-24日在四川省成都市举办,大会主题是“数聚驱动,智算未来”,欢迎各界前来参会。
点击“阅读原文”,加入CCF。
