聚焦国产AI编译基础设施,探讨AI驱动的编译范式变革与面向新硬件的敏捷框架。重点介绍基于MLIR的统一架构的Ascend NPU-IR的实践成果,推动编译系统向智能化、高效化、开放化演进。
论坛简介
编译系统作为连接软硬件的核心桥梁,正经历着AI技术带来的深刻变革。一方面,大语言模型开始渗透编译领域,从辅助生成优化序列到探索端到端的“AI即编译器”新范式;另一方面,AI工作负载的爆发式增长也倒逼编译系统重构,如何高效适配层出不穷的新硬件架构成为核心议题。同时国产异构算力平台的崛起,对编译栈的敏捷性与开放性提出了更高要求。
本论坛聚焦国产AI编译基础设施的建设与落地,深度解析基于MLIR多级抽象中间表示构建统一编译架构的关键路径。论坛将重磅分享Ascend NPU-IR项目的落地经验案例,实现AI应用在国产硬件上的高效迁移与极致性能释放。
本论坛旨在汇聚学术界与工业界的顶尖专家,围绕AI驱动下的编译技术范式变革、面向AI工作负载的编译优化方法、以及面向新硬件的敏捷编译框架等方向,共同推动编译系统向智能化、高效化、开放化的方向演进。
日程安排
顺序 | 主题 | 主讲嘉宾 | 单位 |
1 | AscendNPU-IR:开源编译底座,多语言无缝接入昇腾生态 | 海丽娟 | 华为 |
2 | 从因果决策、全局调度到智能内核生成的昇腾AI编译器全栈优化方法 | 赵捷 | 湖南大学 |
3 | 基于昇腾多核任务编排的通算融合算子生成 | 李诚 | 中国科学技术大学 |
4 | 智能体时代的AI 基础设施:优化的可验证性 | 尚笠 | 复旦大学 |
5 | AI编译优化:Triton-tle在国产平台上的适配优化 | 柴赟达 | 先进编译实验室 |
论坛主席:
华为编译器与编程语言实验室首席专家,CCF专业会员,ACM会员和IEEE高级会员。
现任华为技术有限公司编译器与编程语言实验室首席专家和科学家,主导华为编译器领域业务战略和技术规划,实现华为鲲鹏、昇腾、麒麟全系列自研芯片的编译器技术创新突破和产品化研发,支撑公司ICT和终端业务的竞争力持续领先。加入华为之前,先后在国防科大、清华大学、新加坡国立大学、日本东京大学和加拿大阿尔伯塔大学从事编程模型、编译技术、并行分布处理、体系结构和人工智能方面的教学和科研,而后担任IBM编译器团队的首席架构师,负责全球IBM Power服务器、BlueGen巨型机、CELL加速器,system z大型机的编译器创新研发和产品交付。在顶级国际学术刊物和国际会议上发表50余篇论文,拥有三本专著,并担任多个国际会议程序委员会成员,拥有40余项国际授予专利。
论坛讲者:
华为编译器与编程语言实验室 AscendNPU IR架构师
现任华为技术有限公司编译器实验室助理首席专家和AI编译器架构师。2016年加入华为,从昇腾第一代芯片开始参与AI编译器研发,主导多项面向自研AI软件栈的DSL和编译器相关技术研发及技术落地,成功支撑昇腾310/910/A2/A3/950等多代际芯片规模商用。加入华为之前,曾在Sun MicroSystems编译器团队从事SunStudio C++编译优化。目前担任昇腾社区TSC委员。超过十多年的编译器研发经验。以一作发表过多篇发明专利。
报告题目|AscendNPU-IR:开源编译底座,多语言无缝接入昇腾生态
报告摘要|AscendNPU IR是面向昇腾亲和算子编译时使用的中间表示,提供昇腾完备表达能力,向上支持Triton等5+生态语言,通过编译优化提升昇腾AI处理器计算效率,支持通过生态框架灵活对接,高效使能昇腾AI处理器与深度调优。基于MLIR构建面向昇腾AI处理器的专用中间表示,提供多级抽象接口,在易用性与细粒度性能控制间取得平衡,能有效提升算子开发效率和计算性能,技术路线先进,直击AI编译优化核心需求。
湖南大学计算机学院教授
湖南大学计算机学院教授,博士生导师,国家级青年人才计划获得者,智源人工智能研究院智源学者,湖南大学岳麓学者特聘B岗,也曾入选中国人民大学杰出青年学者A岗。近年来先后主持和参与了国家自然科学基金优秀青年科技基金项目、区域创新发展基金重点项目、青年基金项目、国家重点研发计划子课题、国家重大专项子课题等项目。以第一/通讯作者身份发表的研究成果已发表在ASE、ISSTA(软件工程领域)、MICRO(体系结构领域)、OSDI、TOCS(操作系统领域)、PLDI(程序设计语言领域)、PPoPP(高性能计算领域)等CCF A类会议和期刊上。曾获2023年度ACM SIGHPC China新星奖、2021年度郑州专家“智库贡献奖”二等奖、2020年度MICRO会议最佳论文提名、2013年度军队科技进步二等奖等奖项。
报告题目|从因果决策、全局调度到智能内核生成的昇腾AI编译器全栈优化方法
报告摘要|随着深度学习模型规模持续增长与硬件架构日益异构,AI编译器在面向昇腾等专用加速器进行优化时面临系统性挑战:单点编译优化可能引发全局性能抖动,分布式训练中通信放置与内存占用存在深层耦合,高性能内核的开发与跨后端迁移仍高度依赖人工。本文围绕上述问题,提出一套面向昇腾AI编译器的全栈优化方法。首先,构建基于全Kernel因果状态建模的公共决策架构,将编译优化形式化为合法干预集合上的反事实推理问题,采用区间安全选择策略,仅当候选优化时间上界低于原始状态下界时方予采纳。该方法在GPU上完成了SIMD-like优化降级的实证验证,并为Ascend 950+ SIMD/SIMT双模式迁移提供理论支撑。其次,针对参数分片训练中All-Gather通信与参数缓冲区生命周期的全局耦合问题,将前向与后向传播构造为全迭代图,以混合整数规划联合优化通信启动位置与迭代内保留决策。该方法在16卡A100集群上相较DeepCompile提升吞吐1.10倍。最后,以多智能体协作框架将优化策略探索与后端代码生成解耦,通过统一草图表达硬件无关优化意图,经验证驱动闭环实现跨DSL后端的高保真代码生成,支持Triton到Ascend NPU的跨后端迁移,在KernelBench上取得1.46倍平均加速。三项工作分别从编译决策的因果安全性、分布式训练的通信调度与算子生成的智能自动化三个层面,共同勾勒出昇腾AI编译器从局部优化走向系统化全栈优化的技术路径。
中国科学技术大学教授
中国科学技术大学特任教授、博士生导师,合肥综合性国家科学中心人工智能研究院院长助理,CCF专委工委副主任委员,入选国家高层次青年人才计划。2009年获南开大学计算机系学士学位,2016年获德国马普学会软件系统研究所(MPI-SWS)博士学位。从事大模型与类脑智能系统研究,承担国家自然科学基金联合重点/面上/专项课题、新一代人工智能国家科技重大专项课题、安徽省重大攻坚专项等多项科研任务,并与字节、阿里、华为、新华三、中科类脑等企业保持长期合作。曾获得世界人工智能大会青年优秀论文奖、IEEE ICCD 2025唯一最佳论文奖、高校计算机专业优秀教师奖励计划、CCF 高专委青年学者激励计划、ACM China 新星提名等奖励。指导学生多次获得 CCF 数据库专委优博激励计划、ACM China SIGHPC 优秀博士论文奖、ACM China SIGCSE 优秀博士论文奖、中国科学院院长特别奖、中国科协青年人才托举工程等奖励。多名毕业生进入大模型头部企业,参与千问、豆包、混元等大模型的训练与推理系统优化工作,并入选字节 TopSeed、阿里星、小红书 RedStar、华为天才少年、中国电信优才计划等企业人才项目。
报告题目|基于昇腾多核任务编排的通算融合算子生成
报告摘要|针对Ascend NPU上MoE训练因逐kernel串行执行而未能充分利用AIC与AIV异构计算资源的问题,本文提出HyperParallel-MoE编译调度框架,通过将算子级执行转换为静态调度的tile级异构任务流,引入AIV驱动的单边通信消除集合通信同步,并采用保持依赖关系的事件驱动调度实现通信、矩阵与向量计算的细粒度重叠。该框架已在MindSpore和MindFormers中实现,并在Ascend A3集群上基于DeepSeek风格MoE模型评测,结果表明从Dispatch到Combine的MoE-FFN延迟最高可降低至原来的1/1.58,验证了tile级异构调度对提升NPU训练效率的有效性。
复旦大学计算与智能创新学院教授
复旦大学计算与智能创新学院教授,获普林斯顿大学计算机工程博士学位,曾任英特尔中国研究院副院长兼首席架构师。尚笠教授的研究方向位于计算机系统与人工智能的交叉领域,重点关注机器学习系统、具身智能、超大规模集成电路和电子设计自动化。他已发表学术论文200余篇,多次获得国际顶级会议最佳论文奖及提名,论文引用超万次。
报告题目|智能体时代的 AI 基础设施:优化的可验证性
报告摘要|大模型智能体正在重塑AI基础设施的优化范式。计算图变换、数值近似、编译优化和硬件映射正逐步从专家主导走向自主生成与组合,显著扩大了可探索的优化空间。与此同时,跨层、动态的优化过程也使语义保持与数值可靠性难以仅靠传统测试加以保证,正确性验证因而成为智能体优化落地的关键挑战。本报告聚焦智能体驱动的AI基础设施优化及其可验证性,探讨如何通过显式语义规范和正确性条件,为张量计算的图变换、数值近似及软硬件映射提供可组合、可追溯的保证。
杭州先进编译科技有限公司先进编译实验室基础编译部部长
个人简介|柴赟达,主要研究方向为AI编译器、基础编译器以及高性能编译优化技术。熟悉LLVM/MLIR编译框架,具备编译器前端设计、中间表示(IR)优化及后端代码生成等核心技术研发能力,具备Triton编译器、Triton-Shared 编译器、Linalg IR 等编译系统的开发经验,在AI编译器、国产GPU/NPU编译器适配等领域具有丰富的工程实践经验。
报告题目|AI编译优化:Triton-tle在国产平台上的适配优化
报告摘要|Triton基于Block的编程抽象降低了高性能Kernel开发门槛,但面对DSA和新兴GPU架构,其细粒度硬件控制与结构化表达能力仍存在不足。Triton-TLE通过TLE-Lite、TLE-Struct和TLE-Raw三层编程抽象,在可移植性、可维护性和性能之间建立更灵活的平衡。借助extract_tile等结构化Tile原语,TLE能够在保持跨平台复用能力的同时,为编译器暴露更清晰的结构化优化信息,并支持国产芯片平台上的“一次优化、多芯复用”。
欢迎参加CNCC2026
CNCC是一个宏观论述技术趋势的大会,具有规格高、规模大、内容丰富等特点,会议形式包括大会特邀报告、大会论坛、专题论坛、特色活动及展览。大会汇聚两院院士、国内外顶尖学者、知名企业家等亲临大会,展望前沿趋势,分享创新成果。ACM、IEEE CS、IPSJ、KIISE等国际计算机组织的代表也多次获邀现场参加这一盛会。CNCC2026将于10月21-24日在四川省成都市举办,大会主题是“数聚驱动,智算未来”,欢迎各界前来参会。
点击“阅读原文”,加入CCF。
