本论坛将聚焦数算与智算领域的最新研究和创新,探讨新型网络技术在提升数据中心间数据交换效能、实现算力与数据智能融合方面的作用。论坛重点关注智能化、自适应性和可扩展性等关键技术,探讨如何应对日益增长的数据量和复杂的网络环境,促进技术合作与产业协同发展。
门票类型 | 参会者身份 | 4.28-6.23 | 6.24-7.26 |
会议注册费 | CCF专业会员 | ¥2200 | ¥2700 |
CCF学生会员 | ¥1500 | ¥2000 | |
非会员专业人员 | ¥2700 | ¥3200 | |
非会员学生 | ¥2000 | ¥2500 |
董德尊,CCF杰出会员、体系结构专委常委、分布式计算与系统专委常委,国防科技大学计算机学院研究员、博导,教育部长江学者、全国百篇优秀博士论文奖获得者、国防卓青、湖南省杰青,主要研究计算机体系结构、高性能与智能计算、并行与分布式系统,长期参与国产高性能计算机系统研制工作,获湖南省教学成果特等奖、军队科技进步一等奖、湖南省自然科学一等奖、中国电子学会和中国计算机学会(CCF)自然科学二等奖等,在CCF推荐的A/B类国际刊物发表论文80余篇,担任Fundamental Research、《国防科技大学学报》、《计算机工程与科学》等期刊编委。
王晓亮,南京大学教授,博士生导师,长期从事“云计算网络系统”研究。曾任微软亚洲研究院“铸星计划”学者,腾讯网络,阿里云,华为2012荣誉顾问,参与支持云网络、存储与计算网络的研发与部署工作。获得2019,2023年江苏省科技进步奖。
孟晴开,南京大学特聘研究员,博士生导师,博士毕业于清华大学计算机系。近年来一直从事数据中心网络、网络传输协议、机器学习系统等方向研究工作,在ACM SIGCOMM、USENIX NSDI、ACM ASPLOS等国际顶级会议和期刊上发表论文三十余篇,获2025年度ACM SIGCOMM中国新星奖,担任ACM SIGCOMM CCR领域主编。
讲者简介:李丹,清华大学计算机系教授、博导,教育部长江学者特聘教授,IEEE Fellow。主要从事计算机网络领域的研究工作,发表学术论文100余篇,获授权专利50余项。担任北京高校卓越青年科学家计划项目负责人,曾担任国家973计划项目首席科学家、国家重点研发计划项目负责人、国家十四五重点研发计划“网络空间安全治理”专家组副组长。获教育部“青年科学奖”,以第一完成人获中国通信学会技术发明一等奖、中国电子学会技术发明一等奖。
报告题目:新型智算集群组网架构ZCube及其产业应用
报告摘要:长上下文窗口的大模型推理业务,在智算集群中呈现出高动态、高带宽的流量特征,放大了传统Clos组网架构在流量负载均衡能力方面的不足。我们提出了新型智算集群组网架构ZCube,采用创新的扁平组网架构取代Clos网络的层次化组网架构。ZCube具备拓扑内生的负载均衡能力,使得其可以在大模型推理业务下实现更高的网络带宽吞吐量。除了网络带宽更高的优势之外,ZCube相比Clos架构,还有组网成本更低、故障源更少、GPU之间路径更短、多用户网络隔离性更强等优势。ZCube已经在智谱公司运行GLM5.1模型推理的千卡规模集群正式落地运行。与相同集群之前采用Clos组网架构相比,ZCube在不改变服务器侧任何软硬件环境的前提下,将GPU推理吞吐率提升了15%,P99 TTFT降低了40.2%。
讲者简介:张汝云,研究员,国家级高层次人才、国务院特殊津贴专家,科技创新 2030 “新一代人工智能” 重大项目专家组专家、中国通信学会算力网络专委会委员、浙江省电子学会副理事长。长期深耕网络通信与人工智能领域,主持国家重点研发计划、863 计划课题、工信部工业互联网创新发展工程等多项国家级重点项目,牵头完成浙江省首个全液冷万卡集群算网存系统的设计与建设工作。先后荣获国家科技进步一等奖 1 项,省部级科技进步一等奖 5 项、二等奖 2 项。
报告题目:打破域间传输瓶颈打造高性能跨域智算网络体系——跨域高通量智算网络思考与实践
报告摘要:大模型训练已进入“算力决定上限”的阶段,跨中心联合训练是突破”算力天花板“的可行路径,高通量跨域互联也因而成为下一代算力基础设施的必然选择。报告将结合大模型训练技术趋势,国内外算力基础设施技术演进路径,探讨算力集群跨域协同中的高通量智算网络核心技术难题及工程化落地挑战,分享非侵入式的解决方案与团队的初步实践,为全国一体化算力网络建设和打造支持下一代大模型研发的关键基础设施提供参考。
讲者简介:陈果,湖南大学教授,国家超算长沙中心常务副主任,CCF理事,YOCSEF总部副主席。长期从事计算机系统与网络研究,在相关领域重要期刊和会议上发表论文近百篇,出版教材3部。研究成果应用于华为鲲鹏芯片、腾讯自研交换机、字节跳动高速网络等产品,显著提升了网络性能与系统可靠性。入选国家级和省市级青年人才计划,主持国家自然科学基金企业联合重点、国家重点研发计划课题、工信部揭榜挂帅行动、湖南省科技创新平台计划等多项国家和省部级重点项目,获中国产学研合作创新奖、全国高校计算机专业优秀教师、华为最佳技术合作教授、湖南省教学成果一等奖和湖南省科技进步二等奖等奖项。
报告题目:从机内多路径到机内SDN——面向智算的机内统一互连探索
报告摘要:针对大模型时代数据传输成为核心瓶颈的现状,指出当前GPU服务器内部存在"协议孤岛"困境——NVLink、PCIe等多种互连链路虽带宽充裕,却因软硬件约束无法协同利用。报告首先验证了在现有硬件上通过跨协议多路径传输可实现显著带宽提升,进而提出"机内SDN"愿景:在不依赖硬件统一升级的前提下,通过软件定义的方式实现机内异构网络的统一池化与动态调度,为突破AI基础设施的机内传输瓶颈提供可落地的演进路径。
阿里云
讲者简介:付斌章,博士,中国计算机学会高性能计算专委会执行委员,阿里云高性能网络业务负责人,主导了阿里云自研高性能网卡和通信库软件的研发,以及超大规模RDMA网络的建设、交付和运营,在ISCA、SIGCOMM等行业旗舰会议发表论文20余篇。
报告题目:面向多元AI应用的推理系统优化:EP并行与超节点通信实践
报告摘要:Agent、AI编程、视频生成等多元AI应用正在重塑推理系统的负载特征——从长上下文的KV Cache压力到多轮交互的实时响应要求,从视频生成的批处理需求到编程场景的低延迟偏好,差异化的业务模式对推理架构提出了更高要求。本次演讲聚焦推理系统的性能与成本优化两大核心议题,重点分享MoE模型Expert Parallelism场景下的动态负载均衡技术,解决Expert利用率不均带来的性能瓶颈;同时介绍面向超节点架构的通信算子优化方案,通过拓扑感知的通信调度提升跨节点协作效率。结合多场景的实际部署经验,探讨如何构建高效、弹性、低成本的新一代大模型推理平台。
讲者简介:李强,华为高级技术专家,研究方向包括HPC高性能计算机、大规模存储系统和高性能网络,先后参与曙光高性能计算、大规模云存储系统和AI高性能网络及系统的研制,并发表FAST、NSDI、OSDI等会议论文。
报告题目:τ Scaling超节点通信思考:由网络走向系统
报告摘要:随着AI大模型进入超节点时代,通信τ正从网络指标演变为系统级的第一性约束。本报告从系统架构与器件演进双重视角,重新思考AI基础设施中的通信本质。AI 时代,网络不再是简单的数据管道,而是与计算、存储深度融合的系统核心。基于该思考,本报告将重点阐述从系统角度打破计算、通信与存储边界的可能性,以此实现基于网络通信的System Scaling。
点击“阅读原文”,加入CCF。
