分论坛:Token经济下的
开源AI Infra机遇和挑战
论坛主旨
当AI以Token为计量单位重新定义计算价值,开源基础设施正站在范式转移的十字路口。我们将直面这些关键问题:Token定价波动是否会让开源项目陷入“算力通胀”陷阱?开源社区如何设计Token激励机制,既不违背开放精神,又能吸引企业级贡献者?现有Kubernetes、Ray等开源栈能否原生适配Token化计费与动态路由?当推理成本趋近于零,开源Infra的价值锚点该转向何处?
论坛主席
章文嵩
CCF会士、常务理事、开源发展技术委员会副主任委员,开源项目LVS(Linux Virtual Server)创始人。现在主要从事云原生和AI Infra创业孵化与投资。曾任高瓴运营合伙人、滴滴出行高级副总裁、阿里副总裁和阿里云首席技术官、TelTel联合创始人、国防科技大学计算机学院副教授。他在设计和架构大规模系统、云计算、大数据、AI工程、软件研发管理、开源上有着丰富的经验。
章津楠
CCF开源发展技术委员会委员、CCF ODTC AI Infra工作组组长,沐曦股份开源生态总监。10年+创业经历,15年以上的Infra开源产品设计和运营经验,参与制定国内开源领域多项标准,获全国信息技术标准化委员会颁发的“2022年度云计算标准工作先进个人”,2025 CCF中国开源大会、2025 CNCC、COSCon’s“开源AI 基础设施论坛”发起人之一。
论坛议程
嘉宾与报告介绍
姜开达
上海交通大学信息化推进办公室副主任、网络信息中心副主任
从启悟学习社区建设到高校AI自主开源生态发展
将围绕高校AI自主开源生态发展展开,介绍教育部等五部门《“人工智能+教育”行动计划》相关部署,阐述全球开源生态现状及我国开发者规模优势与短板。重点介绍启悟学习社区的建设背景、运营模式,以校企协同为核心,助力AI人才培养,为高校AI开源生态建设提供实践路径与支撑。
张同浩
CCF开源发展技术委员会委员、滴滴出行系统软件负责人
HUATUO 华佗:面向 Agent 沙箱的低损耗内核全景观测实践
HUATUO 华佗为滴滴开源、CCF 孵化的内核全景观测项目。依托 eBPF 实现低损耗穿透采集,通过事件驱动捕获资源异常,自动化追踪与持续性能剖析,为大规模 Agent 集群提供轻量化、全栈式内核观测解决方案。
王豪杰
九源智能计算系统生态联合体副秘书长
从统一编程到异构推理:国产开源智能计算系统的探索与实践
国产智能芯片快速发展,但软件生态碎片化与跨平台迁移成本高等问题依然突出。本报告围绕九源统一智能计算系统,介绍其面向国产芯片从单点支持到统一架构、从算子开发到系统优化的探索历程,阐述统一软件栈实现“一套代码、无需修改、全平台运行”的实践,重点分享九齿编程语言、异构推理优化等关键技术成果。同时,结合九源开源实践,探讨如何通过开源社区与生态联合体建设,结合开发者课程和技术赛事等活动,促进知识传播、人才培养与开放协作,推动国产智能计算系统生态可持续发展。
仇实
腾讯高级工程师
于2026年厦门大学计算机科学与技术系取得博士学位,曾在USENIX FAST、ACM SC、TOS等存储及系统领域会议与期刊发表论文十篇。于同年加入腾讯数据计算平台部,工作聚焦于研究面向人工智能的高性GPU文件系统和分布式文件系统,并负责将相关技术部署到真实的生产系统中,以解决实际问题。
GPU为中心的KV Cache存储
LLM 推理服务依赖KV缓存(KV Cache)来提升推理性能。随着上下文长度持续增长,KV 缓存的存储规模远超 GPU HBM 和 CPU DRAM 的容量上限,将 KV 卸载至 NVMe SSD 逐渐成为主流方案。然而,将KV卸载到SSD上面临严重的 I/O 性能瓶颈,会引发长时间到GPU 停顿。根本原因在于,碎片化的 GPU 内存布局导致海量细粒度随机 I/O,使得低并行的 CPU 软件栈成为严重瓶颈。Tutti 是一种以 GPU 为中心的高效 KV 存储系统,大幅削减了 HBM 与 SSD 之间数据路径和 控制通路上 CPU 开销。CPU 仅负责逐层的完成轻量元数据同步并且加载GPU I/O Kernel,由GPU并发的读写KV。测试表明,在严格 SLO 约束下,相比当前最优的 GDS 方案 LMCache-GDS,Tutti 的首 Token 时延(TTFT)降低 78.3%,系统 QPS 提升 2 倍,推理服务成本降低 27%。Tutti 使 vLLM 在 SSD 上加载 KV 缓存的性能与 DRAM 方案近乎持平,同时提供了百倍以上的缓存容量。
章文嵩
CCF会士、常务理事、开源发展技术委员会副主任委员,开源项目LVS(Linux Virtual Server)创始人
大模型时代云原生InfraServices的机会
本报告主要抛砖引玉讲述在大模型时代下云原生InfraServices的发展机会。LLM触发的智能化科技革命会持续一百年,各行各业都有智能化升级的机会。开源是AI发展的重要力量,加快AI的开发速度,构建AI的开源生态,大幅降低智能化的门槛,加速AI技术的扩散。智能化升级和AI应用会创造巨大价值。人工智能应用成功需要三个必要条件:人才、数据、算力,催生新的基础设施需求,包括数据基础设施和AI服务基础设施等,来复用人才的经验(软件)和公共的硬件基础设施。这些基础设施服务应该建设在云基础设施之上,来重用云上的计算与存储服务,并实现自动伸缩的弹性能力。会概要地讨论用云原生的架构来设计数据基础设施和AI服务基础设施等。AI开发生态还处于早期阶段,通过开源协作在智能服务开发框架、高性能算子库等领域形成事实的标准,大有可为。云原生Infra Services可以大幅降低大模型AI技术的应用门槛,它自然是多云的,通过开源可以拓展国际化市场。
李兆石
沐曦AI研究院院长
智能体原生GPU架构设计与实现
随着智能体从短对话走向多轮规划、工具调用和长上下文任务,推理瓶颈正从单纯的计算效率转向 KV Cache 容量、数据搬移与内存带宽。传统的 HBM、CPU DRAM 和存储分层,已难以同时满足超长上下文的容量需求与在线推理的访问效率。
本次演讲将提出两种面向智能体负载的中间存储层:L1.5 SEQ 利用共享 NVMe SSD,在 session turn边界增量保存并顺序恢复 KV snapshot,以低成本容量减少重复 prefill;L1.5 RAND 则通过定制 GPU的南向 CXL fabric 连接扩展内存,将完整长上下文 KV 常驻 CXL-DRAM,由 HBM 中的 indexer 选出稀疏注意力所需的 top-K KV,并在 decode 过程中按需随机读取。
Panel介绍
嘉宾
章文嵩:CCF会士、常务理事、开源发展技术委员会副主任委员,开源项目LVS创始人;
章津楠:CCF开源发展技术委员会委员、CCF ODTC AI Infra工作组组长,沐曦股份开源生态总监;
李兆石:沐曦AI研究院院长,清华大学博士;
姜开达:上海交通大学信息化推进办公室副主任、网络信息中心副主任;
王豪杰:九源智能计算系统生态联合体副秘书长;
仇实:腾讯高级工程师;
张同浩:CCF开源发展技术委员会委员,滴滴出行系统软件负责人;
葛佳烨:上海人工智能实验室大模型中心产品运营负责人。负责司南OpenCompass 评测体系产品建设和生态影响力建设,负责书生系列大模型(InternVL, InternLM等)及工具链开源生态建设。
主题:每个token背后都是一次开源协作
从Transformer架构的发表,到海量开放数据集的构建,再到无数开发者对训练框架的迭代优化——Token中承载的不仅是语义,更是协作的契约、共享的精神与数字时代的“公地”治理智慧。
圆桌将直面以下三个维度的真实断点:
稳定层:当推理集群遭遇突发流量,Linux内核参数调优、Kubernetes弹性调度、GPU虚拟化与存储IO如何联动,将故障恢复时间压缩至秒级?
效率层:PyTorch 2.0编译优化、vLLM的PagedAttention、DeepSpeed ZeRO-offload,近一年有哪些开源贡献真正让Token边际成本腰斩?下一个性能拐点又在何处?
治理层:从许可证兼容性到模型偏见审计,从CVE漏洞披露到跨境数据合规,开源社区如何建立可落地的协同机制,让合规从“成本项”变为“信任标签”?
2026 CCF中国开源大会
点击了解详情 ↑ ↑ ↑
2026 CCF 中国开源大会(CCF ChinaOSC)拟于 2026年8月15日至16日 在 重庆?山城国际会议中心 召开。
大会报名渠道已开启,欢迎开源领域学术界、企业界、教育界的学者、从业者、师生等前来参会,共见中国开源新征程!
大会官网
https://chinaosc.ccf.org.cn
大会报名链接:
https://ccf.org.cn/2026COSC
扫码立即报名!
往期推荐
点击阅读原文 立即报名CCF中国开源大会
