首页 > 最新动态 > 赛题解读 | 龙蜥社区 × CCF开源创新大赛,5w激励金,Mooncake KVCache 存储设计与性能优化等你挑战!
最新动态
赛题解读 | 龙蜥社区 × CCF开源创新大赛,5w激励金,Mooncake KVCache 存储设计与性能优化等你挑战!
2026-07-0331

导语

你有没有发现,随着大模型上下文窗口越来越长(从8k到128k甚至更长),GPU显存往往不是卡在计算上,而是卡在了 KVCache(键值缓存)的存储与调度上?传统的单体显存管理已无法满足多节点、高并发的生产级推理需求。Mooncake作为业界领先的 KVCache分离架构项目,旨在通过分布式存储解放GPU显存压力。

这一次,我们邀请你深入Mooncake内核,解决真实场景下的 RDMA网络传输效率、内存碎片化以及跨框架兼容性难题。这不仅是一次代码竞赛,更是通往顶级AI基础设施工程师的快车道。


一、赛题速览卡


报名链接:

https://www.gitlink.org.cn/competitions/track2_2026Mooncake



二、赛题激励

奖项设置:

奖项

数量

激励金

一等奖

1

15000元+获奖证书

二等奖

3

5000元+获奖证书

三等奖

8

2500元+获奖证书

优秀参赛者可获得龙蜥生态合作伙伴企业招聘加分项


扫码加入赛题交流群



三、这道题,我们为什么要出?

1、真实痛点:显存墙与通信墙

在当前的大模型服务中,KVCache占据了巨大的显存空间。当请求并发增加或序列长度变长时,单机显存迅速耗尽。虽然引入分布式存储可以扩展容量,但带来了新的瓶颈:

● 网络开销大:跨节点获取KVCache数据时,传统TCP/IP协议延迟高,带宽利用率低。

● 内存管理复杂:分布式环境下的内存分配、回收极易产生碎片,导致频繁GC或OOM。

● 生态割裂:许多优化方案仅针对特定框架,难以同时兼容vLLM、SGLang等主流推理引擎。


2. 行业趋势:存算分离是必然

“KVCache分离架构”已成为大模型推理系统的演进方向。通过高速网络(如 RDMA)将KVCache卸载到集中式或分布式内存池中,是实现长上下文、高吞吐推理的关键技术路径。


3. 出题意图

我们希望参赛者:

● 深入底层:掌握RDMA编程、高性能内存池设计等系统级核心技术。

● 解决实战问题:在Mooncake现有架构基础上,切实提升KVCache的命中率、复用率及传输效率。

● 回馈社区:优胜方案将有机会合入Mooncake主线,被全球开发者使用,并作为你简历中极具含金量的开源贡献。



四、任务拆解:你到底要做什么?

4.1 赛题全景





最终目标:基于Mooncake项目,开发一个或多个优化模块,实现与现有分布式存储及调度系统的平滑集成,并在标准测试环境下显著提升性能指标。

分层拆解:


基础目标(必须完成)

● 代码符合 Mooncake 规范(C++/Python),无内存泄漏,线程安全。

● 功能模块能正常编译、运行,并与 vLLM 或 SGLang 至少一种主流框架完成对接。

● 在标准 Linux 环境(Ubuntu)及 Nvidia GPU 环境下可稳定部署。

进阶挑战(冲击高分)

● 性能突破:显著降低跨节点 KVCache 读取/写入延迟,提升吞吐量(Tokens/sec)。

● 算法优化:提出更高效的内存分配策略或缓存淘汰算法,提升 KVCache 命中率。

● 通用性增强:实现更优雅的抽象层,同时兼容多种推理框架。

彩蛋方向(创意加分):

● 引入新型压缩算法减少网络传输量。

● 针对特定硬件(如特定网卡型号)进行指令集级优化。


4.2 关键概念解析





● KVCache (Key-Value Cache):大模型推理过程中,为了避免重复计算之前生成的 Token 的 Key 和 Value 向量,将其缓存起来的技术。它是加速推理的核心,也是显存消耗的大户。

● RDMA (Remote Direct Memory Access):远程直接内存访问。允许一台计算机直接读写另一台计算机的内存,无需经过操作系统内核,极大降低延迟,提高带宽,是分布式 AI 存储的基石。

● Mooncake:一个开源的 KVCache 分离存储系统,旨在为大模型推理提供高性能、可扩展的分布式缓存服务。


4.3 阶段任务与提交物






五、解题思路点拨(从何入手?)

第一步:零基础冷启动(必做


不要急着写代码,先让 Mooncake 跑起来!

1. Clone 仓库:

git clone https://www.gitlink.org.cn/mooncake-track/Mooncake
cd Mooncake

2. 环境配置:参考 README 安装依赖(CMake, GCC, RDMA 驱动等)。

3. 运行 Demo:执行官方提供的 Quick Start 脚本,确保你能看到基本的存储读写日志。

提示:如果没有 RDMA 硬件,请先配置好 RoCE 模拟环境或使用 TCP fallback 模式进行初步开发。


第二步:技术路线图




路线 A:存储引擎优化派

(适合擅长 C++/系统编程的同学)

○ 切入点:分析 mooncake-store 模块。

○ 思路:优化内存池分配算法(如引入 Slab Allocation 改进版),减少碎片;优化 RDMA verbs 调用链路,减少上下文切换。

○ 难点:需深入理解 RDMA 异步操作机制及 C++ 内存模型。


路线 B:调度与协议优化派

(适合擅长分布式系统/算法的同学)

○ 切入点:分析 mooncake-transfer-engine 或调度器逻辑。

○ 思路:设计更智能的数据预取策略(Prefetching);优化多副本一致性协议;改进负载均衡算法。

难点:需平衡一致性与可用性,避免死锁或活锁。


路线 C:生态适配与接口优化派

(适合全栈/应用层同学)

○ 切入点:分析与 vLLM/SGLang 的集成接口。

○ 思路:简化接入流程,提供更通用的 Python Binding;优化序列化/反序列化效率。

○ 难点:需深入理解主流推理框架的内部显存管理机制。


第三步:官方工具箱的“正确打开方式”



● Benchmark 工具:务必使用官方提供的压测工具建立基线数据(Baseline)。每次修改代码后,都要重新跑分,用数据说话。

● Profiling 工具:利用 perf、nsys (Nvidia Nsight Systems) 或 RDMA 专用监控工具,定位热点函数。是卡在 CPU 拷贝?还是网卡发送?还是锁竞争?

● CI/CD 检查:在提交 PR 前,本地运行单元测试和格式检查(clang-format),确保符合社区规范,避免因风格问题被拒。



第四步:实操经验和注意事项



忽视线程安全

在多线程并发读写 KVCache 时,未加锁或锁粒度太粗,导致数据竞争或性能急剧下降。对策:善用无锁数据结构或细粒度读写锁。


RDMA 环境配置错误

很多同学在本地调试正常,一到集群环境就报错。对策:尽早使用多机环境测试,注意 MTU 设置、GID 索引等网络参数。


文档缺失

代码写得很棒,但评委看不懂怎么跑。对策:README 必须包含“一键复现”步骤,视频演示要清晰展示性能对比数据



六、评审标准深度解读:

怎么样能拿高分?

一句话总结:我们想看到的,是一个能跑、能讲、能复用的作品,而不仅仅是一份报告。


七、资源与支持:

你不是一个人在战斗


● 官方资源包:

○ Mooncake 仓库:

-GitLink:  

https://www.gitlink.org.cn/mooncake-track/Mooncake

https://www.gitlink.org.cn/mooncake-track/dynamo

https://www.gitlink.org.cn/mooncake-track/ccf-mooncake

-Github:

https://github.com/kvcache-ai/Mooncake

○ 开发文档与 API 参考:详见仓库 docs/ 目录。



八、常见疑问集中解答(FAQ)



九、写在最后

赛题讲师寄语:大模型的基础设施之战,才刚刚开始。Mooncake 不仅仅是一个项目,它是未来 AI 推理系统的基石之一。我们期待看到你们用代码打破性能的边界,用开源精神连接全球的开发者。

无论你是系统编程的老手,还是对 AI 基础设施充满好奇的新星,龙蜥社区都欢迎你的加入。







2.35:1-C.jpg

底部banner.png





往期推荐


赛题解读 | CCF开源创新大赛《全球自动驾驶数据集统一规格设计赛》

赛题解读 | 西北工业大学× CCF开源创新大赛,CrowdOS群智应用开发与大模型智能增强实践等你来战

赛题解读 | 星绽社区×CCF开源创新大赛:10w激励金,共创下一代Rust通用内核






点击阅读原文 报名本赛题

点我访问原文链接