Kernel & ML Compiler
Kernel & Operator
从 GPU 体系结构与 CUDA 出发,沿着 Layout、数据复用和流水线一路抵达高性能 GEMM、Attention 与 MoE Kernel,并理解 DSL、ML Compile 如何实现简化开发与自动优化的梦想
大模型如何训更快、跑更好、推更省?
从 Kernel 到编译器、从分布式系统到集合通信、从模型推理到强化学习系统,社团骨干与超算队倾力设计打造课程设计,力求向你揭示工业界大规模模型训练与推理的最前沿!
Kernel & Operator
从 GPU 体系结构与 CUDA 出发,沿着 Layout、数据复用和流水线一路抵达高性能 GEMM、Attention 与 MoE Kernel,并理解 DSL、ML Compile 如何实现简化开发与自动优化的梦想
Communication
从不同的视角看互联网络与集合通信如何决定大规模系统的真实效率
Serving
围绕 KV Cache、调度与并行策略,理解推理优化的目标和目的,并实践和理解真实推理在系统层面如何优化
RL Systems
当训练、推理、奖励与环境同时出现,如何系统性地看待和解决解决长尾、资源调度、权重同步、容错与训推一致性等问题
每场围绕一个系统主题,由专业同学进行系统讲解和分享。
分享后开放提问与延伸讨论,串联论文、源码与真实工程经验。
邀请业界专家进行专题讲座,分享前沿技术与实践经验。
结合 CUDA、TileLang 与训推框架,提供高质量的作业练习、评测环境与测试实例。
讲义与资料统一同步开源,持续更新。