跳到正文

北京大学未名超算队北京大学学生 Linux 俱乐部

AI Infrastructure Seminars

大模型如何训更快、跑更好、推更省?

从 Kernel 到编译器、从分布式系统到集合通信、从模型推理到强化学习系统,社团骨干与超算队倾力设计打造课程设计,力求向你揭示工业界大规模模型训练与推理的最前沿!

四个 Topics,四个 Level

01

Kernel & ML Compiler

Kernel & Operator

从 GPU 体系结构与 CUDA 出发,沿着 Layout、数据复用和流水线一路抵达高性能 GEMM、Attention 与 MoE Kernel,并理解 DSL、ML Compile 如何实现简化开发与自动优化的梦想

  • CUDA
  • Triton
  • TileLang
  • Tensor Core
  • Warp Specialization
  • Pipeline Ordering
  • ML Compiler
02

Interconnnect & Communication

Communication

从不同的视角看互联网络与集合通信如何决定大规模系统的真实效率

  • RDMA
  • NCCL
  • Scale-Up
  • Scale-Out
  • Network Fabric
  • Memory-Storage Co-design
03

LLM Serving & Inference

Serving

围绕 KV Cache、调度与并行策略,理解推理优化的目标和目的,并实践和理解真实推理在系统层面如何优化

  • KV Cache Centric Systems
  • Batching
  • PD 分离
  • Spec Decode
  • vLLM
04

Distributed Reinforcement Learning Systems

RL Systems

当训练、推理、奖励与环境同时出现,如何系统性地看待和解决解决长尾、资源调度、权重同步、容错与训推一致性等问题

  • PPO
  • veRL
  • Rollout
  • Agentic RL
  • 训推一致性
  • 分布式 RL 系统

如何进行

  1. 01

    主题分享

    每场围绕一个系统主题,由专业同学进行系统讲解和分享。

  2. 02

    现场讨论

    分享后开放提问与延伸讨论,串联论文、源码与真实工程经验。

  3. 03

    Guest Lecture

    邀请业界专家进行专题讲座,分享前沿技术与实践经验。

  4. 04

    代码实践

    结合 CUDA、TileLang 与训推框架,提供高质量的作业练习、评测环境与测试实例。

  5. 05

    资料开源

    讲义与资料统一同步开源,持续更新。