BEGIN:VCALENDAR
VERSION:2.0
CALSCALE:GREGORIAN
METHOD:PUBLISH
PRODID:-//LCPU//AI Infra Seminars//ZH-CN
X-WR-CALNAME:AI Infra Seminars
X-WR-TIMEZONE:Asia/Shanghai
BEGIN:VEVENT
UID:event-topic-1-opening@ai-infra-seminars.lcpu.dev
DTSTAMP:20260726T100000Z
SUMMARY:Topic 1 Kernel & ML Compiler 第一次分享
STATUS:TENTATIVE
CATEGORIES:AI INFRA,lecture,kernel
DTSTART:20260726T100000Z
DTEND:20260726T123000Z
DESCRIPTION:Topic 1\, Session 1.0 | 从 HPC 到 AI Infra：并行计算与
 并行编程\nTopic 1\, Session 1.1 | CUDA 编程模型\nTopic 1\, Session
  1.2 | Triton/TileLang Tile Level 编程\n介绍活动整体安排、内
 容设计、评测与算力资源。\n\nTopic 1 讲义: https://ai-infra-w
 ebsite.leavelet.workers.dev/wiki/VWJPwVFTHifeadkE4phc45hOntg\nTopic 1 演
 示文稿（PDF）: https://ai-infra-website.leavelet.workers.dev/slides/s
 ession01.pdf\nSession 1.0 回放: https://www.bilibili.com/video/BV1u83w6D
 EfG\nSession 1.1 回放: https://www.bilibili.com/video/BV1g83w6DETm\nSess
 ion 1.2 回放: https://www.bilibili.com/video/BV1Sb3w6nE8v
URL:https://ai-infra-website.leavelet.workers.dev/wiki/VWJPwVFTHifeadkE4phc
 45hOntg
TRANSP:OPAQUE
END:VEVENT
BEGIN:VEVENT
UID:event-topic-1-session-02@ai-infra-seminars.lcpu.dev
DTSTAMP:20260730T113000Z
SUMMARY:Topic 1\, Session 2 | Memory Abstraction & Hierarchy
STATUS:CONFIRMED
CATEGORIES:AI INFRA,lecture,kernel
DTSTART:20260730T113000Z
DTEND:20260730T133000Z
DESCRIPTION:本讲以 CUDA Core FP32 GEMM 为主线，从计算语义出发
 理解 data reuse 与 memory hierarchy 的抽象；从 strawman GEMM 演
 进到 tiling，并使用 Roofline Model 分析数据复用；再从硬件
 视角理解 SM、warp 执行、 coalescing、latency hiding、shared memo
 ry bank conflict、padding、 swizzle 与 per-thread microtile，最后使
 用 Nsight Compute 完成一个 Kernel 的编写与调优。\n\nSession 2.
 1 演示文稿（PDF）: https://ai-infra-website.leavelet.workers.dev/sli
 des/session0201.pdf\nSession 2.2 演示文稿（PDF）: https://ai-infra-w
 ebsite.leavelet.workers.dev/slides/session0202.pdf\nSession 2.1 回放: ht
 tps://www.bilibili.com/video/BV1gqGA6ZEfg\nSession 2.2 回放: https://www
 .bilibili.com/video/BV1L8GA6YEAH
URL:https://ai-infra-website.leavelet.workers.dev/slides/session0201.pdf
TRANSP:OPAQUE
END:VEVENT
BEGIN:VEVENT
UID:event-topic-1-workshop-01@ai-infra-seminars.lcpu.dev
DTSTAMP:20260801T113000Z
SUMMARY:Topic 1\, Workshop 1 | Parallel Programming with TileLang
STATUS:CONFIRMED
CATEGORIES:AI INFRA,workshop,kernel
DTSTART:20260801T113000Z
DTEND:20260801T143000Z
DESCRIPTION:本次 Workshop，我们将介绍：TileLang 语法、 如何
 用 TileLang 写 Kernel、TileLang 中的 CTA 到 Thread 的映射与 Layo
 ut Inference、 如何在 TileLang 中做 Latency Hiding，以及 DSL 的 
 JIT 编译和 Host 侧的相关内容； 最后，我们还将介绍在 Ti
 leLang 下如何做算子优化以及一些相关的工具。\n\nWorkshop 
 1 演示文稿（PDF）: https://ai-infra-website.leavelet.workers.dev/sli
 des/workshop01.pdf\nWorkshop 1 回放: https://www.bilibili.com/video/BV1r
 hMD6YEKM
URL:https://ai-infra-website.leavelet.workers.dev/slides/workshop01.pdf
TRANSP:OPAQUE
END:VEVENT
BEGIN:VEVENT
UID:event-topic-1-session-03@ai-infra-seminars.lcpu.dev
DTSTAMP:20260802T110000Z
SUMMARY:Topic 1\, Session 3 | Tensor Core
STATUS:CONFIRMED
CATEGORIES:AI INFRA,lecture,kernel
DTSTART:20260802T110000Z
DTEND:20260802T140000Z
DESCRIPTION:本讲以 Tensor Core 的硬件与编程模型为主线，贯
 穿 mma.sync（Ampere）、 wgmma（Hopper）和 tcgen05（Blackwell）三
 代指令的演进，从数据搬运与 发射带宽推导 Tensor Core 的
 设计逻辑，理解 fragment 布局以及使用 layout 与 swizzle 解
 决 bank conflict 的方法，最后以 FP8 fine-grained scaling 介绍低
 精度 Tensor Core 的使用。\n\nSession 3 演示文稿（PDF）: https:
 //ai-infra-website.leavelet.workers.dev/slides/session03.pdf\nSession 3 
 回放: https://www.bilibili.com/video/BV1LxM96eE43/
URL:https://ai-infra-website.leavelet.workers.dev/slides/session03.pdf
TRANSP:OPAQUE
END:VEVENT
BEGIN:VEVENT
UID:event-topic-1-session-04@ai-infra-seminars.lcpu.dev
DTSTAMP:20260809T113000Z
SUMMARY:Topic 1\, Session 4 | Pipeline Ordering: Data Orchestration
STATUS:TENTATIVE
CATEGORIES:AI INFRA,lecture,kernel
DTSTART:20260809T113000Z
DTEND:20260809T133000Z
DESCRIPTION:硬件发展过程中，计算能力、内存带宽提升的同
 时，频率提升稍显缓慢。 单个操作 latency 的改善已经远
 慢于系统 throughput 的增长，现代体 系结构从“降低 latenc
 y”逐渐转为越来越依赖于通过并行性容忍和隐藏 latency
 。 从指令并行 ILP，乱序执行 OoO，到内存层级并行 MLP、W
 arp 调度与 TLP， 追寻自动 latency hiding 的方法不断发展和
 演进，然而， 随着 Tensor Core 等专用计算单元的吞吐快速
 增长，计算与数 据供给能力之间的差距进一步扩大。以
  cp.async、TMA 为代表的异步数据搬运机制， 逐渐将原先
 很大程度由硬件自动完成的 latency hiding，暴露为程序员
 和编译器需 要显式组织的 Pipeline。更进一步的，我们甚
 至不再完全依赖通用的 Warp Scheduling 来自动隐藏延迟， 
 而是主动固定不同执行资源的职责，并显式安排工作的
 空间和时间结构。这些，都可以 算是 Pipeline Ordering: Data 
 Orchestration，即如何组织数据、处理计算。 在最新的硬件
 上，上述内容已成为发挥硬件极限性能、实现极致性能
 算子的关键核心与重中之重。 本节课，我们将在有限的
 时间内，对上述内容进行综合性的介绍。\n\nB站直播: http
 s://live.bilibili.com/22591408\nLCPU Live: https://live.lcpu.dev/\n\nSessi
 on 4 演示文稿（PDF）: https://ai-infra-website.leavelet.workers.dev/
 slides/session04.pdf\nSession 4 回放: https://www.bilibili.com/video/BV1
 NRuX6UEwJ
LOCATION:腾讯会议 · B站直播 · LCPU Live
URL:https://ai-infra-website.leavelet.workers.dev/slides/session04.pdf
TRANSP:OPAQUE
END:VEVENT
BEGIN:VEVENT
UID:event-topic-2-session-05@ai-infra-seminars.lcpu.dev
DTSTAMP:20260817T113000Z
SUMMARY:Topic 2\, Session 5 | Towards Modern Networking System
STATUS:CONFIRMED
CATEGORIES:AI INFRA,lecture,comm
DTSTART:20260817T113000Z
DTEND:20260817T133000Z
DESCRIPTION:随着计算量的不断增加，单个计算单元已无法满
 足更大的计算需求，这要求我们必须采用某些方式将计
 算单元连接起来。 历史上，总线、PCIe、TCP/IP、Ethernet 等
 ，都从不同方面不同层次对互联中关键的问题进行了回
 答。 AI 时代，为了承载 HPC/AI Workload 中大规模并行计算
 所需要的通信和互联，我们需要更大的带宽、更低的延
 迟、更高的可靠性， 迫使我们不断设计和改进网络系统
 。本节课，我们将从通信需求的产生开始，试图从第一
 性原理出发，逐步解释现代网络系统的组成与设计。 本
 次活动无课前阅读。\n\nLCPU Livestream: https://live.lcpu.dev/\n\n
 Session 5 演示文稿（PDF）: https://ai-infra-website.leavelet.workers
 .dev/slides/session05.pdf\nSession 5 回放: https://www.bilibili.com/vide
 o/BV1Xg836FE7G
LOCATION:腾讯会议 · 腾讯会议直播 · B站直播 · LCPU Livestrea
 m
URL:https://ai-infra-website.leavelet.workers.dev/slides/session05.pdf
TRANSP:OPAQUE
END:VEVENT
BEGIN:VEVENT
UID:event-topic-2-workshop-02@ai-infra-seminars.lcpu.dev
DTSTAMP:20260823T113000Z
SUMMARY:Topic 2\, Workshop 2 | AI Communication Stack
STATUS:CONFIRMED
CATEGORIES:AI INFRA,workshop,comm
DTSTART:20260823T113000Z
DTEND:20260823T133000Z
DESCRIPTION:Pipeline 背后真正的问题是：谁来决定什么工作在
 什么时候、在哪个资源上执行？谁负责维护依赖、推进
 执行，并判断一个阶段何时真正完成？ 这其中涉及到一
 组连续的设计 trade-off：硬件与软件的责任划分、编程复
 杂度与硬件复杂度、静态与动态调度、显式控制与自动
 管理、 灵活性与可预测性，以及细粒度重叠带来的性能
 收益与状态和同步开销。在单 GPU 内部，这些责任可以由
  Compiler、Warp Scheduler、 Scoreboard、Pipeline、Barrier、Copy Engin
 e 和 Memory Hierarchy 共同承担。我们关注数据如何在 Register
 、Shared Mem、片上专用存储和 HBM 之间流动并保证计算正
 确推进。 今天，我们把同一个问题扩展到 GPU-to-GPU 高速
 互联。此时数据的 Producer 和 Consumer 不再位于同一块 GPU 
 上，数据可能需要跨越 GPU Fabric、 NVLink / NVSwitch、PCIe、RN
 IC、RDMA Transport 和交换网络。原本局限在单 GPU 内部的 Rea
 diness、Ordering、Completion 和 Visibility， 现在必须跨越不同
 的设备、地址域、队列、协议乃至故障域继续成立。我
 们今天讨论这些状态和控制责任应该放在哪里，并介绍 W
 orkload 中对通信的要求以及工业界一些经典的解决方案。
  本次活动无课前阅读。\n\nB站直播: https://live.bilibili.com/2
 2591408\nLCPU Live: https://live.lcpu.dev/\n\nWorkshop 2 演示文稿（PD
 F）: https://ai-infra-website.leavelet.workers.dev/slides/workshop02.pdf
LOCATION:腾讯会议 · B站直播 · LCPU Live
URL:https://ai-infra-website.leavelet.workers.dev/slides/workshop02.pdf
TRANSP:OPAQUE
END:VEVENT
BEGIN:VEVENT
UID:assignment-A01@ai-infra-seminars.lcpu.dev
DTSTAMP:20260808T155900Z
SUMMARY:[DDL] A01 · Assignment 01 · GPU 与 GPU 编程
STATUS:CONFIRMED
CATEGORIES:AI INFRA,ASSIGNMENT,DEADLINE
DTSTART:20260808T155900Z
DURATION:PT15M
URL:https://github.com/lcpu-club/wmhpc-training-camp-x-lcpu-ai-infra-semina
 rs/blob/main/assignment01/README.md
TRANSP:TRANSPARENT
END:VEVENT
BEGIN:VEVENT
UID:assignment-A02@ai-infra-seminars.lcpu.dev
DTSTAMP:20260829T155900Z
SUMMARY:[DDL] A02 · Assignment 02 · Tensor Core 与 Pipeline
STATUS:CONFIRMED
CATEGORIES:AI INFRA,ASSIGNMENT,DEADLINE
DTSTART:20260829T155900Z
DURATION:PT15M
URL:https://github.com/lcpu-club/wmhpc-training-camp-x-lcpu-ai-infra-semina
 rs/blob/main/assignment02/README.md
TRANSP:TRANSPARENT
END:VEVENT
END:VCALENDAR
