跳到正文

Session 2.2 FP32 GEMM Quick Walkthrough

回放:2.2-FP32 GEMM Quick Walkthrough主讲:周宇轩

矩阵乘法 (GEMM)

计算C=A×B,ARM×K,BRK×N,CRM×N

我们如何计算这样的矩阵乘法呢?按照并行计算的思路,我们需要拆分计算和数据。我们需要使用数据并行的思路进行数据拆分,把数据拆分到 thread 尺度。

在传统的深度学习中,我们一般使用 FP16 甚至 FP8 这类低精度的运算,但是科学计算中,仍然会涉及到32位精度浮点数的矩阵乘法。这时我们没有办法使用矩阵运算的专用硬件 tensor core,需要自己设计一个并行化的 kernel。