人工智能学院 · 课程讲义

并行计算与算子编程

Parallel Computing and Operator Programming

理解并行的思想,掌握 GPU 的语言。
从 CUDA 编程基础出发,走向现代 AI 算子的设计与优化。

关于这门课

ABOUT THIS COURSE

模型中的一次矩阵乘法,如何变成 GPU 上高效执行的程序?这门课从并行计算的基本概念与性能模型出发,逐步介绍 CUDA、内存层次、Tensor Core 与异步流水线,并以 FlashAttention 和 3D Gaussian Splatting 为案例,连接算法、硬件与系统。

一份讲义,两种打开方式

连续阅读梳理知识脉络,逐页浏览图示、实验与问答,也可以从目录跳转到需要复习的主题。

已公开讲义

AVAILABLE LECTURES

从并行思维到真实算子,一步步理解性能从何而来。

PART 01 01–02

理解并行计算

从问题分解出发,建立分析并行性能的直觉。

当前公开第一讲与第二讲,可通过阅读模式复习,也可逐页查看课堂中的图示与讨论。

课程考核

LEARN BY BUILDING

以个人形式阅读、复现或改进并行计算与 AI 算子相关论文,也可以选择任意领域的论文,运用并行计算提升其中算法或系统的运行效率。通过实验与讨论形成自己的理解。

个人 Presentation50%

方法解读、复现结果或改进方案展示

课程 Report50%

实现过程、实验结果与性能分析报告

参考资料

READ FURTHER