人工智能学院 · 课程讲义
并行计算与算子编程
Parallel Computing and Operator Programming
理解并行的思想,掌握 GPU 的语言。
从 CUDA 编程基础出发,走向现代 AI 算子的设计与优化。
关于这门课
ABOUT THIS COURSE模型中的一次矩阵乘法,如何变成 GPU 上高效执行的程序?这门课从并行计算的基本概念与性能模型出发,逐步介绍 CUDA、内存层次、Tensor Core 与异步流水线,并以 FlashAttention 和 3D Gaussian Splatting 为案例,连接算法、硬件与系统。
一份讲义,两种打开方式
连续阅读梳理知识脉络,逐页浏览图示、实验与问答,也可以从目录跳转到需要复习的主题。
已公开讲义
AVAILABLE LECTURES从并行思维到真实算子,一步步理解性能从何而来。
当前公开第一讲与第二讲,可通过阅读模式复习,也可逐页查看课堂中的图示与讨论。
课程考核
LEARN BY BUILDING以个人形式阅读、复现或改进并行计算与 AI 算子相关论文,也可以选择任意领域的论文,运用并行计算提升其中算法或系统的运行效率。通过实验与讨论形成自己的理解。
个人 Presentation50%
方法解读、复现结果或改进方案展示
课程 Report50%
实现过程、实验结果与性能分析报告
参考资料
READ FURTHERStanford CS149Parallel Computing · 并行思想与性能模型
CUDA 编程:基础与实践樊哲勇 · CUDA 入门与实践参考教材
Modern GPU Programming for MLSys现代 GPU 架构与高性能算子编程