01

LEARNING PATH

学习主线

算子与 AI 编译器Triton / CUDATriton 算子实践Nsight Compute 优化MLIR / LLVM LoweringPass 与 IR DiffLowering 优化
02

BEFORE YOU START

课程使用说明

高校使用要求

高校需提供 1 个教师的 GitHub 账号 ID 和真实姓名,用于下载实验环境与每节课的课后练习题。下载完成后,将代码及习题拷贝给学生。

查看配套镜像

考核安排

完成所有课程后,按实践练习的“提交清单”要求提交相关材料至 riscv-ai@bosc.ac.cn。我们将组织专家答辩评审,并确定是否通过。

03

DAY 1–7

课程学习安排

DAY 4

算子优化;Nsight Compute 性能分析

  1. 1

    高性能 Kernel:从瓶颈判断到 Triton Softmax 优化(视频|Stanford CS336 中文字幕|约 80 分钟)

  2. 2

    NVIDIA Nsight Compute:Kernel 级性能分析入门(视频课程页|NVIDIA 官方)

  3. 3

    ncu CLI:采集、筛选 Kernel 与导出报告(视频|NVIDIA 官方课程搬运 P31)

04

DAY 8–10

实践练习

DAY 8–10

实践练习与提交

完成实践作业,并按照作业文档中的“提交清单”整理材料,发送至指定邮箱参加答辩评审。

查看实践作业