课程目录

基础设施

GPU计算

GPU计算是AI训练和推理的主力算力形态。它通过大规模并行核心、高带宽显存和成熟软件生态,把矩阵乘法、卷积和Attention等AI算子高效执行。

核心要点

  • 并行计算:GPU用大量核心同时处理矩阵和张量运算,适合深度学习中的高吞吐计算
  • CUDA生态:NVIDIA CUDA、cuDNN、TensorRT和NCCL构成从训练到推理的主流软件栈
  • 显存瓶颈:HBM容量和带宽决定可训练模型规模、batch size与推理吞吐
  • 通信瓶颈:多卡训练依赖NVLink、PCIe、InfiniBand/RDMA和集合通信库
  • 推理优化:量化、KV Cache、Flash Attention、TensorRT/vLLM能显著提升吞吐与降低延迟

关联知识