Pixiv - おむたつ/omutatsu
张量并行详解
Tensor Parallelism 的本质是把一个”大矩阵运算”切到多个 GPU 上,让每张 GPU 只保存和计算矩阵的一部分,最后通过通信把结果拼起来。
GQA 详解
GQA 来源于论文 GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints,是一种注意力机制变体。
模型量化
模型量化就是利用低精度的数据类型表示模型中的权重、激活以及 KV Cache,从而降低显存占用、减少内存带宽需求,并利用低精度 Tensor Core 提高推理吞吐。
CUDA 算子优化:Transpose
Transpose 即矩阵转置。它几乎没有计算量,性能主要取决于内存访问效率,因此是理解 CUDA Global Memory 合并访问和 Shared Memory Bank Conflict 的经典算子。
CUDA 算子优化:GEMM
GEMM(General Matrix Multiplication)是深度学习中最核心的计算模式之一。
Transformer 中的 Linear、Attention 投影以及 MLP 层,本质上都可以归结为矩阵乘法。
因此,GPU 对 GEMM 的优化能力直接决定了 AI 训练和推理性能。