张量并行详解
Tensor Parallelism 的本质是把一个”大矩阵运算”切到多个 GPU 上,让每张 GPU 只保存和计算矩阵的一部分,最后通过通信把结果拼起来。
GQA 详解
GQA 来源于论文 GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints,是一种注意力机制变体。
Nano-vLLM 环境搭建
比较少的人去讲 nano-vllm 的环境搭建,这里简单记录一下:
模型量化
模型量化就是利用低精度的数据类型表示模型中的权重、激活以及 KV Cache,从而降低显存占用、减少内存带宽需求,并利用低精度 Tensor Core 提高推理吞吐。
FlashAttention
在介绍 FlashAttention 之前,先统一本文使用的符号。
CUDA 算子优化:Transpose
Transpose 即矩阵转置。它几乎没有计算量,性能主要取决于内存访问效率,因此是理解 CUDA Global Memory 合并访问和 Shared Memory Bank Conflict 的经典算子。
CUDA 算子优化:GEMM
GEMM(General Matrix Multiplication)是深度学习中最核心的计算模式之一。 Transformer 中的 Linear、Attention 投影以及 MLP 层,本质上都可以归结为矩阵乘法。 因此,GPU 对 GEMM 的优化能力直接决定了 AI 训练和推理性能。
北邮研究生课程《最优化理论与算法》知识总结 - Part 1
本章是单纯形法的理论基础,核心建立“几何极点 \leftrightarrow 代数基本可行解”的等价关系。
北邮研究生课程《算法设计与分析》知识总结 - Part 1
针对同一问题规模N,输入集合D_N:
北邮研究生课程《算法设计与分析》知识总结 - Part 2
根据活结点处理顺序分为两类,优先队列式是考试重点。
Profile Image of the Author
Ming
你是来找 Ming 学习的吗
🎉 欢迎来到 Ming 的博客
这里是我的个人博客,分享 AI Infra、LLM 等技术内容。欢迎关注交流!
分类
标签
站点统计
文章
19
分类
8
标签
16
总字数
55,114
运行时长
0
最后活动
0 天前

目录