
每日论文速读解决的是广度——今天世界上发生了什么。但读论文有个前提:你得先看得懂。
这里是另一条线:把视觉生成的底层零件一个个拆开讲透。每篇都给数学推导 + 能跑的代码 + 经典论文出处,并标注前置知识,你可以顺着依赖链一路读下来。
当前规划 38 个知识点,已发布 33 篇。
图例:● 已发布 · ◍ 已发布待更新 · ◐ 正在写 · ○ 计划中
概率、变分推断、随机微分方程——读懂扩散模型公式的最小前置集合。
● 变分下界与重参数化(ELBO) · 难度:入门前置
不理解 ELBO 就没法理解 VAE 的 KL 项为什么要加权,也没法理解扩散模型的训练目标从哪来。
● 扩散过程的前向与反向推导(SDE) · 难度:入门前置 · 前置:ELBO
把 DDPM 的离散公式和 SDE 的连续视角对上,后面所有采样器的差异都能一句话解释。
注意力、位置编码、稀疏激活与循环记忆——视频生成里最吃显存、最难外推也最影响长程建模的部件。
● 自注意力机制的计算与显存账本(MHA) · 难度:核心必修
先把 O(N²) 的常数项算清楚,才能判断后面各种稀疏/线性方案到底省在哪一项。
● 旋转位置编码 RoPE 的原理与实现(RoPE) · 难度:核心必修 · 前置:MHA
许多现代视频 DiT 使用 RoPE;理解旋转和相对位置性质,才能区分坐标可计算与生成质量可外推。
● FlashAttention 为什么不需要存下注意力矩阵(FlashAttn) · 难度:进阶 · 前置:MHA
online softmax 这一个技巧撑起了整个长序列时代,值得把递推式一步步推一遍。
● 视频 DiT 里的 3D RoPE 与分辨率外推(3D-RoPE) · 难度:进阶 · 前置:RoPE
换分辨率或帧数时,3D RoPE 的坐标、频率与轴分配是需排查的因素之一,还要检查训练分布、VAE 与注意力实现。
● 混合专家 MoE:稀疏激活怎么省算力(MoE) · 难度:工程实战 · 前置:MHA
统一多模态模型开始普遍用 MoE 扛参数量,但路由不均衡带来的训练不稳定很少被讲清楚。
○ 线性、循环与记忆架构(LinearMem) · 难度:前沿 · 前置:MHA
长序列架构正在从保存完整注意力矩阵转向可更新状态和深度循环;把复杂度、记忆容量与并行性放进同一框架,才能判断它们何时真能替代 Softmax Attention。
○ 视频生成里的稀疏注意力(SparseAttn) · 难度:前沿 · 前置:FlashAttn、3D-RoPE
视频长序列的全注意力成本很高;稀疏化可以减少计算,但免训练部署的质量取舍需和精确 IO 优化、缓存等方案比较。
从 DDPM 到流匹配,以及把 50 步压到 4 步的蒸馏路线。
● DDPM 训练目标与采样流程(DDPM) · 难度:核心必修 · 前置:SDE
DDPM 是理解扩散模型的重要起点;先读懂其 loss 与采样循环,再比较其他生成路径和训练目标。
● 分类器无关引导 CFG 的代价与调法(CFG) · 难度:核心必修 · 前置:DDPM
CFG 让每步算两遍,是推理成本里最容易被忽视的 2×,也是蒸馏首先要干掉的对象。
● 从 DDIM 到高阶采样器(DDIM) · 难度:进阶 · 前置:DDPM
采样器换一个、缓存策略就得重调——这是推理加速最常见的踩坑点。
● 流匹配与 Rectified Flow(FlowMatching) · 难度:进阶 · 前置:SDE、DDPM
流匹配被许多近期生成模型采用;它与 DDPM 的概率路径、监督目标及采样方式值得系统比较。
● 潜空间扩散与 Stable Diffusion 架构(LDM) · 难度:进阶 · 前置:DDPM、VAE
把扩散搬进潜空间这一步,直接决定了今天视觉生成的算力可行性。
● DiT:用 Transformer 替掉 UNet(DiT) · 难度:进阶 · 前置:LDM、MHA
adaLN-Zero 这个小设计是 DiT 能稳定训起来的关键,值得逐行对照公式看。
● 自回归视频生成与 Forcing 范式(Forcing) · 难度:工程实战 · 前置:DDPM、DiT
双向扩散没法流式出帧,Forcing 系列是把视频生成变成可交互的关键一步,也是当下最活跃的范式。
○ 少步蒸馏:从 50 步到 4 步(Distill) · 难度:前沿 · 前置:DDIM、CFG
蒸馏是过去两年推理加速收益最大的一条线,也是最容易把质量搞崩的一条。
○ 世界模型:从视频生成到可交互环境(WorldModel) · 难度:前沿 · 前置:Forcing
视频生成正在从「出片」转向「可交互环境」,这是范式转变而不是又一个 SOTA 分数。
VAE / Tokenizer——视频生成的「地基」,决定了上限和伪影形态。
● VAE 结构与训练目标(VAE) · 难度:核心必修 · 前置:ELBO
潜空间扩散依赖编码器输出的统计尺度;像素空间扩散不使用 VAE,不能将 scaling_factor 推广到所有扩散模型。
● 离散化表征:VQ-VAE 与 VQGAN(VQGAN) · 难度:进阶 · 前置:VAE
离散自回归视觉模型依赖 tokenizer,码本利用率是重要问题;连续潜变量自回归路线不适用这一前提。
● 视频 VAE 的时空压缩结构(VideoVAE) · 难度:工程实战 · 前置:VAE
时间维压缩比和因果卷积的实现方式,直接决定了长视频能不能逐块解码而不接缝。
● 视频 VAE 的常见 loss 组合(VAELoss) · 难度:工程实战 · 前置:VideoVAE
L1 + KL + LPIPS + GAN 四项的权重配比是玄学重灾区,把每项在管什么讲透很有价值。
从 PPO 到 GRPO,以及怎么把 RL 用到扩散和视频生成上。
● 策略梯度与 PPO 基础(PPO) · 难度:核心必修
PPO 是在线策略优化的重要基础;掌握优势估计和裁剪后,再区分 GRPO 与直接偏好优化等不同路线。
● 从 DPO 到 GRPO:去掉价值网络(GRPO) · 难度:进阶 · 前置:PPO
GRPO 用组内相对奖励省去 critic;净成本还取决于组采样、参考模型、奖励评估和显存,不能统一声称降低一个量级。
● 把 RL 用到扩散模型上(DiffusionRL) · 难度:前沿 · 前置:GRPO、DDIM
把多步去噪当成一条 MDP 轨迹,是理解视频 RL 各种做法的统一视角。
● 视频生成中的强化学习与奖励模型(VideoRL) · 难度:前沿 · 前置:DiffusionRL、FlowMatching
视频的奖励要同时管画质、运动和指令遵循,reward hacking 在这里表现得最明显。
参数、数据、序列三个维度怎么切,以及切完之后通信量变成多少。
● 数据并行与 ZeRO 显存切分(ZeRO) · 难度:进阶
先把「参数 + 梯度 + 优化器状态」的显存账算清楚,才知道该切哪一部分。
● 混合精度与数值稳定性(AMP) · 难度:进阶
BF16、FP16 与 FP8 的范围、精度和缩放机制不同,排查异常时要区分前向溢出、梯度下溢与舍入误差。
● 张量并行与流水线并行(TP-PP) · 难度:工程实战 · 前置:ZeRO
TP 的通信量和 PP 的气泡率都能手算,算完就知道并行度该怎么配。
● 序列并行与 Ring Attention(SP) · 难度:前沿 · 前置:TP-PP、FlashAttn
超长视频序列可能需要序列或上下文并行;是否值得使用取决于单卡容量、通信和计算重叠。
先用性能模型定位算力、带宽和显存瓶颈,再用缓存、稀疏、量化与算子融合把生成时间从分钟压到秒。
● 性能建模与 Profiling:算力、带宽与显存账本(Roofline) · 难度:进阶 · 前置:AMP
不先判断算力、带宽还是显存容量在卡住系统,量化、融合、缓存很容易做成负优化;这篇提供所有推理优化节点共同的测量方法。
● KV Cache 与自回归视频生成(KVCache) · 难度:进阶 · 前置:MHA、Roofline
自回归视频模型正在把 LLM 的这套缓存工程整体搬过来,值得先打好底。
● 算子融合与 CUDA Graph(Fusion) · 难度:工程实战 · 前置:MHA、Roofline
小算子多的模型往往卡在访存和 launch 开销上,融合的收益比换算法更确定。
● 量化:从 INT8 到 FP4(Quant) · 难度:工程实战 · 前置:AMP、Roofline
激活里的离群值是量化掉点的主因,SmoothQuant 的迁移技巧值得逐步推演一遍。
● 扩散模型的跨步缓存复用(DiffCache) · 难度:前沿 · 前置:DDIM、DiT、Roofline
相邻去噪步的特征高度相似,这是免训练加速里性价比最高的一类手段。
FID/CLIP/VBench 各自测的是什么,以及它们什么时候会骗人。
● FID / CLIP Score 到底测了什么(FID) · 难度:核心必修
FID 对样本量和预处理极其敏感,不同论文的数字经常根本不可比。
○ 视频生成评测:VBench 与人工验收(VBench) · 难度:进阶 · 前置:FID
加速类工作最爱报 VBench 总分不变,但分维度看往往能发现明显退化。
● 音频质量评测:MOS、PESQ 与 FAD 各测什么(AudioEval) · 难度:工程实战
音视频生成里音频质量几乎全靠几个数字说话,但这些数字测的根本不是一回事:SI-SDR 只管波形对齐、PESQ 只为通信语音设计、FAD 看的是分布而不是单条样本的保真度。选错指标会得到自欺欺人的结论——比如用波形指标验收 codec,数字很好听但高频毛刺全在。
最后更新:2026-10-05 12:40
评论 (0)