人工智能炼丹君 整理 | 2026年5月2日(周六)
覆盖时间:2025年5月 — 2026年4月
本期 AIGC 周末专题聚焦稀疏注意力在视频生成中的应用:从免训练加速到可训练融合方向,精选 10 篇代表性论文进行深度解读。
方向分布:
含 ICLR 2026 Oral × 1, ICLR 2026 × 1, NeurIPS 2025 × 1, AAAI 2026 × 1, ICCV 2025 × 1
描述:Sparse Attention 从 LLM 领域迁移到视频 DiT,研究者发现 3D 全注意力中天然存在的稀疏性。
关键节点:
描述:Sparse VideoGen 系列开创免训练框架,系统性利用 3D 全注意力天然稀疏性。
关键节点:
描述:VSA 首次证明可训练稀疏注意力可在预训练阶段全程替代全注意力。
关键节点:
描述:SLA(ICLR 2026 Oral)确立稀疏+线性融合范式,SALAD 和 VMonarch 从不同角度验证。
关键节点:
描述:SLA2 将加速比推向 18.6x,SVG-EAR 刷新免训练帕累托前沿,Light Forcing 开辟 AR 方向。
关键节点:
论文: SLA
arXiv: 2509.24006
机构: 清华大学, UC Berkeley
核心问题: 视频DiT中全注意力O(N²)复杂度导致推理延迟极高
注意力权重可分为两部分:少量大权重(高秩)和大量小权重(低秩)。这天然暗示:对大权重用稀疏注意力(O(N²)但只算少量),对小权重用线性注意力(O(N))。现有方法要么纯稀疏(丢失低秩信息)要么纯线性(无法捕捉局部关键依赖),SLA首次将两者系统融合。
前序工作及局限:
与前序工作的本质区别: SLA首次系统性融合稀疏+线性注意力,通过三级分类+自定义GPU kernel实现最优分配
SLA的核心设计:\n\n(1) 三级分类:将注意力权重按大小分为Critical(精确计算)、Marginal(线性注意力近似)、Negligible(跳过)三个级别。\n\n(2) 融合GPU Kernel:将稀疏注意力和线性注意力的前向/反向计算融合到单个自定义GPU kernel中,消除额外显存开销和kernel launch延迟。\n\n(3) 轻量微调:仅需少量步即可在目标视频DiT模型上完成适配。
优势:ICLR 2026 Oral验证了方法的学术价值;自定义kernel可直接工业落地;2.2x E2E加速是质量无损方法的最优数字。局限:目前仅在1.3B模型上验证,14B+模型效果未知;kernel需针对不同硬件调优。
技术演进定位: 稀疏-线性融合范式的奠基工作(ICLR 2026 Oral)
可能的后续方向:
论文: SLA2
arXiv: 2602.12675
机构: 清华大学, UC Berkeley
核心问题: SLA固定分类边界无法适应动态变化,且未利用量化压缩空间
SLA采用固定的三级分类边界,无法适应不同层/头/时间步的动态变化。SLA2提出:能否让模型自己学习最优的稀疏-线性分配比例?同时,SLA未利用量化技术进一步压缩计算,存在额外压缩空间。
前序工作及局限:
与前序工作的本质区别: SLA2引入可学习路由器实现层级自适应+QAT进一步压缩,将加速比从13.7x提升到18.6x
SLA2的核心改进:\n\n(1) 可学习路由器:每层每头配备轻量路由网络,动态预测每个注意力块应使用稀疏、线性还是跳过策略。\n\n(2) 改进注意力公式:重新设计稀疏+线性混合公式,更好地贴合原始SLA的分解动机,减少近似误差。\n\n(3) 量化感知训练(QAT):联合训练路由器和量化参数,在INT4/INT8精度下保持质量。
优势:在SLA基础上进一步将加速比提升35%,可学习路由实现层级自适应。局限:需要训练路由器(非免训练);QAT引入额外训练复杂性。
技术演进定位: SLA范式的极致推进
可能的后续方向:
论文: SVG-EAR
arXiv: 2603.08982
机构: UC Berkeley
核心问题: 免训练稀疏注意力丢弃块后信息损失且传统路由不精确
现有稀疏注意力面临两难:直接丢弃被跳过块会丢失信息;用学习型预测器近似又引入训练开销和分布偏移。SVG-EAR提出关键洞察:经过语义聚类后,同一块内的key/value具有高度相似性,可用少量聚类质心准确概括。
前序工作及局限:
与前序工作的本质区别: SVG-EAR用聚类质心无参数恢复被跳过块+误差感知路由替代传统注意力分数路由
SVG-EAR的核心设计:\n\n(1) 聚类质心补偿:对被跳过的注意力块,用key/value的聚类质心做线性(O(N))近似,恢复其对输出的贡献。\n\n(2) 误差感知路由:不按注意力分数选择块,而是用轻量探测器估计每个块的补偿误差,选择'误差-成本比'最高的块做精确计算。\n\n(3) 理论保证:提供注意力重建误差与聚类质量之间的理论上界。
优势:免训练、有理论保证、误差感知路由思路优雅。局限:聚类质心计算本身有开销;PSNR不是视频生成的最佳指标;加速上限受限于免训练范式。
技术演进定位: 免训练稀疏注意力的帕累托前沿
可能的后续方向:
论文: VSA
arXiv: 2505.13389
机构: UC Berkeley, FastVideo
核心问题: 稀疏注意力仅用于推理,训练仍需全注意力导致训练-推理不一致
现有稀疏注意力主要用于推理加速,训练仍需全注意力。这导致训练-推理不一致和训练成本居高不下。VSA提出核心问题:能否设计一种从训练到推理全程使用的稀疏注意力,彻底替代全注意力?
前序工作及局限:
与前序工作的本质区别: VSA首次证明可训练稀疏注意力可从预训练阶段全程替代全注意力
VSA采用层次化两阶段设计:\n\n(1) 粗粒度阶段:将token序列划分为3D cubes并池化为粗粒度表示,用低成本全注意力预测每个cube的重要性分数,选出关键token区域。\n\n(2) 细粒度阶段:仅在预测的关键区域执行token级精确注意力,形成块稀疏计算模式。\n\n(3) 硬件对齐:cube大小和块大小均对齐GPU的执行粒度,最大化并行效率。
优势:训练+推理双加速是独特卖点;硬件对齐设计实用性强;NeurIPS 2025验证了学术质量。局限:粗粒度预测可能丢失细粒度关键信息;需要从头预训练或大量微调。
技术演进定位: 训练范式变革的先驱(NeurIPS 2025)
可能的后续方向:
论文: Sparse-vDiT
arXiv: 2506.03065
机构: 多机构合作
核心问题: 统一稀疏策略未充分利用视频DiT注意力图的结构特征
此前的稀疏注意力方法大多采用统一的稀疏策略(如Top-K或块级稀疏),未充分利用视频DiT注意力图的结构特征。Sparse-vDiT通过详细分析注意力图,发现三种反复出现的稀疏模式,并为每种模式定制高效计算方案。
前序工作及局限:
与前序工作的本质区别: Sparse-vDiT系统识别三种稀疏Pattern并为每种设计专用kernel
Sparse-vDiT的核心设计:\n\n(1) 稀疏模式识别:通过统计分析发现视频DiT注意力图中三种主导模式——对角线(diagonal)反映时间邻近性、多对角线(multi-diagonal)反映空间局部性、竖条纹(vertical-stripe)反映全局anchor token。\n\n(2) Pattern-Optimized Sparse Kernels:为每种模式设计专用的CUDA kernel,将稠密注意力替换为结构化稀疏计算。\n\n(3) 自适应模式选择:根据每层每头的注意力分布自动选择最匹配的稀疏模式。
优势:对注意力图的结构化分析深入,三种模式的识别有启发性;定制kernel实现到位。局限:固定的三种模式可能无法覆盖所有场景;模式选择的开销需考虑。
技术演进定位: Pattern-aware稀疏注意力的开拓者(AAAI 2026)
可能的后续方向:
论文: SALAD
arXiv: 2601.16515
机构: 清华大学, 腾讯
核心问题: 免训练稀疏度受限于50-70%,而训练型方法计算成本高
免训练稀疏注意力受限于有限的稀疏度(通常50-70%),突破稀疏度上限需要训练。但训练型方法通常需要大量数据和计算。SALAD提出:能否用极轻量的微调达到极高稀疏度?
前序工作及局限:
与前序工作的本质区别: SALAD用极轻量微调(2000样本)在稀疏注意力旁添加线性分支达到90%稀疏度
SALAD的核心设计:\n\n(1) 双分支并行:在原始稀疏注意力旁边添加一个轻量线性注意力分支,线性分支负责捕捉被稀疏注意力丢弃的低秩信息。\n\n(2) 输入依赖门控:用可学习门控机制根据输入内容动态调节两个分支的贡献权重。\n\n(3) 极轻量微调:仅新增线性注意力层和门控网络的参数,用2000个视频样本1600步即可完成训练。
优势:微调效率极高(2000样本),工程门槛低;门控机制优雅。局限:1.72x加速低于SLA的2.2x;线性注意力的表达能力有限。
技术演进定位: 工程门槛最低的稀疏-线性融合方案
可能的后续方向:
论文: VMonarch
arXiv: 2601.22275
机构: 南京大学, 腾讯
核心问题: 现有稀疏方法缺乏数学最优性保证
视频DiT的注意力模式天然具有高度稀疏的时空结构,但现有稀疏方法(Top-K/局部窗口)要么不灵活要么丢失全局信息。VMonarch发现Monarch矩阵——一类具有灵活稀疏性的结构化矩阵——可以优雅地表示这些模式。
前序工作及局限:
与前序工作的本质区别: VMonarch首次将Monarch矩阵引入视频DiT,提供时空注意力的数学最优分解
VMonarch的核心设计:\n\n(1) 时空Monarch分解:将全注意力矩阵分解为帧内(空间)和帧间(时间)两组Monarch因子,分别捕捉空间和时间相关性。\n\n(2) 交替最小化:通过交替优化两组因子来逼近原始全注意力,配合重计算策略解决收敛不稳定问题。\n\n(3) 在线熵算法:融入FlashAttention的在线计算范式,使Monarch矩阵更新在长序列上高效可行。
优势:数学上最优雅的方案;FlashAttention兼容;理论深度最强。局限:交替最小化收敛依赖初始化;实际wall-clock加速(5x)远小于理论FLOPs减少(17.5x),存在实现瓶颈。
技术演进定位: 理论深度最强的结构化注意力方案
可能的后续方向:
论文: Light Forcing
arXiv: 2602.04789
机构: 多机构合作
核心问题: 现有稀疏注意力面向双向扩散模型,忽视自回归视频生成的因果特性
现有稀疏注意力主要面向双向扩散模型(如Wan/HunyuanVideo),而自回归视频扩散模型(如GameGen/Oasis/CogVideoX-AR)的因果结构与双向模型截然不同。Light Forcing首次为AR视频扩散定制稀疏注意力方案。
前序工作及局限:
与前序工作的本质区别: Light Forcing首次为AR视频扩散定制Chunk-Aware Growth稀疏注意力
Light Forcing的核心设计:\n\n(1) AR注意力模式分析:发现AR视频扩散中注意力呈现因果增长的独特模式——新生成帧主要关注临近帧和关键锚帧。\n\n(2) Chunk-Aware Growth机制:将视频序列划分为因果chunk,稀疏注意力范围随chunk增长动态扩展,保持对历史的选择性回顾。\n\n(3) 锚帧保留策略:自动识别并保留关键参考帧的全注意力计算,确保长程一致性。
优势:AR视频生成方向的首个稀疏注意力方案,填补空白;Chunk-Aware Growth设计与AR范式天然匹配。局限:AR视频生成模型本身尚未成为主流;方法可推广性受限于AR架构。
技术演进定位: AR视频生成稀疏加速的开创者
可能的后续方向:
论文: CalibAtt
arXiv: 2603.05503
机构: 以色列理工
核心问题: 免训练方法需要在线动态判断token重要性,开销大
已有稀疏注意力方法要么需要训练,要么在线动态判断token重要性(开销大)。CalibAtt发现核心洞察:稀疏模式在不同输入上惊人地稳定,可以离线一次校准、在线直接复用。
前序工作及局限:
与前序工作的本质区别: CalibAtt发现稀疏模式跨输入稳定,可离线固定复用
CalibAtt采用两阶段策略:\n\n(1) 离线校准阶段:在少量参考视频上运行全注意力,统计每一层、每个头、每个扩散时间步的块级稀疏模式和重复模式。\n\n(2) 模式编译:将稳定的稀疏模式编译为优化的注意力操作(类似JIT编译)。\n\n(3) 在线推理:只计算被选中的输入相关连接,以硬件友好方式跳过未选中连接。
优势:完全免训练、直接即插即用;离线校准成本低;硬件友好。局限:1.58x加速比在近期方法中不突出;对新架构需重新校准;块级粒度可能丢失细粒度信息。
技术演进定位: 离线校准范式的开创者
可能的后续方向:
论文: AdaSpa
arXiv: 2502.21079
机构: 字节跳动, 北京大学
核心问题: 动态模式和在线搜索难以兼顾,现有方法牺牲其一
现有免训练稀疏方法要么用固定模式(无法适应动态变化),要么在线搜索开销大。AdaSpa提出:能否将动态模式与在线精确搜索结合,实现既准确又高效的自适应稀疏注意力?
前序工作及局限:
与前序工作的本质区别: AdaSpa利用FlashAttention的LSE副产品零开销实现在线精确搜索
AdaSpa的核心设计:\n\n(1) 块化模式(Blockified Pattern):将注意力矩阵划分为层次化block结构,高效表示DiT中的多尺度稀疏性。\n\n(2) LSE缓存搜索:利用FlashAttention计算过程中的LogSumExp副产品作为block重要性信号,零额外开销精确定位关键token区域。\n\n(3) 自适应稀疏决策:根据每步动态计算的重要性信号决定哪些block需要精确计算,实现自适应稀疏。
优势:LSE缓存搜索零开销,设计极其优雅;免训练免数据实用性最强。局限:依赖FlashAttention实现,对其他注意力实现不通用。
技术演进定位: 免训练免数据方案的最优解(ICCV 2025)
可能的后续方向:
Sparse VideoGen: Accelerating Video Diffusion Transformers with Inherent Sparsity | UC Berkeley | arXiv:2502.01776
关键词: 免训练, 空间/时间稀疏, 3D全注意力, 系列开山作
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 首个系统性利用3D全注意力天然稀疏性的免训练加速框架,在线3%样本分析识别空间/时间稀疏模式
效果: 在Wan/HunyuanVideo/Mochi上实现高效免训练加速,开创Sparse VideoGen系列
Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Clustering | UC Berkeley | arXiv:2505.18875
关键词: 语义聚类, K-Means, 空间/时间稀疏, SVG系列第二代
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 基于K-Means语义聚类的稀疏注意力加速,自动发现空间和时间两种稀疏模式并分别优化
效果: 在SVG基础上进一步提升加速比,聚类质量直接影响加速效果
Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention | 多机构合作 | arXiv:2602.01801
关键词: KV缓存压缩, 自回归, 世界模型, AnnCA
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 面向自回归视频扩散的时间KV缓存压缩+稀疏注意力联合加速,AnnCA近似近邻注意力
效果: 长视频流式生成效率大幅提升,支持视频世界模型
SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion Transformer | 多机构合作 | arXiv:2603.07057
关键词: 敏感度建模, 动态规划, 缓存+剪枝, 统一框架
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 敏感度导向的缓存+剪枝统一框架,通过动态规划求解最优缓存时间点
效果: 在DiT-XL/PixArt-α/OpenSora上实现SOTA保真度-加速比权衡
Less is Enough: Training-Free Video Diffusion Acceleration via Adaptive Caching | 多机构合作 | arXiv:2507.03065
关键词: 免训练, 自适应缓存, 可叠加, 3x加速
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 无需训练的自适应缓存加速,运行时自适应决策何时复用何时重算,与SVG稀疏注意力可叠加
效果: SVG+EasyCache在HunyuanVideo上实现3x以上加速
FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality | 多机构合作 | ICLR 2026
关键词: 免训练缓存, 时间步复用, ICLR 2026, 全自注意力
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 免训练视频扩散缓存加速,利用全自注意力层的时间步相关性进行特征复用
效果: 在CogVideoX/Vchitect 2.0/Mochi上实现高质量免训练加速
FastLightGen: Fast and Light Video Generation with Fewer Steps and Parameters | 香港科技大学(广州) | arXiv:2603.01685
关键词: 步数蒸馏, 参数剪枝, 联合压缩, 35x加速
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 步数+参数同时压缩的三阶段协同蒸馏管线,将13B模型压缩至30%参数4步推理
效果: 35x加速HunyuanVideo/WanX,5秒视频数秒内生成
FrameDiT: Frame-level Matrix Attention for Video Diffusion Transformers | 多机构合作 | arXiv:2603.10200
关键词: 帧级注意力, 矩阵注意力, 结构化, 需训练
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 帧级矩阵注意力替代token级全注意力,粒度介于Full 3D和Local Factorized之间
效果: 效率与Local Factorized Attention相当,多个视频生成benchmark达到SOTA
From Slow Bidirectional to Fast Autoregressive Video Diffusion Models | Nvidia, Technion | arXiv:2412.07772
关键词: 非对称蒸馏, CVPR 2025, 自回归, 实时生成, 9.4 FPS
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 将双向扩散模型蒸馏为因果自回归生成器,DMD视频蒸馏50步→4步,非对称蒸馏用双向教师监督因果学生
效果: 9.4 FPS实时生成,VBench-Long 84.27,CVPR 2025接收
Fast Video Generation with Sliding Tile Attention | UC Berkeley (Hao AI Lab) | arXiv:2502.04507
关键词: 滑动窗口, Tile级, 硬件友好, ICML 2025, 免训练
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 提出Tile级滑动窗口注意力替代Token级,利用视频DiT注意力在3D时空局部窗口内集中的特性,硬件友好设计
效果: 注意力加速2.8-17x(vs FlashAttention-2),端到端1.36-3.53x加速,ICML 2025接收
Bidirectional Sparse Attention for Faster Video Diffusion Training | UC Berkeley (Hao AI Lab) | arXiv:2509.01085
关键词: 训练加速, 双向稀疏, Query+KV稀疏, 动态阈值, 20x FLOPs
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 首个同时动态稀疏化Query和KV对的训练加速方法,通过语义相似性选择Query+动态阈值保留关键KV块
效果: 训练FLOPs减少20x,注意力训练加速17.79x,生成质量与全注意力持平或超越
∇NABLA: Neighborhood Adaptive Block-Level Attention | AI Forever | arXiv:2507.13546
关键词: 块级注意力, CDF二值化, Flex Attention, 训练+推理, 开源权重
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 自适应块级注意力:下采样Q/K后在压缩空间计算注意力,CDF二值化生成稀疏mask,集成PyTorch Flex Attention无需自定义CUDA
效果: 训练和推理加速最高2.7x,可与STA叠加使用,Wan 2.1预微调权重已开源
HunyuanVideo 1.5 Technical Report — Selective and Sliding Tile Attention | 腾讯混元 | arXiv:2511.18870
关键词: SSTA, 选择性注意力, 滑动Tile, 工业级, 消费级GPU, 开源
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 提出SSTA(Selective and Sliding Tile Attention):识别并剪除冗余时空KV块,仅对高信息区域执行全注意力,集成于8.3B参数的工业级视频生成模型
效果: 10秒720p视频端到端1.87x加速(vs FlashAttention-3),消费级GPU可运行,开源模型权重
Awesome-Video-Attention: A Curated Survey of Efficient Video Attention Methods | UC Berkeley (Hao AI Lab) | GitHub (hao-ai-lab)
关键词: 综述, 社区资源, 全技术栈, 持续更新
前序工作问题: 统一多模态生成与理解长期面临模态表示、训练目标和推理范式不一致的问题。
贡献: 视频注意力加速方法的系统性综述列表,涵盖稀疏化/量化/缓存等全部技术路线
效果: 社区标准参考,持续更新,按时间逆序排列
| 论文 | 方法类别 | 是否需要训练 | 注意力加速 | 端到端加速 | 测试模型 | 质量保持 |
|---|---|---|---|---|---|---|
| SLA | 稀疏+线性融合 | 轻量微调 | 13.7x | 2.2x | Wan 2.1 1.3B | |
| SLA2 | 稀疏+线性+量化 | 可学习路由 | 18.6x | - | 视频DiT | |
| SVG-EAR | 稀疏+线性补偿 | 免训练 | - | 1.93x | Wan 2.2 / HunyuanVideo | |
| VSA | 可训练稀疏 | 预训练替换 | 训练+推理 | - | 视频DiT | |
| Sparse-vDiT | Pattern定制kernel | 免训练 | 显著 | 显著 | HunyuanVideo | |
| SALAD | 稀疏+线性门控 | 2000样本微调 | - | 1.72x | 视频DiT | |
| VMonarch | 结构化Monarch | 轻量微调 | 5x | - | VBench | |
| Light Forcing | AR稀疏 | 免训练 | 显著 | - | AR视频DiT | |
| CalibAtt | 离线校准稀疏 | 免训练 | - | 1.58x | Wan 2.1 14B / Mochi | |
| AdaSpa | 自适应稀疏 | 免训练免数据 | 显著 | 显著 | OpenSora |
从免训练到可训练,从推理到全程
稀疏注意力的演进路线清晰:免训练方法(CalibAtt/SVG-EAR)天花板约2x,轻量微调(SALAD/SLA)突破至2-5x,全程可训练(VSA)则实现训练+推理双加速。三条路线并行发展,适用于不同部署场景。
稀疏+线性融合成为最优范式
SLA(ICLR 2026 Oral)确立了'大权重用稀疏、小权重用线性'的分工模式。SLA2通过可学习路由将其推向极致(18.6x)。SALAD用门控机制轻量化实现同一思路。这一范式的优势在于理论完备且工程可落地。
注意力图的结构化利用
从统一稀疏策略到结构化利用:Sparse-vDiT识别三种Pattern、VMonarch用Monarch矩阵表示时空结构、CalibAtt发现跨输入稳定性。理解注意力图的内在结构是设计更好稀疏方案的关键。
自回归视频扩散带来新挑战
Light Forcing和TempCache分别面向AR视频扩散设计稀疏注意力和缓存压缩。随着AR范式(CogVideoX-AR/GameGen)兴起,因果注意力的稀疏化将成为新研究热点。
多方法叠加实现极致加速
EasyCache+SVG可叠加达3x+;SLA+步数蒸馏理论可达5-10x无损加速;稀疏注意力+量化(SLA2 QAT)+缓存三者联合将推动视频生成走向消费级设备实时部署。
人工智能炼丹君 整理 | 数据来源:arXiv 2025年5月 — 2026年4月
评论 (0)