首页
应用
关于
Search
1
Pytorch DDP
2,482 阅读
2
Pytorch 常见问题
1,515 阅读
3
视频时序切分
1,341 阅读
4
中文场景下的CLIP图文预训练
1,044 阅读
5
Semi-Supervised + Noisy Label
1,028 阅读
AIGC
AIGC Daily Papers
AIGC Fundamentals
其他
职场经验复盘
多模态理解
购房/投资
阅读
广告
Segmentation
LeetCode
Pytorch
Python
Shell
C++
常用链接
Search
标签搜索
AIGC
人工智能
论文速读
ai
视频生成
DiT
对齐
蒸馏
扩散模型
attention
transformer
图像生成
视频编辑
diffusion
基础知识
稀疏注意力
多模态
文生图
NVIDIA
llm
Jefxiong
累计撰写
205
篇文章
累计收到
8
条评论
首页
应用
栏目
AIGC
AIGC Daily Papers
AIGC Fundamentals
其他
职场经验复盘
多模态理解
购房/投资
阅读
广告
Segmentation
LeetCode
Pytorch
Python
Shell
C++
常用链接
页面
关于
搜索到
120
篇与
AIGC Daily Papers
的结果
2026-08-11
AIGC 每日速读|2026-08-11|NVIDIA免训练治好世界模型失忆WorldTrace
今日 AIGC 论文速览 今日共 10 篇 · 世界模型长时一致性与物理保真 2 篇 · 可控图像生成与区域编辑 4 篇 · 生成效率与免训练适配 2 篇 · 语音与数字人生成 2 篇 重点论文标题列表 WorldTrace(NVIDIA·普林斯顿大学·多伦多大学):免训练治好世界模型失忆 InsertFuse(上海交通大学·上海创智学院·西安交通大学·武汉大学):先训专家再蒸馏成一个 MOSAIK(华为加拿大):砍70%算力质量不掉 ControlRef(中山大学·清华大学·北京理工大学):稀疏布局延迟砍掉八成 HRDiT(兰卡斯特大学·华南理工·NVIDIA AI Tech Centre):现成DiT免训练出高清 今日论文速览 1. WorldTrace:免训练治好世界模型失忆 Addressable Memory for Video World Models | NVIDIA·普林斯顿大学·多伦多大学 | arXiv:2608.07408 关键词:视频世界模型,长时记忆,RoPE外推,KV cache压缩,免训练 前序问题:交互式视频世界模型依赖不断增长的 KV cache 当视觉记忆,来承接已生成的帧。但作者发现,一旦 rollout 超出训练时长,模型就无法可靠地寻址已存内容——因为时间维度的 RoPE 偏移跑到了训练时从未见过的范围之外,注意力检索不到相关视觉信息。更麻烦的是,天真地在 RoPE 旋转后的空间里压缩 cache 会直接破坏记忆,相当于把互不兼容的位置相位平均在一起。 本文贡献:提出免训练的记忆框架 WorldTrace:给每个摘要槽位分配一个互不相同、且落在训练分布内的虚拟位置,让压缩后的记忆保持「可寻址」。在这个可寻址 cache 之上研究两条压缩路线——WorldTrace-Field 压缩历史以维持时序连贯,WorldTrace-Landmark 在检测到的场景转换处保存原样场景轨迹以支持情节式回忆。同时提出 LoopBench,专门评测「绕一大圈之后能否重建先前访问过的场景」。 实验效果:WorldTrace-Field 把时序一致性提升 15.5%;WorldTrace-Landmark 在 LoopBench 上把情节式回忆提升 19.5%。全程无需重新训练,即扩展了视觉持久生成的长度。 批判点评:这篇的价值主要在诊断而非方法:把「世界模型跑长了会失忆」从模糊的「容量不够」精确归因到 RoPE 外推越界加旋转空间压缩相位冲突,并指出必须让虚拟位置落回训练分布内,这个洞察干净且可迁移——长上下文语言模型里的同类问题同样适用。免训练、可直接挂到现成模型上,落地成本几乎为零。局限是它本质在给外推能力打补丁而非根治:虚拟位置复用意味着不同时刻的记忆共享位置编码,冲突在更长 rollout 上迟早重现;Field 与 Landmark 两条路线各优化一个指标(时序连贯 vs 情节回忆),说明还没找到统一解;LoopBench 是作者自建的,绝对难度和外部可比性有待其他团队验证。 2. InsertFuse:先训专家再蒸馏成一个 InsertFuse: A Unified Framework for Multi-Category Reference-Guided Image Insertion | 上海交通大学·上海创智学院·西安交通大学·武汉大学 | arXiv:2608.06490 关键词:图像插入,On-Policy蒸馏,流匹配,区域平衡,参考引导 前序问题:参考引导的图像插入(把一个参考物体自然地放进目标场景)要同时处理人物、服饰、家具、logo 等多种类别,而不同类别的插入行为差异很大。直接联合训练一个通用模型会产生跨类别干扰——学插家具的能力会把插人物的能力带偏;而分别训练多个专用模型又无法统一部署。此外插入区域通常远小于背景,直接做流匹配会让监督信号被背景主导,且对物体尺度敏感。 本文贡献:提出 InsertFuse,核心思路是把「类别专属能力的学习」与「跨类别能力的整合」解耦:先为不同插入类别各训一个专家,再用 Insertion On-Policy Distillation(IOPD)把它们的能力合并进单个学生模型——在学生实际访问到的状态上去查询匹配的那个专家,从而保住类别专属的插入行为,又避免了直接联合训练的跨类别干扰。为改善空间控制,提出 Token 对齐的几何条件(TAGC),把掩码导出的几何线索映射到视觉 token 网格;以及区域平衡流匹配,对插入区域内外的预测误差分别归一化,防止背景主导和尺度依赖的监督失衡。另引入 Reference CFG,在固定场景与几何条件下隔离并强化视觉参考带来的引导,再由 IOPD 把这份增强监督迁移进统一学生。 实验效果:在公开的 AnyInsertion benchmark 和作者自建的多类别测试集上,多数指标达到最优,在多样插入类别上都表现出很强的参考保真度与生成质量。 批判点评:「先训专家、再 on-policy 蒸馏成一个」这条路子在大语言模型里已被验证,搬到图像插入上很对症——插入任务的类别差异确实大到会互相拖累,而 IOPD 在学生自己走到的状态上查专家(而非离线蒸馏固定数据),能避免分布错位,这是关键细节。区域平衡流匹配也点出一个容易被忽视的工程真相:插入区域只占画面一小块,不做归一化,损失基本被背景吃掉。不足在于成本:要先训 N 个专家再蒸馏,整体训练开销远高于单模型方案,论文没交代专家数量和总算力,实用性判断打折;「多数指标最优」的措辞意味着有指标不占优,具体哪些没说;此外自建测试集与公开 benchmark 混合汇报,容易掩盖在标准集上的真实位次。 3. MOSAIK:砍70%算力质量不掉 MOSAIK: Multi-Patch Content-Aware Spatial Allocation of Image Tokens for Efficient Generation | 华为加拿大 | arXiv:2608.05450 关键词:像素空间扩散,异构patch,推理加速,token预算,华为 前序问题:像素空间扩散模型避开了潜空间扩散的重建天花板,但 token 数量高得多,在自注意力的二次复杂度下生成成本高昂。已有的效率方法通过在选定的去噪步使用更大 patch 来减少 token,但每一步都在整张图上用同一个 patch 尺寸,忽略了不同区域被粗化时的保真损失其实差别很大。 本文贡献:提出 MOSAIK,一个「损伤引导」的框架,让 patch 尺寸同时随区域和去噪步变化。改造 PixelDiT 骨干使其能生成任意异构的 patch 布局,并用一个轻量预测器基于中间去噪特征估计每个区域被粗化会造成多大保真损失。在给定 token 预算下,损伤引导的布局预测器把细 patch 分给敏感区域、粗 patch 分给其余区域。 实验效果:在 FLOPs 减少 70%、token 数减少 83% 的同时,GenEval 与全算力 PixelDiT 持平,DPG-Bench 仅下降 1.0 分。与包括时序 patch 调度、特征缓存在内的多种效率范式相比,在中等预算下极具竞争力,在算力极度受限的场景下持续超越这些基线。 批判点评:「不同区域被粗化的代价不一样」这个观察太朴素了,以至于之前的 patch 调度工作集体忽略——把逐步的时间维调度扩展到空间维,并且用一个学出来的损伤预测器而非手工启发式来分配预算,思路正确且数字漂亮:砍 70% FLOPs 而 GenEval 持平,这个性价比在效率方向里属于第一梯队,尤其在算力受限区间超越特征缓存类方法,说明它不是靠预算宽松堆出来的。风险在于:异构 patch 布局需要改造骨干(PixelDiT),无法像特征缓存那样零成本挂到现成模型;损伤预测器本身要跑,在极小预算下它的开销占比会上升;此外评测集中在 GenEval/DPG 这类文图对齐指标,异构 patch 边界在高频纹理和小字上是否留下可见接缝,摘要没有交代。 4. ControlRef:稀疏布局延迟砍掉八成 ControlRef: Efficient Layout-Guided Multi-Instance Generation via Anchored 4D-RoPE | 中山大学·清华大学·北京理工大学 | arXiv:2608.06878 关键词:布局引导生成,多实例合成,4D-RoPE,MM-DiT,推理加速 前序问题:布局引导的多实例生成对多模态扩散 Transformer(MM-DiT)的可控合成很关键,但要把这个能力整合进统一架构一直很难。此前框架依赖冗余的全分辨率画布填充加 Shifted-RoPE 来管理多张参考图:这套机制在稀疏布局下把计算开销急剧放大,又破坏了关键的低频 RoPE 特征,形成严重的空间-频率折损,把绝对空间对应关系搞模糊。 本文贡献:提出 ControlRef。用统一实例-布局控制(UILC)注意力掩码严格解耦实例间的语义交互,强制精确的区域绑定。为进一步促进区域级空间对齐,提出 Anchored 4D-RoPE:把 token 直接锚定到它们的绝对几何中心——先把参考图预对齐到对应边界框的分辨率,再把布局 token 和参考 token 都物理锚定到绝对几何中心,并让参考沿 z 轴堆叠,从而原生保留空间先验,无需有损位移就缓解了空间-频率折损。 实验效果:在视觉保真度和定位准确率上达到最优,同时把稀疏布局下的推理延迟削减 80% 以上,稠密场景下的显存开销降低 50%。 批判点评:这篇把「Shifted-RoPE 用位移换对齐」这个隐性代价揭示得很清楚——位移破坏低频分量,而低频恰恰承载绝对空间信息,于是控制精度和算力两头同时受损。改成把 token 物理锚定到绝对几何中心、参考沿 z 轴堆叠(这也是 4D 的来源),是从坐标系层面而非加约束层面解决问题,延迟降 80%、显存降 50% 属于工程上很实在的收益。需要留意的是:稀疏布局的 80% 提速本质来自不再做全分辨率填充,收益高度依赖布局稀疏程度,稠密场景下只剩 50% 显存收益,宣传口径要打折;把参考预对齐到边界框分辨率意味着参考图会被重采样,小物体的细节保真如何没有交代;此外方法与 MM-DiT 的位置编码强耦合,迁移到其他架构的成本未知。 5. HRDiT:现成DiT免训练出高清 HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models (ECCV 2026) | 兰卡斯特大学·华南理工·NVIDIA AI Tech Centre | arXiv:2608.07003 关键词:免训练,高分辨率生成,Diffusion Transformer,空间错乱,ECCV2026 前序问题:免训练的文本到高分辨率图像生成正获得越来越多关注,但已有研究主要集中在把现成的 U-Net 扩散模型适配到高分辨率;对现成 Diffusion Transformer(DiT)的适配进展有限——尽管 DiT 在有限分辨率下的文生图能力本来更强。 本文贡献:指出两个特别阻碍现成 DiT 免训练做高分辨率合成的关键挑战——空间错乱(spatial disorder)与生成时间过长,并针对性提出一套专门适配现成 DiT 的方法。代码已公开。 实验效果:大量实验验证了方法的有效性。论文已被 ECCV 2026 接收。 批判点评:问题定位很到位:社区做免训练超高分辨率的技巧大多是 U-Net 时代的遗产,而主力基座早已换成 DiT,这个空档确实值得补;免训练、直接用现成权重、代码开源,落地门槛几乎为零,ECCV 2026 接收也算一层同行背书。但这条摘要是今天十篇里写得最含糊的:只说「有两个挑战」和「提出一种新方法」,具体机制、能撑到多高分辨率、加速比多少、与 ScaleCrafter/DemoFusion 这类前作差多少,一个数字都没给。即使实验部分扎实,这种写法也会让读者在信息筛选阶段先流失一批——对一篇主打「免训练即插即用」的工作来说,是很可惜的自我设限。 6. MaskFlow:掩码写进流匹配目标 MaskFlow: Precise, Consistent and Seamless Regional Image Editing | 商汤研究院·北京航空航天大学·南洋理工大学 | arXiv:2608.06929 关键词:区域图像编辑,流匹配,掩码条件,边界融合,商汤 前序问题:区域图像编辑因为空间可控性受到关注。但即便基于指令和基于掩码参考的方法都能做到不错的语义对齐,可靠的区域控制仍然困难——编辑必须被准确定位,并且与被保留的上下文自然融合,而现有方法常在边界留下痕迹或污染背景。 本文贡献:提出训练框架 MaskFlow,同时追求精确定位、一致的背景保持和无缝的边界过渡。关键做法是把掩码直接纳入概率路径和流匹配目标,让可编辑区域内的生成与区域外的源保持协同优化,而不是事后拼接。另提出 Soft-Poisson 去缝合模块,在训练和采样两个阶段都对预测的向量场做精修,改善编辑前景与保留背景的平滑融合。同时设计数据合成管线构建 MEData——面向区域图像编辑训练的掩码数据集。 实验效果:在自然场景和信息图(infographic)图像上的实验显示,定量与定性评测均相对竞争方法取得一致提升。 批判点评:把掩码写进概率路径和流匹配目标、而不是当成后处理的贴回操作,这是方法论上的正解——边界不自然的根源就是训练目标里从来没有「区域内外要协同」这一条。Soft-Poisson 在训练和采样两侧都介入也考虑得比较周全;选信息图当评测场景很实用,因为文字和线条对缝合痕迹最不宽容。不足在于它是训练框架而非免训练插件,接入成本比同类高;效果描述停留在「一致提升」,缺具体数字和基线对比,而区域编辑的差异往往只体现在边界几十个像素上,这类主观性强的改进尤其需要量化和用户研究支撑;MEData 由合成管线构造,与真实用户涂抹掩码的分布是否一致也需要验证。 7. EmoWorld:情感拆成三路分别调 EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation | 香港科技大学(广州)等 | arXiv:2608.06231 关键词:情感视频生成,可控生成,冻结DiT,残差操控,Wan2.2 前序问题:情感决定观众如何解读一个场景,但现有视频生成器把全局氛围、承载情感的语义线索、以及情绪的时间推进这三件事全都揉在同一条文本条件里,导致无法分别控制——想调暗氛围就连带改了画面内容,想加一个悲伤的道具又连带改了整体色调。 本文贡献:提出 EmoWorld,在冻结的流匹配视频扩散 Transformer(Video DiT)内部解耦这三个因素。一次性准备阶段从「几何保持的中性全景图」与「情感编辑后的全景图」中提取逐层的情感方向和一个可复用的线索库。推理时:视觉氛围操控(VAS)把氛围方向注入隐藏状态;语义情感操控(SAS)为语义线索单独隔离出一个可独立缩放的 prompt 残差;时间情感操控(TAS)在去噪时间与视频时间两个维度上插值端点残差场。全程不更新生成器参数。 实验效果:在 Wan2.2 上,VAS 把目标情绪对齐度提升 19%、同时把时序波动代理指标降低 48%;SAS 把目标情绪对齐度提升 37%、检测到的承载情感线索增加 36%;TAS 相对最强基线把过渡单调性提升 15%。覆盖 27 个情绪类别的文生视频与图生视频设定,可跨多个 Video-DiT 骨干移植,并支持相机条件下的构图。 批判点评:把「情感」这个含混的条件拆成氛围、语义线索、时间推进三路分别注入,是这篇最漂亮的地方——它把一个说不清的美学需求变成了三个可分别缩放的旋钮,而且完全不动生成器权重、能跨骨干移植,工程友好度很高;用几何保持的中性/情感全景图对来抽取情感方向,也是个巧妙的构造。要谨慎的是评测指标的自定义程度偏高:「时序波动代理」「过渡单调性」都是作者自拟的量,19%/37%/48% 这些百分比缺少公认基线的对照,跨论文可比性差;情绪这类主观维度最终仍需人类评测,摘要未提及用户研究;此外方法依赖一次性准备阶段产出的线索库,换主题域或换骨干后是否需要重建,成本没有交代。 8. GAUGE:方程对了加速度还是错 GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models | 上海人工智能实验室·香港大学·上海交通大学·浙江大学 | arXiv:2608.05948 关键词:物理保真度,视频世界模型,物理引擎,诊断基准,上海AI Lab 前序问题:物理引擎支撑着具身智能的大规模训练与评估,而生成式视频世界模型正在成为未来状态与交互的隐式模拟器。但现有的物理保真度评估往往各自孤立进行,且严重依赖感知相似度或人工判断,几乎无法告诉你到底是哪条物理原理、哪个参数被违反了。 本文贡献:提出 GAUGE,一个以真实世界为基准的诊断性 benchmark,联合评估数值模拟器与生成式视频世界模型对真实物理的复现与偏离。包含 22 个受控任务族,覆盖刚体、柔性线缆、织物和体积可变形物体;以真实世界轨迹为基准,配套标定过的物理元数据、不确定性标注和任务专属可观测量,涵盖碰撞、摩擦、动量传递、振荡、自接触、形变等基本物理过程。 实验效果:用广义轨迹误差在 14 个任务族上评测 Isaac Sim、Genesis 与 Newton,并在 5 个刚体任务上评测 6 个图生视频模型的物理定律一致性与推断参数的时序稳定性。结果显示没有任何一个物理引擎在全部任务上保真,最大偏差出现在冲击性接触、织物快速运动和体积形变;更值得警惕的是,视频世界模型能产出「方程形式符合预期」的轨迹,但恢复出的加速度、动量传递和振荡时序全是错的。 批判点评:把物理引擎和生成式视频模型放进同一套以真实轨迹标定的尺子下衡量,这个设计本身就是贡献——此前两个社区各说各话,一边比轨迹误差一边比感知相似度,根本无法对话。最有价值的结论是「方程形式对但加速度错」:这精确刻画了视频模型的物理是表层拟合而非机制正确,对所有把视频世界模型当具身智能模拟器用的团队都是一记警钟,而这种可归因到具体物理量的诊断,是感知相似度指标永远给不出的。局限在于覆盖不平衡:物理引擎评了 14 个任务族,视频模型只评了 5 个刚体任务,柔性和形变这些最难的场景恰恰没测到生成模型;真实轨迹的标定精度与不确定性标注本身也会引入误差上限;22 个任务族的构造和评分细节能否被外部团队稳定复现,要等数据与代码放出后才能判断。 9. SemBridge:语义token只在训练时用 SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation | 西北工业大学·Soul AI Lab | arXiv:2608.07462 关键词:自回归语音生成,连续潜表示,语义token监督,零样本TTS,歌声合成 前序问题:连续潜表示的自回归语音生成通过避免量化损失、保留更丰富的声学信息,成为离散 token 建模之外一条有前景的路线。但连续声学目标并不把语言结构暴露成显式的 token 级预测目标,结果自回归语言模型只能通过预测声学来间接获得语言结构,这会损害生成语音的内容保真度——说白了就是音色和韵律很好,但字容易念错。 本文贡献:提出 SemBridge,一个仅在训练阶段生效的语义 token 锚定框架。用离散语义 token 直接监督自回归 LM 的状态,并采用语义对齐的声学 VAE,把连续目标空间组织在同一个语义参照系之下。语义监督只在训练时使用,推理阶段完全保持连续,因此不引入量化损失。在零样本文本转语音(TTS)和乐谱条件的歌声合成(SVS)两个任务上评估。 实验效果:在多个基准上,SemBridge 改善了以词错误率和字错误率(WER/CER)衡量的内容准确率,同时保持有竞争力的说话人相似度和感知质量。结果表明,对自回归状态施加显式语义 token 监督,是连续语音生成的一个有效且通用的方向。模型代码与 checkpoint 将开源。 批判点评:「训练时用离散语义 token 当拐杖、推理时完全撤掉」这个设计非常讨巧——它精准命中连续潜表示路线的软肋(音质好但内容易错),又不把量化损失带回推理阶段,属于两头好处都要的正确姿势,而且同时在 TTS 和歌声合成上验证,说明不是针对单一任务的技巧。不足是收益描述偏保守:内容准确率提升、说话人相似度和感知质量「保持有竞争力」,这个措辞通常意味着后两项略有折损,具体折多少要看正文;语义 token 的质量高度依赖所用的语义编码器,换一个编码器结论是否稳定没有交代;此外 16 位作者的大团队工作却只给出相对提升而无绝对 WER 数字,可比性打了折扣。 10. SubtleTalk:眉毛眨眼终于不再呆滞 SubtleTalk: Generating Controllable Weakly-correlated Facial Dynamics for 3D Talking Heads via Residual Flow Matching | 上海交通大学·腾讯 | arXiv:2608.06408 关键词:3D说话人,弱相关动态,残差流匹配,Valence-Arousal,腾讯 前序问题:音频驱动的 3D 面部动画要从语音合成真实且时序连贯的运动。尽管唇形同步已有显著进展,但眉毛运动、眨眼、头部动作这些「弱相关动态」——对照片级真实感恰恰至关重要——仍然难以忠实建模,常常表现得僵死或不自然地重复。作者归因于三点:一是弱相关动态的条件信息不足;二是确定性回归难以捕捉多样的运动模式;三是上半脸伪标签不可靠、数据集多样性有限造成的数据瓶颈。 本文贡献:提出 SubtleTalk,通过多条件建模与残差流匹配生成自然可控的弱相关面部动态。第一,针对单靠语音引导不足,引入可解释的控制信号——韵律、区域强度、Valence-Arousal(效价-唤醒度),显式刻画弱相关动态的时机、幅度和情感变化。第二,针对确定性回归表达力有限,在稳定的语音驱动运动先验之上构建残差流匹配,让模型捕捉超出确定性预测的随机偏差。第三,为缓解数据瓶颈,构建 SubtleTalk-Face 数据集,约 3900 个身份、74 小时数据,通过简单可扩展的伪标注管线构建,改进了上半脸追踪并带有帧级 VA 标注。 实验效果:大量实验表明,该方法在显著提升弱相关面部动态的真实感和多样性的同时,保持了准确的唇形同步。 批判点评:问题诊断分层很清楚:条件不足、回归表达力不足、数据不足,三条各配一个对策,而不是笼统地上一个更大的模型。「弱相关动态」这个提法本身就抓住了数字人恐怖谷的真正来源——唇形对了但眉眼呆滞,观众立刻觉得假;用残差流匹配在确定性先验之上叠随机偏差,是承认这类动作本质多模态、不该被回归到均值,方向正确;3900 身份、74 小时并带帧级 VA 标注的数据集也是实打实的贡献。局限是上半脸标注仍来自伪标注管线,而上半脸恰恰是原问题里「伪标签不可靠」的部分,这在方法论上有一点自我循环的味道;效果只给了「显著提升真实感和多样性」的定性说法,而多样性和真实感之间通常是权衡(动得多容易动得怪),缺少量化取舍曲线;此外三路控制信号的调参空间不小,实际使用的易用性有待验证。 趋势观察 长时一致性的病根被重新定位到「位置编码的可寻址性」 — NVIDIA 与普林斯顿的 WorldTrace 指出,视频世界模型跑超训练时长后失忆,真正原因不是 KV cache 装不下,而是 RoPE 的时间偏移跑出了训练分布,模型根本「找不到」存进去的内容;更糟的是在 RoPE 旋转后的空间里直接压缩,等于把相位不兼容的记忆平均成糊状。给每个摘要槽位分配一个落在分布内的虚拟位置,免训练就把时序一致性提了 15.5%、情节回忆提了 19.5%。这是今天最典型的「诊断比方法更值钱」。 生成效率的战场从「少走几步」转到「每一块像素值不值得花算力」 — 华为加拿大的 MOSAIK 指出,此前的 patch 调度都是在时间维上做手脚——某几个去噪步换大 patch,但整张图仍用同一个尺寸,完全忽略了不同区域被粗化时保真损失差别巨大。它训了一个轻量预测器估计每个区域的「损伤程度」,把细 patch 分给敏感区、粗 patch 分给其余,FLOPs 砍 70%、token 砍 83% 而 GenEval 与全算力持平、DPG 只掉 1.0 分,并且在算力极度受限时持续超越特征缓存类方法。空间维的自适应预算分配,是这条路上被漏掉的一整个维度。 免训练与训练后处理,仍然是投入产出比最高的一档工作 — HRDiT(ECCV 2026)把免训练高分辨率生成从 U-Net 时代搬到现成 DiT 上,只需解决空间错乱和生成耗时两个卡点;WorldTrace 完全不动权重就修好长时记忆;EmoWorld 在冻结的 Video DiT 上做三路情感操控,27 类情绪、跨多个骨干可移植,全程不更新生成器参数。当基座模型迭代速度远快于论文周期时,「不碰权重」正在成为一种务实的方法论选择。 可控生成的瓶颈从「像不像」转向「位置对不对、别处别动」 — 中山大学与清华的 ControlRef 发现前作用全分辨率画布填充加 Shifted-RoPE 管多张参考图,既在稀疏布局下浪费大量算力,又破坏低频 RoPE 特征、模糊了绝对空间对应;改成把 token 锚定到绝对几何中心的 Anchored 4D-RoPE,稀疏布局延迟砍掉 80% 以上、稠密场景显存省一半。商汤的 MaskFlow 把掩码直接写进概率路径和流匹配目标,从训练目标层面保证「区域内生成、区域外保源」;上交的 InsertFuse 则用区域平衡流匹配,对插入区域内外分别归一化误差,防止小目标的监督被背景吃掉。三篇都在说同一件事:控制不是往外加约束,而是改坐标系和目标函数。 评测正在从「打分」走向「诊断违反了哪条物理定律」 — 上海 AI Lab 联合港大、上交、浙大的 GAUGE 用真实世界轨迹做基准,22 个受控任务族覆盖刚体、柔性线缆、织物和体积可变形物,同时评物理引擎(Isaac Sim、Genesis、Newton)和 6 个图生视频模型,结论相当刺眼:没有一个引擎在全部任务上物理保真;而视频世界模型能生成「方程形式看起来对」的轨迹,但加速度、动量传递和振荡时序全是错的。这种可归因到具体物理量的评测,比再多一个感知相似度分数有用得多。 人工智能炼丹君 整理 | 2026-08-11 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月11日
20 阅读
0 评论
0 点赞
2026-08-10
AIGC 每日速读|2026-08-10|阿里Wan-Animate-2角色动画冲进实时24FPS
今日 AIGC 论文速览 今日共 10 篇 · 视频生成与人物编辑 4 篇 · 图像生成与扩散训练范式 1 篇 · 世界模型与 3D 生成 3 篇 · 评测基准与音频编解码 2 篇 重点论文标题列表 Wan-Animate-2(阿里巴巴通义实验室):14B角色动画实时到24FPS Vorch-IR(美团 Vorch Team·复旦大学):双人换脸拉到分钟级 UniVVT(清华大学·天津智能创新研究院):扔掉掩码姿态快38倍 EG-FM(京东·中科院自动化所):让终点自己动收敛快2.7倍 EffectLearner(清华大学深圳国际研究生院):擦人连影子涟漪一起擦掉 今日论文速览 1. Wan-Animate-2:14B角色动画实时到24FPS Wan-Animate-2: Pushing the Application Boundaries of Character Animation | 阿里巴巴通义实验室 | arXiv:2608.06009 关键词:角色动画,实时流式生成,Self-Forcing蒸馏,视角控制,阿里通义 前序问题:角色图像动画目前有三条路线,每条都有硬伤:基于显式运动表征(骨架、关键点、SMPL)的方法受制于提取误差,一旦姿态估计出错就带着身份一起漂移;基于隐式运动特征的方法把驱动信号压缩成低维向量,手指、微表情这类细粒度动态在压缩里被抹平;上下文学习(in-context learning)路线干脆不要中间表征,直接把驱动视频喂进注意力,质量最好但算力开销高到无法接受。更要命的是,现有系统全部是离线合成,数字人主播、直播换装这类交互场景要求边算边出,而当前方法连准实时都做不到。 本文贡献:端到端重构 DiT,让模型直接消费驱动视频,彻底删掉中间运动提取器。四个部件撑起 Base 版:双分支 DiT 共享 QKV 投影,参考分支锚定在扩散时间步 t=0 提供无噪运动先验,只训共享投影层、主干权重冻结;Time-Align RoPE 把参考视频 token 逐帧前置拼接,用H_t×W_t 的空间偏移避免位置索引撞车;Sparse-Ref Attention 让每个 latent query 只看时间上对应的参考 K/V,把跨分支注意力从 O((N_r+N_l)²) 压到 O(N_l);Viewpoint LoRA 只注入 cross-attention 投影矩阵,用「right 60-degree view」这类自然语言而非旋转矩阵来控视角,把输出机位和驱动视频解耦。Lite 版靠三段式训练做到实时:教师强制预训练把全局去噪模型改造成chunk-wise 因果生成器;Error Buffer 把单步预测与真值latent 的残差以滑动估计维护,训练时加回 clean context 来对冲 exposure bias,不用跑完整自回归 rollout;Self-Forcing 蒸馏为 14B 规模设计分块反向传播,rollout 阶段无梯度算完整序列分数,梯度阶段逐 chunk 累积并 detach,峰值显存从与全序列成正比降到与单 chunk 成正比。 实验效果:Lite 版在 4 张 H100 上以流水线并行(1 卡 VAE 编码、2 卡序列并行跑 3 步 DiT 去噪、1 卡 VAE 解码)达到 400×720 分辨率 24 FPS,推理 chunk 为 8 帧,跨过实时阈值;得益于 error buffer,长时间自回归里观察不到误差累积或质量退化。视角空间离散为 12 个方位角×4 个俯仰角共 48 档,大幅换机位时周围环境仍保持高度一致。盲测用户研究覆盖视觉质量、动态自然度、身份保持、动作准确度、面部表情五维加总体质量:对开源 Wan-Animate 全指标领先,总体质量在超过 70% 的成对比较中被偏好;对闭源商业产品 Dreamina 多数比较中胜出,对可灵 Kling-MotionControl 打成平手——而后两者建立在更大的闭源视频基座上,Wan-Animate-2 完全基于开源基座。训练数据用 Wan-Animate 自动合成配对视频,参考图由 Qwen-Image-Edit / Qwen-Image / Z-Image 生成,覆盖全身/半身/特写;多视角数据由 Unreal Engine 渲染,仅用于训Viewpoint LoRA。团队承诺开源 Base 权重。 批判点评:这篇最扎实的地方不是又一个动画框架,而是把「实时」这件事真正做进了 14B 视频 DiT:Error Buffer 用一次前向的残差近似替代完整 rollout,Self-Forcing 的chunk-wise 反传把显存与序列长度解绑,这两招是可以直接搬去做其他流式视频生成的通用工程手艺。Viewpoint LoRA 用自然语言而非相机参数控视角,也切中了普通用户拿不到标定内参的实际痛点。但要冷静看几处:全文没有一张定量指标表,FVD/FID/身份相似度一个都没报,评估只有定性图和盲测胜率,而用户研究连参与人数、样本量、分维度百分比都没披露,「超过 70% 偏好」这种数字缺乏可复核性;对比只挑了 Wan-Animate、Dreamina、Kling 三家,AnimateAnyone/Champ/UniAnimate 等经典基线全部只在引言里被引用而未实测。所谓 24 FPS 是 4 卡 H100 加 400×720 的成绩,折算成单卡或 1080p 就不再是实时,「开放部署新场景」的说法离消费级还有距离。另外 Lite 是蒸馏产物、Base 才开源,最能落地直播的那一版权重反而没承诺放出。 2. Vorch-IR:双人换脸拉到分钟级 Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation | 美团 Vorch Team·复旦大学 | arXiv:2608.05648 关键词:视频身份替换,长视频生成,时间重叠推理,LTX2,美团 前序问题:视频身份替换要把一到多个主体的身份换掉,同时保住驱动视频的动作、表情和时序结构。现有方法几乎只做单人,而且普遍依赖任务专属的结构控制——掩码、姿态图之类,这让它们很难塞进一个通用的多模态编辑系统里。多人替换更是被配对训练数据的稀缺卡死:你很难找到「同一段舞蹈、同样的动作、但换了两个人」的真实配对素材。另一个长期痛点是长度,短片段模型要拉长通常靠自回归续写,误差会一路累积成身份漂移。 本文贡献:一个模型同时支持单人替换、双人替换,以及可选的背景替换,四种设置共享同一套参数,没有任务专属分支或输出头。基于 LTX2 的 48 层 DiT,联合条件化于驱动视频、有序参考图集合和一句文本编辑指令;参考图不需要和驱动视频的姿态、布局、空间构型对齐,谁替换谁完全由指令文本说明(比如「参考1换左边的人,参考2换右边的人,参考3换背景」)。密集视觉条件走自注意力融合——驱动视频与目标视频用同时间原点、同帧率的独立 RoPE 网格,每张参考图分配独立位置网格,从而不对参考图与目标施加坐标级对应;语义对应关系则通过 Gemma 视觉语言编码器的 cross-attention 建立,参考-目标的绑定被学成语义关系而非显式定位模块。条件 token 始终保持 clean 并赋时间步 0,只有目标 token 加噪与监督。配套一条全自动数据构建流水线:先编辑首帧身份(合成参考涵盖真人、动漫角色、其他类人形象),可选再编辑背景,由 LLM 生成替换指令,再用运动引导动画模型沿源运动轨迹传播,最后由 VLM 过滤肢体畸形、主体缺失、身份不匹配等失败样本。长视频靠时间重叠推理:8 秒窗口、2 秒重叠、线性 cross-fade 融合,所有窗口读同一份 latent、融合后对整段施加单次 Euler 步,全视频保持单一去噪轨迹,因此不需要自回归续写。 实验效果:训练只用了 15,571 个clip、总时长约 13 小时(91% 的clip 在 2-4 秒),32 张 H20Z、有效 batch 96、2000 次优化步的checkpoint。在自建 benchmark 上主体一致性 0.9096 与背景一致性 0.9332 双项第一,DINOv2 主体相似度 0.5613 第一(次优 SCAIL-2 为 0.5470),CLIP-I 0.7767 第二仅差 0.0068;跨数据集 XDance 上运动平滑度 1.4286 第一,DINOv2 0.6040、CLIP-I 0.7953 均为第二。GSB 人工成对评测覆盖 4 个对手×4 个维度共 16 组,Vorch-IR 在全部 16 组中 Good 占比都高于 Bad:对 Wan-Animate 身份一致性 77.0% Good 对 11.5% Bad,对 MoCha 运动一致性 50.0% Good 对 0.0% Bad、身份一致性 69.2% 对 3.9%,对 HunyuanCustom 身份一致性 65.4% 对 23.1%。推理用 8 步蒸馏采样器单阶段完成,完整驱动视频只编码一次,短片段训练的模型直接扩展到分钟级。 批判点评:这是Vorch 系列本周的第四篇(8 月 7 日那期已推过 Omni、Streamer、Director),从「一套权重覆盖 30 多种音视频配置」走到「一套权重覆盖单人/双人/背景四种替换设置」,路线是连贯的:把任务差异从架构里赶出去,全部推给指令文本和 token 角色分配。最实用的一招是时间重叠推理——用完整驱动视频本身作为稠密逐帧条件,所有窗口共享同一份 latent 再做单次全局 Euler 步,绕开了自回归续写的误差累积,这个思路对任何「有完整条件序列」的长视频任务都能复用。但要看清代价:训练数据只有 13 小时、15,571 个clip,而且监督信号全部由「图像编辑首帧 + 运动传播」合成,本质是在蒸馏现成编辑器与动画模型的能力,天花板受限于那两个工具;论文也没报 FVD,视频级分布距离缺一个公认口径。更关键的是定量对比只在「单人替换」这一共同设置下做——双人和背景替换恰恰是它宣称的核心增量,却只有项目页的定性结果,无法核验。时序闪烁 0.9680 低于 HunyuanCustom 的 0.9781,DWPose 误差 0.0976 也不及 Wan-Animate 的 0.0614,说明身份保真的提升是拿姿态精度和时序平滑换来的。最后,这类换脸能力的滥用风险是实打实的,论文对此几乎没有讨论。 3. UniVVT:扔掉掩码姿态快38倍 UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on | 清华大学·天津智能创新研究院 | arXiv:2608.05745 关键词:视频虚拟试穿,端到端生成,MLLM语义条件,预处理加速,清华 前序问题:视频虚拟试穿要合成一段「这个人穿上这件目标服装」的视频,同时保住身份、动作和场景动态。主流做法把它当成掩码条件下的视频修补,于是必须挂一串独立模块:人体解析、姿态估计、服装变形。这套多阶段设计不只部署麻烦,更要命的是显式几何先验一旦出错,误差会不可逆地传进生成结果——掩码估计歪了,衣服就换不干净。而且这些预处理开销随视频长度近线性增长,90 帧就要一百多秒。 本文贡献:把视频试穿从「掩码条件视频修补」重新定义为「语义条件视频生成」,推理时彻底不需要掩码、姿态和变形场。核心判断是:「换什么」和「换到哪、怎么换」可以由多模态语义隐式编码,不必显式规定。三个组件:场景-任务感知器用 Qwen3-VL-2B-Instruct 把源视频、目标服装图、文本指令联合编码,前置 512 个可学习 task query 通过自注意力聚合任务信息,取的是 MLLM 的 hidden states 而非解码出的文本,因此同时捕获服装属性、场景上下文、人体-服装对应关系与时序编辑意图;语义桥是个轻量 MLP,只做维度与分布的适配,不学新的生成先验;视频生成模块基于 Wan2.1-Fun-Control 的 DiT,源视频 latent 与噪声沿通道维拼接以保留身份动作背景,服装 latent 沿序列维追加作为静态外观参考,每个 block 通过 cross-attention 注入任务语义与冻结CLIP 的服装外观特征。训练走三阶段渐进:先冻结生成器只对齐语义,再联合端到端适配,最后在256p-1024p 随机分辨率上精调。掩码与 DensePose 只出现在离线数据构建阶段(从真实的服装-视频对反向合成源输入),训练和推理都不吃这些输入。 实验效果:最有说服力的是效率:显式几何预处理在 30 帧要 36.36 秒、90 帧要 111.39 秒且近线性增长,UniVVT 的隐式任务编码分别只要 2.06 秒和 2.92 秒,加速 17.7 到 38.1 倍,90 帧场景直接省掉 108.47 秒。质量上也没让步——ViViD-S 视频基准 paired VFID_I 8.3623、VFID_R 0.1934、LPIPS 0.0456、unpaired VFID_I 12.3640、VFID_R 0.1876 五项里四项最优(SSIM 0.8922 次于 MagicTryOn 的 0.9011),unpaired VFID_R 相比次优 DreamVVT 的 0.4285 几乎腰斩。图像基准同样领先:DressCode paired FID 2.734、KID 0.4154、LPIPS 0.0349、unpaired FID 4.900、KID 0.960全为最优;VITON-HD paired FID 5.348、KID 0.3667 也是第一,并明显优于 Qwen-Image-Edit(14.269)与 FLUX.2-klein(11.503)这类通用图像编辑模型。消融很干净:去掉场景-任务感知器后 unpaired VFID_R 从 0.1876 恶化到 0.4424翻倍以上,定性上会把短裙错误地贴到上半身;语义桥若用 12 层 Transformer(1260M 参数、571G FLOPs)反而不如 41.96M 的 MLP,说明这一层只需做紧凑的分布变换。8 张 A100、LoRA rank 32、每阶段 30k 步。 批判点评:这篇给「能不能把一堆预处理模块直接删掉」提供了一个相当有力的答案,而且删的理由讲得通:掩码和姿态本质是在告诉模型「改哪里」,但一个足够强的 MLLM 看完视频和指令后本来就知道该改哪里,交叉注意力可视化也确实显示注意力集中在上半身并沿手臂持续跟随、人脸和背景响应明显更弱。17.7-38.1 倍的预处理加速对电商这种要批量跑的场景是硬收益,比多零点几个 SSIM 实在得多。轻量 MLP 打败重型 Transformer 那组消融也很有价值——提醒大家适配层不该无脑堆容量。但几处需要打折:训练三元组的「源视频」全部是用 inpainting 模型合成出来的,真实数据只提供服装图与目标视频,也就是说模型学的是「从合成劣化态恢复到真实态」,真实用户上传的视频未必落在这个分布里;in-the-wild 只在 TikTok 舞蹈上做了定性展示,没有数值。评测统一在 512×384 这个偏低的分辨率下进行,而试穿最挑剔的恰恰是布料纹理与 logo 这类高频细节,Stage 3 在 832p上 LPIPS 反而退到 0.0586 也暗示高分辨率并非无痛。论文既没有 FVD 也没有用户主观评测,视频级的时序观感缺少直接证据。SSIM 输给 MagicTryOn 也说明「端到端」在结构保真上还有欠账。 4. EG-FM:让终点自己动收敛快2.7倍 Energy-Guided Flow Matching | 京东·中科院自动化所 | arXiv:2608.05811 关键词:像素空间扩散,Flow Matching,频谱调度,收敛加速,京东 前序问题:像素空间生成模型绕开了 VAE 的有损压缩,代价是要在极高维空间里同时学全局结构和细粒度纹理。标准 flow matching 把噪声笔直插值到一个固定的干净图像终点,从低频轮廓到高频细节的整条频谱演化只能由网络隐式摸索,没有任何机制告诉模型「先把大形状定下来,再补纹理」。结果就是收敛慢、epoch 烧得多,像素扩散一直被认为训不动。 本文贡献:把固定终点换成会动的终点。用热核频率响应 R(h,ρ)=exp(−aħρ²) 对干净图做低通滤波,得到随时间平滑演化的终点 y_t(x):h=1 时最强低通只剩轮廓,h=0 时恢复全频谱等于原图,边界条件与标准 FM 完全一致。关键是高频释放节奏不写死,而是按每张图自己的频谱能量自适应:用 Parseval 定理算出总缺失能量与已恢复能量,令所有样本在同一时刻 t 完成相同比例的频谱能量恢复(release clock q(t) 用五次smootherstep),再用 16 次二分求出该图的热时间 h。速度目标因此多出一项终点自身运动项 t·∂_t y_t,通过隐式微分求导,无需对求根器反传。默认 σ₀=3.5,所有频谱运算在 FP32 下执行,t 与 1−t 接近 0 时解析赋值保证端点稳定。不改backbone、不改训练数据、不改采样器。 实验效果:ImageNet 256×256 类条件生成上做成收敛加速器:HyperDiT-H 只训 220 epoch 就拿到 FID 1.51,优于基线 600 epoch 的 1.56,约 2.7 倍加速;DeCo-XL/16 440 epoch 达 1.63 优于基线 600 epoch 的 1.69;PixelDiT-XL 200 epoch 的 1.55 已经超过基线 320 epoch 的 1.61,600 epoch拉到 1.45 优于基线 800 epoch 的 1.54(torch-fidelity 协议下为 1.39)。512×512 上从256 检查点仅微调 40 epoch,240 epoch 得 FID 1.68,而标准 PixelDiT 多训 530 epoch 才 1.81。迁到文生图,1.3B 的 EG-FM-T2I 把 PixelDiT-T2I 的 GenEval 从 0.78 提到 0.85、DPG 83.7→83.9(DPG 为全表最佳),GenEval 分项里Position 0.53→0.72、Color attribute 0.65→0.77 提升最猛。开销几乎为零:额外 FLOPs 最多 +0.026%/样本,每步墙钟时间增幅除 PixelDiT-B/16 的 4.81% 外均在 1% 以内,推理阶段完全零开销(不需 FFT、不需求根,与标准 FM 同 solver 同 NFE)。消融证明「逐样本自适应」是关键:共享线性释放 FID 2.48、数据集级 2.11、类级 2.03、逐样本 1.99。 批判点评:在一堆「加个新模块涨点」的论文里,这种改训练目标而不动网络、推理零开销的路子性价比极高,尤其「同一时刻所有样本释放相同比例频谱能量」这个归一化视角很干净——它把粗到细这件一直靠 noise schedule 玄学调的事,变成了可解析求解的能量约束。消融也做得诚实:取消量化、换释放时钟、改热时间粒度都摆了数字,还坦白 x-prediction 扩展在 JiT 上只从 2.37 到 2.33几乎无效,并解释了原因(早期 solver 的 x̃ 频谱不可靠)。不足同样清楚:σ₀ 呈 U 形曲线且最优值 3.5 是搜出来的,换数据分布或分辨率是否还成立没有验证,σ₀=1000 时 FID 崩到 66.08 说明这条路径对超参并不宽容;全部结果限于像素空间 backbone(DeCo/HyperDiT/PixelDiT),latent 空间主流模型上有没有增益完全空白,而作者也承认没在 Flux、Qwen-Image 量级基座上测过;GenEval 0.85 虽亮眼,但 DeCo-XXL/16 用 1.1B 参数拿了 0.86,说明这套增益并非在所有对手面前都成立。视频与跨模态更是明确列为未来工作。 5. EffectLearner:擦人连影子涟漪一起擦掉 EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal | 清华大学深圳国际研究生院 | arXiv:2608.05565 关键词:视频物体移除,效果推理,VLM引导,DiT擦除,清华 前序问题:视频物体移除不只要抹掉目标本身,还要连带清掉它引起的影子、反光、涟漪、尾迹、扬尘这些次生效果,同时保证补出来的背景高保真且时序连贯。现有方法把物体-效果对应关系隐式地从预定义效果类别和固定数据分布里学,一旦遇到真实场景里的组合效果(影子叠反射)、空间上与物体分离或弱相关的效果(远处水面的涟漪)、长尾物理现象、以及随时间演化的动态交互,就统统失效——把人擦了,地上的影子还在。 本文贡献:把语义推理塞进擦除管线:VLM 物体-效果推理器(Qwen2.5-VL-3B-Instruct)接收「目标高亮视频」(红色叠加α=0.15、黄色描边)与结构化效果分析提示,通过可学习效果查询做跨模态推理,聚合目标身份与运动、诱发效果及其时序演化、期望的移除后状态、需保留的场景内容,投影成紧凑的 effect-aware context tokens,直接替换 DiT 交叉注意力里原有的文本条件;DiT 视频擦除器基于 Wan2.2-TI2V-5B(从 Kiwi-Edit 初始化)在通道维拼接源视频 latent 与下采样掩码。两个运动感知机制补最后一公里:时间维掩码并集防止 causal 3D VAE 的时间压缩把快速运动目标的短时位置丢掉,运动一致性损失匹配运动补偿后的潜变量时序残差来压闪烁。配套自建 EffectWorld:Unreal Engine 5 渲染,每个目标 20 条随机化序列、每场景 3 条时空对齐序列(source/target/mask),共 11,092 组有效三元组,加 ROSE 的 16,663 组共 27,711 训练样本,配三阶段渐进课程(基础擦除→提高组合/动态/分离样本比例→长尾物理与快速运动精修)。 实验效果:EffectWorld-Eval 上 5 项指标全线最优:PSNR 29.521(次优 ROSE 25.955,领先 3.57 dB)、SSIM 0.934、LPIPS 0.044(次优 0.111,降 60%)、MAE 6.839、FVD 69.184(次优 EffectErase 238.521,降 71%)。ROSE-Bench 上拿到最佳 LPIPS 0.054 与最佳 FVD 81.866——注意 ROSE 虽然 PSNR 30.468领先,但 FVD 高达 803.722,几乎是本文的 10 倍,说明它的像素分领先建立在视频级不连贯之上。EffectWorld-Wild(70 组无配对真值)的 VBench 指标里背景一致性 0.958 与动态程度 0.400 双项最优。GPT-5.4 作评委的四维打分(1–4)总分 3.389 领先 EffectErase 的 3.270,20 人人工评测总分 3.675 对 3.213,其中效果移除 3.900 对 3.000、背景保持 3.950 对 3.000;人工与 LLM 评测的总分 Pearson r=0.9837。消融显示运动一致性损失最关键:去掉后 PSNR掉 4.818、LPIPS 恶化 3.25 倍、FVD 恶化 4.26 倍。 批判点评:这篇的价值在于把「效果」从枚举类别变成了可推理的语义变量——ROSE 那套预定义五类副作用(阴影/光源/反射/镜面/半透明)在真实视频里根本不够用,而让 VLM 先看一遍再告诉 DiT「哪些像素是这个物体造成的」是很自然的解法,评测设计也难得地把 ROSE 的高 PSNR 低 FVD 矛盾摆出来,说明作者清楚像素指标会骗人。人工与 LLM 评测 r=0.9837 也为 LLM-as-a-Judge 在这个任务上提供了一次有说服力的校验。但几处要打折:训练数据 11,092 组全部来自 Unreal Engine 渲染,虽然规避了肖像权问题,合成到真实的域差距只靠 ROSE 那 16,663 组真数据和课程学习来弥合,EffectWorld-Wild 上的优势主要体现在无参考指标和主观分而非硬指标;评测集规模偏小(Eval 仅 33 对、Wild 70 组、ROSE-Bench 60 组),单个难例就能明显搅动均值;人工评测只有 20 名志愿者且分数密集落在 3.9这种接近满分的区间,区分度有限。作者自己列的失败案例也很实在:大面积遮挡加高纹理背景会补得过度平滑,复杂运动下甚至把本该保留的细杆结构误删——这两类恰好是电商与影视后期最常遇到的。 6. HelloWorld:按一下键角色回头打招呼 HelloWorld: Enabling Socially Interactive Characters in Video World Models | 东京大学·Alaya Lab | arXiv:2608.05070 关键词:视频世界模型,社交交互,自蒸馏,时序注意力掩码,东京大学 前序问题:视频世界模型这两年进步很快,但里面的角色始终是「背景板」——你只能看,不能和它们互动。用户按个键让屏幕里的角色转过来朝你挥手、点头、说句问候,这件事目前没有任何世界模型支持。难点有两层:一是要让交互看起来自然,二是要控制交互发生的时机,而不是角色在整段视频里随机做动作。 本文贡献:在 LTX-2.3 基础上做了一个能社交互动的视频世界模型:按一下 F 键,屏幕里的角色就会朝镜头做出回应。关键是不采集任何外部数据、不做人工标注,而是用自蒸馏——先用精心设计的 prompt 让冻结的基座模型自己生成「同时含社交交互和相机运动」的片段,再用 Pi3X 从这些自产片段里恢复首帧点云与逐帧相机轨迹,按轨迹把点云重投影渲染成 warp video作为历史条件。warp video 天然带空洞(遮挡区和视野外),正好只提供几何引导、缺失部分交给模型补全,训练时用 visible-token selection 丢掉无有效源观测的 token,并刻意把相机文本从损失条件里排除,确保相机跟随完全由 warp video 而非文本控制。时机控制则是一个完全免训练的技巧:推理时给 cross-attention 加时序掩码,让交互窗口之外的帧无法 attend 到交互文本token,于是角色只在按键窗口内响应观众、窗口外表现为环境行为,开销可忽略。同时配套 HelloWorldBench,用 120 张图扩成 400 个评测样本、覆盖 264 个角色实例与 101 种交互类型,并设计ActAcc/TimeAcc/GazeDev 三个指标分别回答「做的是不是指定动作、有没有在指定时刻发生、是不是朝着观众」。 实验效果:训练成本低到有点惊人:156 条自生成视频、2000 步、LoRA rank 32、单张 H200。时机控制是最大增益——TimeAcc 81.7%,而所有基线在 30.9 到 41.2 之间,多数贴近 33.3% 的随机猜测水平,相比最强基线 WorldPlay 的 41.2 提升 40.5 个百分点;消融显示仅加视频流掩码就把 TimeAcc从 36.7拉到 80.9,再加音频流掩码让语音落在窗口内的比例从 52.5% 升到 69.1%。相机可控性 82.9 为全表最优,比次优 SANA-WM 的 70.0 高 12.9、比基座 LTX-2.3 的 31.4 高 51.5,同时背景一致性 96.9 与美学分 5.27 也都是最高,说明自蒸馏没有损伤基座画质。自蒸馏数据的价值也被量化了:相比用真实视频(不含社交交互)训练,ActAcc 从 36.4 升到 41.4、视线偏差从 51.3 度改善到 40.2 度——因为无交互的真实视频只教会模型填warp video 的空洞,角色会做动作但不朝向观众。30 人用户研究覆盖 4 个对手×3 个问题共12 组,偏好率71.7% 到 91.2%,所有置信区间下界都高于 66%。开销为基座的 +20% 时间、+36% FLOPs,10 秒 1280×704 片段耗时 60.2 秒、每帧 0.26 秒。 批判点评:这篇的巧劲在于两处都绕开了「需要更多数据」这个惯性答案:交互能力靠让基座模型自己生成训练数据来激活(156 条视频、2000 步就够),时机控制干脆完全免训练、只加一个 cross-attention 掩码。TimeAcc 从接近随机的 36.7 跳到 80.9 这组数字尤其说明问题——大家一直以为「控制时机」要靠时序建模,实际上只是没人去屏蔽窗口外的文本注意力。三个指标拆成「做什么/何时做/是否朝向观众」也比笼统的偏好分更有诊断力。但最需要说清的是标题里那个「interactive」目前名不副实:论文明确承认尚不支持实时交互,世界生成由预先指定的相机轨迹与交互脚本驱动,也就是说你并不能真的按一下键就看到反应,60.2 秒才出10 秒视频,离交互式体验差着一个数量级,作者把自回归架构列为未来工作。ActAcc 41.4 还输给 LingBot-World 的 50.5,且绝对值只有四成——意味着六成情况下角色做的并不是你指定的那个动作,这个基础准确率撑不起产品化。自蒸馏也有天花板:能被激活的只是基座里本来就有的社交先验,基座不会的动作蒸馏不出来。评测的 VLM 裁判与真人研究都指向同一个模型家族的偏好,跨基座泛化性未验证。 7. WorldClaw:一句话生成可编辑开放世界 WorldClaw: Agentic 3D Open-World Generation at Scale | 腾讯混元 Hunyuan3D | arXiv:2608.05248 关键词:3D世界生成,Agentic流水线,程序化地形,Hunyuan3D,腾讯 前序问题:从一句开放文本生成能自由漫游的大规模 3D 世界,难点是三件事必须同时成立:全局空间连贯(山脉、河流、聚落的相对关系不能乱)、局部内容丰富(走近了要有细节而不是一块糊墙)、以及产出显式可编辑可复用的资产(下游要能改材质、换模型、接进引擎)。现有路线各缺一角:分块潜变量方法长程组织弱、区域过渡突兀且不暴露独立资产;单视图高保真方法相机一走远就露出离散高斯基元和畸变几何;城市导向方法偏重实例排布而缺大尺度地貌。 本文贡献:全agentic 的粗到细三阶段流水线。规划阶段两个 agent 分工:意图分析 agent 只抽取并归一化 prompt 里显式表达的约束、绝不擅自补内容,场景规划 agent 才按schema 补齐下游必需的缺失字段,输出区域、地形、物体三类结构化规格。全局地形阶段先由地形规划 agent(可调搜索工具、必要时生成概念图)产出布局、资产、材质与世界尺度等参数,再用 GPT-Image-2 生成语义布局图和资产原型图、经 Hunyuan3D 的图生3D 转成可复用原型;核心是区域感知高度场H(x)=Σ_r m̃_r(x)·[h_r+Σk w{r,k}N_{r,k}(x)+Σj α{r,j}G_{r,j}(x)],用区域软权重混合基准高程、多频噪声与山峰/沙丘/阶地/侵蚀四类地貌算子,同一套权重复用于材质分配;地形资产按区域亲和性与目标密度在布局掩码内采样,再用局部高程、坡度、法线过滤,减少悬浮与穿模。区域物体阶段三个可复用 skill:Region Composition 渲染已有地形并生成合成图作为 2D 布局先验,Object Generation 用文本引导 SAM3 分割(全图加重叠滑窗提召回)后 SAM3D 重建网格并做非对称容差的图像空间尺度校准,Object Placement 用双射线对应恢复 3D 放置、以底部体素与地形的接触率为终止条件联合搜索锚点深度与等比尺度。两处渲染驱动精修循环经 BlenderMCP 连回引擎,维护「诊断渲染图+状态报告」任务队列,修区域突变、纹理比例失配、悬浮穿模,并做物体-地形协同变形(修改严格限制在支撑区内以保全全局地貌)。 实验效果:在 4 张 H20 上用 Blender 5.1.1跑通,agent 底座为 Opus 4.8,基础模型套件为 GPT-Image-2 + SAM3 + SAM3D + Hunyuan3D,大物体 PBR 纹理 2048×2048、小物体 1024×1024。正文 4 个加附录 7 个共展示 11 个完整世界,主题跨热带海盗岛、河谷部落聚落、沙漠战场、雪山未来设施、中世纪村庄、日式小镇岛屿、火山巢穴、宝石矿场等,每个都给出全局视图、区域视图、漫游视图,并附实例/深度/法线三种渲染。与 SynCity、Marble、MajutsuCity、WorldGen、GPT-5.6 Sol 五个基线在同一「中世纪村庄」主题下做定性对比:SynCity 长程组织弱且不暴露可控资产,Marble 远移后远处几何不完整并露出离散高斯基元,MajutsuCity 保留可控资产但被规则城市布局强约束,WorldGen 输出显式带纹理网格但展示视图地形平坦均质(作者称其为下游可用性上最接近的基线),GPT-5.6 Sol 能搭出完整布局但地形用简单几何形体、呈 blockout 外观。本文同时给出显式全局地形与独立重建放置的物体网格,兼顾大尺度地貌、局部填充与实例级可编辑性。 批判点评:这篇最有参考价值的不是某个模型,而是它证明了一件事:3D 开放世界生成可以不做成一个端到端大模型,而是拆成「LLM 写程序化地形参数 + 图像模型出布局图 + 分割重建做实例 + 渲染 agent 反复自查」的解耦流水线,且产物天然是引擎可用的显式网格与可编辑实例——这比一坨不可编辑的高斯点云对游戏和影视工业实用得多。区域感知高度场把地貌做成可解析的加权叠加,也让「换个世界尺度重跑」成为改参数而非重训。但必须说清它的实证水准:全文没有任何定量指标,没有 FID、CLIP-Score、几何误差,没有消融,也没有用户研究,全部结论建立在作者挑选的定性图上,这个证据强度撑不起「at Scale」的标题——连场景到底多少平方公里、放了多少资产都没披露。作者自陈的三条局限相当致命:整条链强依赖 Opus 4.8、GPT-Image-2 这类闭源强模型,换开源 LLM 常常生成不可执行的地形程序、换开源图像模型出不了可用布局图;LLM 写 Blender 节点图容易在尺度估计和节点连接上出错,需要多轮渲染-检查-修复;逐物体生成加多轮 agentic 精修导致延迟和成本随物体数与迭代次数增长,简单场景下甚至不如整体式方法。 8. MASS:1024人同屏世界只算一次 MASS: Multiplayer World Models with Authoritative Shared State | Alaya Lab·北京大学·东京科学大学 | arXiv:2608.06257 关键词:多人世界模型,类型化状态,权威服务器,可扩展渲染,北大 前序问题:当前视频世界模型在多人场景里必然失效,因为它们把世界状态和依赖视角的视觉潜变量纠缠在一起:同一份共享内容要为每个观看视角独立编码一遍,算力冗余;各视角的循环历史各自漂移,导致跨视图矛盾(同一个位置一个玩家看到食物、另一个看到空地);最要命的是模拟成本被绑死在「有多少人在看」上,视角数一涨算力线性爆炸,根本无法扩展。 本文贡献:把多人在线游戏的权威服务器架构搬进学习式世界模型:世界只模拟一次,与观看人数无关。Game Schema 声明式定义实体种类、字段与实例数,状态是有序 typed record 集合并做规范化序列化(字段固定位置区间、类型标签互斥 token 区间、可选字段显式 present/absent、有界列表带长度与canonical padding、空间桶排序去重)。Logic Engine 是唯一推进共享状态的学习组件,仅 5.66M 参数的 decoder-only Transformer(宽 256、6 层、8 头),自注意力严格限制在单条 record 内部、record 之间无注意力,因此可自由批处理并支撑千实体世界;物体交互靠预测前从共享状态算出的邻域上下文窗口传入;schema 派生 mask 只约束输出位置的合法词表,移动、碰撞、生长、拾取、死亡、奖励全部是学出来的而非写死的规则。Rendering Engine 按需渲染:把相机局部投影成 16 通道张量(可见占据、语义角色、玩家身份、深度、相机几何),经几何感知残差 U-Net 输出 RGB,只读投影后的 typed state 与相机、不读 RGB 历史,因此相机可在rollout 中随意增删移动、分辨率材质光照可变而无需重训动力学。服务端每tick 开销 T_server=T_logic(N)+C·t_sync(S):学习式转移只跑一次,分发对接收方线性,渲染在客户端本地。网络卡顿时客户端用同一个 Logic Engine 从最新权威版本本地推进,新版本到达后直接替换 typed state,不需要单独的纠正网络或隐藏 RGB latent。 实验效果:matched 多人 Snake(48×48、最多 8 人)上 128 tick、2 路同步相机评测,7 项指标里 6 项领先:LPIPS 0.098(次优 B-UN 0.123、MultiWorld 0.277)、状态恢复 0.764(最强视频基线 B-PV 仅 0.128,约 5.9 倍)、实体计数 0.234、位置 0.355、事件 F1 0.552,而跨视图不一致率为 0.000——所有视图从同一份预测 typed state 解码,一致性是构造性保证,对照 MultiWorld 的 0.984 与 B-PV/B-SL 的 1.000。注意 B-UN 是绝佳反例:LPIPS 有竞争力0.123 但状态恢复归零、事件 F1 仅 0.007,证明像素级好看不等于世界状态可恢复。直接状态预测层面对比更悬殊:所有密集预测器(独立头 CNN、Joint U-Net、RSSM)一步语义准确率都超过 91%,但位置准确率没有一个超过 2.7%、且每个预测 tick 都结构矛盾(100%);typed 载体位置准确率 99.1%、矛盾率 0%,H=32 时位置仍有 90.2%。可扩展性实测 1,024 个玩家 record + 4,096 个食物桶 record 共 5,121 record/tick,推进 10,000 个循环 tick;单张 H100 上渲染请求从 1 个视图 189.6 ms 到 1,024 个视图 842.4 ms,仅 4.4 倍而视图数增加了 1024 倍,世界转移成本完全不变。客户端预测实验中oracle 联合输入下缺失 1–8 次服务器更新的视内一致性恒为 1.000、本地角色位移恒为 0 格,即约 400 ms 窗口内学习式转移不引入任何视内偏差。八个游戏的渲染重建PSNR 五个超过 32 dB(Frogger 40.24),SSIM 全部超过 0.97。 批判点评:这篇的洞察很值钱:多人世界模型真正的瓶颈不是画质而是「循环载体选错了」。密集预测器语义准确率 91% 却位置准确率不到 2.7%、100% 结构矛盾这组对照数据极具说服力——网格表示无法跨 tick 保持实体身份,同一格子在不同步必须编码不同实体,U-Net 没有任何显式追踪机制,所以看起来对但状态全错。把权威状态、状态复制、客户端呈现三者分离,让模拟负载与观众数脱钩,这个架构迁移几乎是把二十年的netcode 经验直接兑换成了世界模型的可扩展性,1024 视图仅 4.4 倍渲染开销的数字很硬。但要注意评测场域的局限:主实验是 48×48 网格的 Snake,附带 Breakout 与 Tile Merger,全部是 2D 离散网格游戏,作者也承认扩展到 3D 环境与更丰富实体交互属未来工作——真实的多人 3D 世界里typed schema 该怎么声明连续几何和物理接触,是完全没碰的难题。延迟上typed-token Transformer 需 45.55 ms,明显高于密集基线的 3–4 ms,虽然刚好卡在 20 Hz tick 预算内但余量很小。Tile Merger 这类随机网格游戏 full-state exact 全程为 0,SRSC 显示 Crate Pusher 的 Logic 分数在 H=100 后跌到 10–17 区间,说明长时程可靠性远未解决。还有一点:MultiWorld 用 5.60B 可训练参数被 5.66M 的MASS 击败,这个对比虽然亮眼,但两者的能力边界本就不同——MASS 需要一份人工声明的 schema,视频世界模型不需要。 9. VideoArgus:给每条输入现场出评分细则 VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing | 罗切斯特大学 | arXiv:2608.05485 关键词:视频生成评测,动态评分细则,Agentic评估,VideoArgus-Bench,罗切斯特 前序问题:评测生成视频有三个老毛病:评测内容是固定的(一套 prompt 打天下,模型很容易过拟合到榜单)、覆盖面是残缺的(要么只测文生视频、要么只测编辑,五种设置没人统一)、给出的分数是不可追溯的(一个数字下来,你不知道它为什么扣分、也没有证据链)。结果是榜单排名和人类观感经常脱节,尤其文生视频这一档,源基准评测器与人工判断的实例内 Spearman 只有 0.162,图生视频那档甚至是 −0.060,等于负相关。 本文贡献:把「固定指标」换成「现场生成的评分细则」。对每条输入实例,先在完全不看任何模型输出的前提下(output-blind)生成一次 sample-specific rubric,然后冻结、复用于该输入的全部候选视频——这样既是样本自适应的,又保证了跨模型的公平。rubric 从统一的 22 个维度池实例化,每条准则包含具体要求、hard/soft 约束类型、三档重要性权重、0–10 整数评分规则、预期失败模式、可选的 hard cap,以及一份evidence plan(目标实体/事件、参考源、有序工具序列)。评估阶段由 evidence plan 驱动工具调用:vlm_qa 做通用语义问答,专用工具负责目标定位跟踪、参考引导裁剪、DINOv3 视觉相似度、OCR、深度与空间关系、时间闪烁检测、感知质量评估,plan-normalization 层会检查工具参数与依赖、把不可用操作映射为替代方案,专用工具失败时回退到 criterion-specific vlm_qa 并把回退决策记进报告。最终分 S=(1−α)B+α·min(B,κ),α=0.5,B 为重要性加权基础分、κ 为最严格 hard cap,且重要性、失败阈值、hard cap 对打分模型隐藏,只在聚合时生效。覆盖 T2V/TI2V/TS2V/TV2V/TSV2V 五种设置。 实验效果:VideoArgus-Bench 含 1,026 条输入实例(653 张图、416 条视频,素材来自 Pixabay 并经质量过滤),指令平均约 26 词,平均 11.9 条准则/实例(范围 6–17),全部 rubric 预生成、冻结并开源,评测了 55 个 model–task 对。在独立的 210 实例、1,260 视频(每输入 6 个模型输出、15 名标注者 0–10 打分)人类对齐集上,实例内 Spearman 与 Kendall 在全部五个任务上都超过源基准评测器:T2V 从 0.162 提到 0.496(+0.334),TI2V 从 −0.060 提到 0.605(+0.665),TS2V 0.524→0.631,TV2V 0.548→0.608,TSV2V 0.686→0.749。骨干鲁棒性上,固定评估 VLM 换 rubric 生成器(Claude Opus 4.8 / GPT 5.6 Sol / Gemini 3.1 Pro)平均排名一致性 0.909,固定 rubric 换评估 VLM(Qwen3.6-27B / Gemma4-31B)平均 0.931。生成 rubric 的准则数是人工标注的 2.33倍(11.68 对 4.98)而 hard 准则数相当(2.09 对 2.27),说明是覆盖更广而非一味更严。成本上 rubric 生成一次性平均 $0.231/case,评估全程本地推理约 0.033 H100 GPU 小时/视频、无按次API 费用。附带榜单里Seedance 2.0 五项任务全冠,可灵 Kling v3 Omni 在四项任务排第二,开源最优分别是 HunyuanVideo-1.5(T2V/TI2V)、OmniWeaving(TS2V)、Kiwi-Edit(TV2V)、Aurora(TSV2V)。 批判点评:这套设计击中了视频评测最尴尬的现实:固定 prompt 集正在被刷榜,而单一维度分数无法解释扣分原因。「output-blind 先出细则、冻结后复用」是很聪明的一步——它同时解决了样本自适应与跨模型公平这对矛盾,而把重要性权重和 hard cap 对打分模型隐藏也有效防止了 judge 顺着权重自我合理化。TI2V 上从负相关 −0.060 翻到 0.605 这个数字尤其说明现有基准的失效程度之深。但要清楚它换来了什么代价:整套流水线依赖闭源 Claude Opus 4.8 生成 rubric、Qwen3.6-27B 做评估,评测本身变成了一个需要 GPU 集群和 API 预算的系统工程,$0.231/case 加0.033 H100 小时/视频,规模化打分并不便宜,而「用大模型评大模型」的循环偏见也没有被真正消解。人类对齐集只有 210 实例且 TSV2V 一档仅 10 条,这一档 0.749 的领先统计意义有限。工具消融显示 Full 相对纯 VLM 在实例内相关性上 5/5 胜出,但 pooled Spearman 在 T2V、TV2V、TSV2V 三项上反而不如纯 VLM 或源基准,说明专用工具的收益并不一致。附带榜单虽然吸引眼球,却只能读作「按VideoArgus 口径」的排名。 10. LILAC:解码再编码token一位不改 LILAC: An Idempotent Neural Speech Codec | 首尔国立大学 | arXiv:2608.05727 关键词:神经语音编解码,幂等性,可逆变换,低码率,首尔国立大学 前序问题:神经音频编解码器已经是语音生成与编辑的标准 token 接口,但它们全都不幂等:把token 解码成音频、再重新编码回 token,token 会变。论文实测的十二个基线配置,单次 decode–re-encode 平均至少重写 15% 的 token,最差的 FocalCodec 重写 89.1%、DualCodec 80.2%。这在任何会发生「重编码解码输出」的管线里都是灾难——级联编辑、迭代生成、多轮处理都会让 token 流不断漂移,100 轮循环后 FocalCodec 与 Mimi 的 token 一致率已趋近于 0,dWER 从 0.07 涨到 1.34。 本文贡献:不靠训练、靠架构把幂等性证出来。设可逆分析变换 A 把输入分成保留坐标 z 与丢弃坐标 f,编码为 E(x)=q(Π_z A(x))、解码为 D(z_q)=A⁻¹(z_q, φ(z_q)),则对任意 z_q 与任意 fill 网络 φ 恒有 E(D(z_q))=z_q,与权重、收敛程度、重建质量完全无关——证明只需三步:可逆性保证投影后取回z_q,FSQ 由 clamp+round 组成故幂等,两者复合即得。工程上用两类可逆基本块:源自 Glow 的可逆 1×1 卷积(正交参数化,逆即转置核)与源自 NICE 的加性耦合块(逆只需减法,对应小波 lifting steps,名字由此而来),f/g 用 ConvNext1D 堆叠、按时间维奇偶索引切分、合并时按通道拼接实现「时间减半通道加倍」。整条路径无任何除法,避免浮点溢出,整体保体积;唯一例外是可逆 1×1 卷积强制全精度执行以保证 round-trip 精确。通道演进为 reshape 到 5 通道 → stem 缓解多相伪影 → 四次 squeeze-and-mix 到 80 通道 → 五次projection 逐步切掉丢弃坐标,最终 20 通道。推论很有意思:证明对 φ 无任何约束,因此可以构造随机解码器 φ(z_q,ω)在保持幂等的同时输出多样结果。 实验效果:24 kHz 全带宽、帧率 9.375 Hz、每通道 4 bit×20 通道 = 80 bits/frame,码率 0.75 kbit/s,总参数 58.5M(分析变换 43.1M 共享 + fill 网络 15.4M)。解码并重编码 LibriSpeech 与 LibriTTS-R 全部 7,457 个测试样本,每一个都重编码为完全相同的 token 流;100 轮循环token 一致率恒为 1.0000,dWER 恒为定值,说话人 EER 恒为 4.00%——而同期DAC 的 EER 从 0.00涨到 46.00、FocalCodec 从 3.00 涨到 41.00。质量上 UTMOS 在 LibriSpeech test-clean 达 4.141、LibriTTS-R 达 4.238,均高于真值音频的 4.072 与 4.194;sub-1 kbit/s 组内 PESQ 2.60、STOI 0.935/0.944、SI-SNR +2.2/+6.0 dB 三项全部第一,且是唯一未在评测集上训练的编解码器(训练用 HiFiTTS-2 并按 reader-ID 排除全部 146 个 LibriSpeech/LibriTTS 说话人)。消融很实在:仅加 anti-imaging stem 会恶化 LibriTTS-R(dWER 0.121→0.252),必须配合带宽衰减增广;解开编解码共享权重、加宽隐层、加深卷积堆叠都无有意义提升;改用连续潜变量(取消量化)每个指标都变差;40 通道×1 bit 的 BSQ 变体 UTMOS 略升但 dWER 崩到 0.46–0.48。 批判点评:这是一篇少见的「先证明、后调参」的 codec 论文:幂等性不是训出来的性质而是构造出来的定理,与权重无关这一点意味着它不会因为换数据、换训练轮次而失效,这种保证在工程上比多零点几个 UTMOS 值钱得多。作者的坦诚也值得记一笔——明确写了「It does not push the pareto frontier」,把单程下游迁移面板里 LILAC dWER 9.90% 在五个学习型 codec 中垫底的数据也照实登出来,MUSHRA 主观分 51.4 落后DualCodec 的 74.8 且相对最接近的 FocalCodec 领先 2.9 分并不显著(p=0.077),这些都没被藏进附录。局限同样明确:dWER 与 SCOREQ 处于中游,纯卷积却因大量小通道卷积导致 GPU 上 RTF 反而落后于其他 codec,「不更好也不更快,只是永不漂移」。最关键的一条作者自己点出来了——幂等性的下游收益(用其 token 训练的生成模型更稳定)目前仍是理论推断,没有任何训练好的下游模型来实证,也就是说这篇提供的是一个有严格保证的接口,但它到底能给TTS 或语音编辑带来多少实际增益,还是空的。另外比特分配消融显示只有真正提高码率才能无副作用地改善性能,说明 0.75 kbit/s 这档已经被榨干。 趋势观察 人物视频生成的战场全面转向「实时 + 长时+ 多主体」 — 阿里通义的 Wan-Animate-2 用教师强制预训练、Error Buffer 与 chunk-wise 反传的 Self-Forcing 蒸馏,把 14B 角色动画在 4 卡 H100 上推到 400×720 分辨率 24 FPS,长时程自回归无可观测误差累积;美团 Vorch-IR 用 8 秒窗口、2 秒重叠的时间重叠推理,让短片段训练的模型直接扩展到分钟级,且一套权重同时吃单人、双人与背景替换。两者的共同判断是:画质早已不是瓶颈,延迟与时长才是数字人、直播换装这类场景真正的门槛。 「把预处理模块删掉」正在成为一条明确的降本路线 — UniVVT 把视频试穿从掩码条件修补改写为语义条件生成,推理时不要掩码、不要姿态、不要变形场——显式几何预处理在 90 帧要 111.39 秒且近线性增长,它的隐式任务编码只要 2.92 秒,加速 17.7 到 38.1 倍,同时 ViViD-S 上五项指标拿下四项最优。Vorch-IR 同样宣称推理不需要空间对齐的参考图、不需要 mask 或 pose。共同逻辑是:掩码和姿态本质在告诉模型「改哪里」,而一个足够强的 MLLM看完视频和指令后本来就知道。 训练目标与推理策略,比换个更大的骨干更划算 — EG-FM 不改 backbone、不改数据、不改采样器,只把 flow matching 那个固定终点换成按每张图频谱能量自适应演化的热核滤波终点,HyperDiT-H 就用 220 epoch 达到 FID 1.51、优于基线 600 epoch 的 1.56,额外 FLOPs 最多 +0.026%、推理零开销。HelloWorld 更极端:时机控制完全免训练,只给cross-attention 加一个时序掩码,就把 TimeAcc 从接近随机的 36.7拉到 80.9。不是每个提升都需要重训一个大模型。 世界模型开始承认「循环载体选错了,画质再好也白搭」 — MASS 的对照数据最刺眼——密集预测器(CNN、U-Net、RSSM)一步语义准确率都超 91%,位置准确率却没一个过 2.7%,且每个 tick 都结构矛盾;换成类型化状态后位置 99.1%、跨视图不一致率降到 0.000,1024 个视图的渲染开销只有单视图的 4.4 倍。HelloWorld 则用 warp video 把相机控制从文本里剥离出来,相机可控性 82.9 对基座 31.4。WorldClaw 干脆放弃端到端大模型,用 agentic 流水线产出引擎可用的显式网格与可编辑实例。三者都在说:让状态显式、可评估、与下游对齐,比在像素上继续堆生成能力更有效。 评测与接口的可信度,正在被当作一等问题对待 — VideoArgus 对每条输入 output-blind 生成一次评分细则再冻结复用,把文生视频与人类判断的实例内Spearman 从 0.162 拉到 0.496、图生视频从负相关 −0.060 拉到 0.605——现有基准的失效程度比想象中深。LILAC 则从架构上证明编解码幂等:对任意权重恒有 E(D(z))=z,7457 个测试样本重编码 token 一位不差,100 轮循环说话人 EER 恒为 4.00%,而同期 DAC 从 0.00 涨到 46.00。一个修评测、一个修接口,指向同一件事:能不能被信任地接进管线,正在成为比榜单名次更硬的约束。 人工智能炼丹君 整理 | 2026-08-10 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月10日
5 阅读
0 评论
0 点赞
2026-08-07
深度解读|Sand.ai MAGI-2|114B视频MoE把token切12份挑专家
MAGI-2 Preview 深度解读:114B 视频 MoE,把一个 token 切成 12 份去挑专家 模型:MAGI-2 Preview 机构:Sand.ai 发布时间:2026-08-03(权重上传);2026-08-05(技术博客与模型卡定稿) 资料:技术博客 | GitHub 推理代码 | HuggingFace 权重 协议:Apache 2.0,代码与权重都是,可商用 说明:本文分析对象是官方博客、模型卡、configs/ 配置和 inference/ 全部源码,没有下载 307GB 权重、也没有跑过 8 卡 H100。文中凡是"推算"字样的数字都是我按 config 与源码算出来的,不是官方公布值。 (图片来源:本文根据 configs/magi2_preview.json 与 inference/model/magi2_preview.py 推算绘制) 01 先说这次开源的到底是什么 一句话:Sand.ai 开了一个 114B 总参数、每 token 只激活约 6B 的统一音视频生成模型,权重和推理代码全是 Apache 2.0。 它能干的事其实很窄: 文生视频(T2V)和图生视频(I2V),只支持首帧图,不支持尾帧、不支持视频续写; 视频自带声音,对白、环境声、音效由同一个模型和画面一起生成,最后用 ffmpeg 混进 mp4; 时长只有 10 秒,这是模型当前唯一支持的长度,不是默认值而是硬约束; 交付分辨率 1080p,但真实生成的是 1088×1920,因为 VAE 下采样要求每个维度是 16 的倍数。 真正值得注意的不是"又一个视频模型",而是它在赛道里的位置:这是目前少数把百亿级 MoE 用在视频生成主干上、并且把权重和训练系统设计一起公开的工作。Sand.ai 自己也把话说得很克制——这是一次 intermediate research release,用来验证"架构、系统、数据能不能一起 scale 到 100B",不是用来宣称画质 SOTA。 所以读这篇东西的正确姿势是:把它当一份系统论文看,而不是当一份效果报告看。 02 亮点,以及必须先说清的短板 亮点: Ultra-Fine-Grained MoE:每个稀疏层有 12 头 × 256 专家 = 3072 个专家单元,每 token 激活 12 × 6 = 72 个。这个粒度在公开的视频模型里没有先例。 通信量与 Top-k 解耦:走 Head Parallel,跨节点通信量是 O(NH),和每头选几个专家无关;收发形状在路由之前就由头划分静态确定,buffer 可以预分配。 架构与系统同步公开:Hierarchical Head Parallel、MagiMoE 融合算子、MagiMuon 优化器三件套都写进了博客,配套 MagiAttention 与 MagiCompiler 也是开源的。 音画在同一序列里联合去噪:文本、视频、音频进同一个 Transformer,只用 self-attention,没有 cross-attention 塔。音频 latent 频率被刻意定成 25Hz,和 25fps 视频帧一对一。 Apache 2.0,代码 + 权重都是。这一点比 MiniMax H3 的自定义社区协议干净。 推理代码的工程质量相当高:Triton 融合算子、Ulysses 上下文并行、四个组件独立的 offload 策略、MAGI2_DETERMINISTIC=1 可开位级确定性,注释里连"为什么这里必须先 draw 音频噪声"这种 RNG 顺序坑都写了。 必须先说清的短板: 没有任何 scaling 曲线,没有任何消融,没有任何 benchmark 表。 博客通篇是架构与系统论述,"我们观察到跨镜头身份更一致"这类能力描述明确写着 remain qualitative observations。一份讲 scaling 的技术报告里没有 scaling 曲线,这是最大的空白。 两个 transformer 都没做步数蒸馏,官方原话是 denoising step count is where most of the wall-clock time goes。base 版就是 100 + 5 步硬跑,蒸馏版 coming soon。 第三方盲测里它排第 6:Artificial Analysis I2V Arena Elo 1105,落后 33B 稠密的 MiniMax H3 整整 85 分。114B 总参数没有直接换来更好的画面。 硬件门槛是 8 张 Hopper,权重 307GB,而且 preview 和 refiner 默认都得 roundtrip 换进换出,因为 1080p 时两个模型在 80GB 卡上放不下彼此的激活。 能力面很窄:没有音频编码器,所以不能做音频驱动、音色参考、配音替换;refiner 阶段音频 token 直接置零,也就是说声音的质量完全由 512×896 那一阶段决定。 默认 8 卡配置里 12 个路由头分不进 8 张卡,代码补齐到 16 个槽位,结果有 2 张卡在 MoE 层纯陪跑(详见第 07 节)。 03 赛道位置:开放权重这一档现在怎么排 2026 年中的音视频联合生成赛道,大致分三层。 闭源第一梯队:字节 Dreamina Seedance 2.0、Google Gemini Omni Flash。这一档拿 API 卖,Elo 在 1190 以上。 开放权重梯队:MiniMax H3(33B 稠密、自定义社区协议)、Wan 系列(阿里,Apache 2.0)、SkyReels、以及现在的 MAGI-2 Preview。 MAGI-2 Preview 的特别之处是它选了一条别人没选的路:别人加参数靠把稠密模型做大(H3 是 33B 稠密),或者做粗粒度 MoE(Wan 2.2 用高噪/低噪两专家切换,27B 总参 14B 激活);MAGI-2 直接把 FFN 拆成三千多个低维小专家。 (数据来源:Artificial Analysis Image-to-Video Arena,2026-08-07 快照。盲测投票 Elo,不是逐维度指标) 这张图是全文唯一的第三方数字,值得多看两眼:MAGI-2 Preview 以 1105 排第 6,在 Wan 2.7(1094)和 Veo 3.1(1085)之上,但被同为开放权重的 MiniMax H3(1190)拉开 85 分。 需要给它留的余地也有两条:一是 base 版没蒸馏、100 步硬跑,Arena 用的是哪个配置无从核实;二是 Elo 反映的是"人类更喜欢哪个",而 MAGI-2 的卖点本来就不在这里。 04 从 MAGI-1 到 MAGI-2:为什么把自回归分块扔了 MAGI-1 是 24B 稠密模型,核心卖点是按 24 帧一个 chunk 自回归去噪,噪声水平随时间单调递增,最多 4 个 chunk 并发,因此支持流式生成、视频续写,而且峰值显存与视频总长无关。 MAGI-2 把这套东西整个放弃了。博客给的理由很直白:自回归分块引入额外的时序依赖和更复杂的生成调度,再叠加统一音视频建模和 100B 级分布式训练,系统变量会爆炸。 这个取舍的代价是实打实的: MAGI-1 MAGI-2 Preview 生成方式 分块自回归去噪 整段一次性去噪 时长 可延长(4M token 上下文) 固定 10 秒 流式 / 续写 支持 不支持 峰值成本 与总长无关 与总长成正比 音频 无 联合生成 所以 MAGI-2 不是 MAGI-1 的功能超集。如果你在用 MAGI-1 做长视频续写,MAGI-2 Preview 替代不了它,Sand.ai 也还在维护 MAGI-1.1-24B。 MAGI-2 保留的是另一篇工作的建模接口——《Speed by Simplicity》里 MagiHuman 的单流架构:文本、视频、音频拼成一条 token 序列,只用 self-attention。理由也讲得通:文本、口型、肢体动作、环境声、音乐、镜头节奏本来就是同一个事件的不同侧面,塞进一条序列可以在整个主干里持续交换信息,而不是只在几个预定义接口上握手。 05 架构核心:路由的单位从"整个 token"变成了"12 个子空间" (这段是全文最技术的一节,不感兴趣可以直接跳到 06 看结论。) 常规 MoE 是这样:路由器看整个 token 的隐藏状态,选出 Top-k 个专家,然后把完整的 H 维表示发到持有这些专家的设备上。每层通信量约为 N·k·H——选的专家越多,通信越贵。 更麻烦的不是量,而是形状不确定:发到哪些设备、每个 rank 收多少 token、收包 buffer 多大,全部由当前 batch 的路由结果决定。于是你会同时吃到三种痛:慢 rank 拖住全局吞吐(straggler)、各 rank 显存峰值不齐导致局部 OOM、以及为了对齐动态 token 数而产生的 GPU-CPU 同步。 视频 latent 的序列比文本长得多,而且一条统一音视频序列里混着不同模态、不同噪声水平、不同空间位置、不同运动状态的 token——异质性更强,动态路由带来的抖动更容易变成一阶系统开销。 Multi-Head LatentMoE 的做法是换掉路由单位。 (图片来源:Sand.ai 技术博客 §2.1 配图) 先用一个投影 W_in 把 3072 维隐藏状态映射成"路由表示",再切成 12 个 256 维子空间。每个子空间有自己独立的路由器和独立的专家池,各自从 256 个专家里选 6 个,算完再拼回去、过 W_out 映射回 3072 维。 关键收益在通信:既然要发的是"某几个头的全部子 token",那么通信量是 N·M·H_head = N·H,和每头选几个专家无关,而且跨设备收发形状由头划分静态决定,可以提前分配 buffer。路由依然是数据相关的,但这份不规则性被关在了每个 head owner 内部,不再决定跨设备的通信形状。 代进 MAGI-2 的实际数字,差距很直观: 常规 MoE 若按整 token 路由、Top-6,每层每 token 要发 6 × 3072 = 18,432 个数值; Head Parallel 每层每 token 只发 12 × 256 = 3,072 个数值,正好是 1/6。 省下的这个 6 倍恰好就是 Top-k,所以这套方法越是往"超稀疏、多专家、小专家"的方向走,收益越大——而 Ultra-Fine-Grained MoE 正是这个方向的极端。反过来它也有上限:Head Parallel 的并行度被头数卡住,12 个头就意味着这一维最多切 12 份。 有两件事这里需要讲清楚,博客说得比较含蓄: 第一,这不是 Sand.ai 原创。 多头路由的思路来自微软亚研的 Multi-Head Mixture-of-Experts(那一版里不同头还共享路由器和专家池),"每个头独立路由器 + 独立专家集 + Head Parallel"来自亚利桑那州立大学 kerner-lab 的 Multi-Head LatentMoE and Head Parallel。后者在 4B 语言模型上报的数字是:k=4 时通信量降到 EP 的 25%,训练最快 1.61× 加速。Sand.ai 的贡献是把一个 4B 规模验证过的学术方法,扛到 114B 的视频模型上——这个工程量本身很值钱,但署名要说清楚。 第二,那 3072 个"专家"不是 3072 个宽 FFN。 每个专家单元只在一个 256 维子空间上工作,结构是 256 → 1280 → 256 的 SwiGLU。所以 MAGI-2 加的不是一堆必须整体调用的大 FFN,而是一堆可以被独立挑选、自由重组的低维变换。同一个 token 的不同表示子空间可以形成完全不同的专家组合——这是它和常规 MoE 最本质的差别。 官方给的完整配置: 组件 MAGI-2 Preview 配置 主干层数 40 层 稀疏核心 中间 36 层(第 2–37 层)用 Multi-Head MoE,首尾 4 层保持稠密 模型宽度 3072 路由表示 12 头 × 256 维 专家池 每头 256 个专家 激活专家 每头 Top-6 专家 FFN 256 → 1280 → 256,融合 SwiGLU7 配置文件里还有几个博客没提的参数:路由打分用 sigmoid(不是 softmax),Top-6 概率归一化后再乘 route_scale = 4.9,路由分数在 FP32 下算、专家权重和主计算走 BF16。 06 把 114B 算给你看 博客说 114B 总参、6B 激活,但没给拆解。用 config 里的数字可以自己算,而且算得相当准。 单个稀疏层的路由专家池:12 头 × 256 专家 ×(W_gate 256×1280 + W_up 256×1280 + W_down 1280×256)= 12 × 256 × 983,040 ≈ 3.02B。乘 36 层 = 108.7B。 也就是说,114B 里有 95% 是那 110,592 个(36×12×256)小专家单元,其余全部加起来不到 6B: 部分 总参数 每 token 激活 路由专家池(36 层 × 12 头 × 256) 108.72B 2.55B(每层 72 个单元) 模态专属专家 + 共享专家(36 层) 1.70B 0.85B 注意力 QKVO(40 层,边界层 ×3 模态) 1.81B 1.51B 边界稠密层 FFN(第 0/1/38/39 层) 0.91B 0.30B split / merge 投影(36 层) 0.68B 0.68B 合计(推算) ≈113.8B ≈5.9B 两个官方数字都对上了,说明这个拆法没跑偏。但拆完会看到一件博客没强调的事: "每 token 激活 6B"里,只有 43% 来自路由专家,注意力占了 26%,剩下 31% 是恒定激活的稠密件。 稀疏化只作用在 FFN,注意力是全量参与的。而视频生成的瓶颈恰恰在注意力——预览阶段五万多个 token 的全注意力,压根不吃 MoE 的红利。 博客里其实也承认了这点,只是一句话带过:MoE does not remove attention cost, and the number of activated parameters is not equivalent to end-to-end FLOPs。看完这张拆解表,你会明白这句话的分量。 07 系统三件套:让三千个小专家真的跑得动 (这段偏基础设施,做应用的可以跳。) Multi-Head LatentMoE 只定义了路由架构,扛到 114B 要同时解决三个问题。 Hierarchical Head Parallel——把两级网络分开用。 单张 GPU 装不下一个头的完整专家库,而训练集群有两档带宽:节点内 NVLink,跨节点 InfiniBand。MAGI-2 把两件事分别映射到两档网络上。 (图片来源:Sand.ai 技术博客 Figure 2) 跨节点走 InfiniBand,只交换固定形状的头切片——[N, M, H_head] 按头维度分发,收发量由头划分静态推出,和 Top-k 产生的动态 token 拷贝无关。节点内走 NVLink,用 ZeRO/FSDP 式全分片存专家权重、梯度和优化器状态,当前层的参数按需 materialize、算完立刻 reshard。 一句话概括:InfiniBand 只管规整的激活交换,NVLink 管专家状态的高带宽聚合与重分片,负责某个头的 GPU 不需要常驻这个头的整个专家库。 MagiMoE——从路由到输出合并的整条路径都融合。 标准 MoE runtime 会按路由结果重排 token,然后用 Grouped GEMM 跑不同大小的专家矩阵。这套在常规 MoE 上没问题,但 MAGI-2 每个稀疏层有 3072 个窄专家单元:每个单元收到的 token 更少,GEMM 形状更小更不规则,于是排序、kernel launch、中间张量读写反而变成主要开销——足以把稀疏计算省下的算力全吃回去。 MagiMoE 的做法是把 融合路由与 Top-K → 紧凑的按专家 token 布局 → 融合 grouped 专家 FFN → 按路由权重合并输出 整条链一起优化,并把 up、gate 投影和 SwiGLU7 融在一起以减少中间结果落地和显存流量。负载均衡用 DeepSeek 那套 auxiliary-loss-free 专家偏置,不往主目标里塞额外的均衡损失;每个路由头独立应用,专家负载统计放在单独的 CUDA stream 上异步聚合,避免干扰主计算流。 推理仓库里能直接看到这条路径的落地:inference/flash_mh_moe/ 下的 route.py 和 Triton kernel mh_moe_fwd.py。 MagiMuon——让优化器认识 head × expert 结构。 稠密 Transformer 里一个权重就是一个大矩阵;MAGI-2 的专家权重天然是"按 head × expert 索引的一大批小矩阵"。MagiMuon 保留这个结构:路由门按头分组成矩阵批,专家的 up/gate/down 投影把 head 和 expert 展平进 batch 维,Muon 正交化对每个矩阵独立做,矩阵批跨 rank 分布以均衡优化器计算——而不是把所有头和专家拼成一个人造的大矩阵。 不是所有参数都用同一套更新规则:adapter、mHC、attention sink、门控相关参数走 Adam 风格,主矩阵参数走 MagiMuon。 博客还专门提了一句同期工作 Kimi K3 的 Per-Head Muon:那个是沿注意力头维度切 Q/K/V 动量矩阵,和 MagiMuon 针对的结构不同,但体现的是同一个设计原则——模型有显式的 head 结构,优化器就该用上这个结构。 顺手说一个发布配置里的小尴尬:12 个头分不进 8 张卡。 上面那句"并行度被头数卡住"在默认推理配置里就已经咬人了。configs/magi2_preview.json 写的是 ep_size = 8,而路由头是 12 个,12 % 8 ≠ 0。CoreMultiHeadMoE.__init__ 的处理方式是补齐到 8 的倍数: self.padded_num_heads = math.ceil(self.num_heads / self.ep_size) * self.ep_size # 16 self.ep_pad_heads = self.padded_num_heads - self.num_heads # 4 my_head_start = ep_rank * (self.padded_num_heads // self.ep_size) # ep_rank * 2 self.has_real_moe_heads = my_head_start < self.num_heads # rank 6/7 → False 12 头被补成 16 个槽位,每张卡分 2 个。算下来 rank 0–5 拿到真实的头 0–11,rank 6 和 rank 7 的 has_real_moe_heads 是 False——它们持有全零的 dummy 权重,照样参与 all-to-all,但输出直接丢掉,_forward_impl 里走的是 out = torch.zeros_like(x_heads)。 也就是说,官方 8 卡默认配置下,MoE 层的专家计算只有 6 张卡在干活,另外 2 张纯陪跑(注意力那部分它们还是照常参与,因为走的是 Ulysses 上下文并行)。要让 12 整除,得用 4 卡或 12 卡的 EP,但整个 pipeline 又硬绑在 8 卡上。这不影响正确性,是官方为了兼容才写的 pad 分支,但对着"高效 scaling"的标题看,这个 25% 的槽位浪费还是有点扎眼。 08 代码里有博客没写的东西 这是我读源码收获最大的一节。有三样东西在 configs/magi2_preview.json 和 magi2_preview.py 里实现得很完整,博客里一个字都没提。 一、mHC:DeepSeek 的流形约束超连接,MAGI-2 全层都在用。 配置里有这么一段: "mhc_config": { "enable": true, "num_stream": 4, "alpha_init": 0.01 } MHCHandler 的实现里是 num_sk_iters=20 的 Sinkhorn-Knopp 迭代,还配了专门的 Triton 算子 magi2::mhc_sinkhorn_knopp_affine_fwd。这对应的是 mHC: Manifold-Constrained Hyper-Connections(DeepSeek,ICML 2026 Spotlight):Hyper-Connections 把残差流从单股拓宽成多股、连接方式可学,效果有提升但破坏了恒等映射性质,大规模训练会信号发散;mHC 用 Sinkhorn-Knopp 把可学的残差混合矩阵投影到双随机矩阵构成的 Birkhoff 多胞体上,让信号传播变成特征的凸组合,从而在保留多股表达力的同时恢复范数保持性。 MAGI-2 把残差流拓宽成 4 股,每层在 attention 前后、MLP 前后各挂一组 mHC 参数。一篇讲"如何稳定地把模型 scale 上去"的报告,把训练稳定性的关键组件整个漏掉了,这个遗漏挺可惜的。 二、每个稀疏层还有两条恒定激活的稠密通路。 博客把稀疏层描述成"路由 + 专家",但 MultiHeadMoELayer.forward 实际是这样: moe_out = self.merge_linear(self.moe_mlp(self.split_linear(norm_output))) return moe_out + self._shared_expert_forward(norm_output, modality_dispatcher) 那个 _shared_expert_forward 里有两个 FFN:一个是所有 token 共用的 shared expert(3072 → 1280 → 3072),另一个是 modality-specific shared expert——视频、音频、文本各有一份独立权重,按 token 的模态选用。加上按模态分组的 MultiModalityRMSNorm,等于每层都留了一条"不经过路由的模态专属通路"。 这解释了一个疑问:既然音频只有 250 个 token、文本只有几百个,混在五万多视频 token 里做 Top-k 路由,凭什么保证音频不被视频专家的分布淹没?答案是——它不完全靠路由,模态差异有一部分是硬编码进权重的。这个设计比博客里"三个模态进同一个主干"的说法要务实得多。 三、注意力侧的两个小改动。 attn_sinks 开启,每层 1 个 sink token;attn_gating 开启。前者是 attention sink 那套(给每个头一个可学的"垃圾桶"logit,缓解 softmax 必须把注意力分配出去导致的伪高激活),后者给注意力输出加了门控。这两个都是 2025-2026 年 LLM 侧被验证有效的稳定性 trick,被搬到了视频 DiT 上。 顺带一个细节:num_query_groups = 24,而 num_heads_q = 3072/128 = 24。两者相等,说明预览阶段没用 GQA,是标准的多头注意力。 首尾 4 层的 QKVO 还是按 3 个模态各存一份。 09 数据方法论:博客最有想法的一节 抛开架构,博客里我觉得最值得抄进笔记本的是"数据过滤陷阱"这个提法。 早期视频生成模型大多在 7B 左右。小模型表达复杂分布的能力有限,而人对视觉错误又极其敏感,于是社区自然形成了一套以过滤为中心的数据策略:保留主体清晰、运动简单、镜头稳定的视频,把模型学不动的样本删掉。 对小模型有效,但会锁死后续 scaling: 当训练数据被持续简化以适配当前模型时,数据本身就成了更强模型的能力上限。 MAGI-2 的转向是从"过滤为中心"改成"高吞吐生产 + 精确标注"。必要的数据治理(安全、合规、隐私、严重损坏、去重)保留,但"当前模型是否容易生成"不再是准入标准。复杂运动、多人交互、镜头切换、长尾主体、字幕、屏幕文字、复杂音频关系——尽可能都留下来。 减少过滤只是第一步。一段复杂视频如果只配一句泛泛的 caption,里面的身份、动作、镜头和音频关系仍然无法变成有效监督。所以新 pipeline 把主体与场景、动作与交互、镜头与时序结构、对白与歌曲、环境声与音乐、屏幕文字与字幕全部纳入可扩展的多模态标注。 这也给"数据质量"换了个定义:先保留有用的复杂度,再把这份复杂度准确描述出来。在这个定义下,标注不再是过滤之后的附加步骤,而是数据 scaling 的核心基础设施。 博客声称的"涌现"是两条:多镜头数据留下后,人物身份跨镜头更容易保持一致;字幕数据留下后,能看到对白/歌曲与对应字幕特效同时出现的样本。但作者自己加了限定——these remain qualitative observations and require more systematic controlled experiments。这个诚实值得肯定,但也意味着这两条目前只是 cherry-picked 样例,不能当结论用。 10 提示词模板反推训练 caption:全文最硬的旁证 上面那套数据说法有多少是真的?推理仓库里有一份间接但很强的证据:prompt enhancement 的模板和 JSON schema。 官方明确说模型训练用的 caption 又长又结构化(long and structured),手写短 prompt 会浪费模型能力,所以配了 PE 步骤:拿一个指令模型按模板把用户 prompt 改写成结构化 JSON caption,再喂给 pipeline。那么这份 schema 的形状,就近似等于训练标注的形状。 T2V 模板(prompts/t2v.md,1543 行)要求输出两层结构: global_layer(整段不变的部分):美学(风格/对比/饱和度/配色/视效/氛围)、音频基线(环境声 + 对白语言与说话人标签)、静态物体列表(形状颜色/材质/相对大小/位置/朝向)、光照基线(条件/方向/阴影/光源一致性)、静态活体主体(性别/族裔/年龄段/面部特征/服装/外观细节)、镜头风格(整体风格/景深/焦段)。 dynamic_layer(按时间切段):每个 timeline_segment 里带镜头增量(对焦/机位/构图/运镜类型方向强度)、光照增量、物体动态状态、活体主体的动作(主要动作/身体姿态/运动细节/交互/面部表情)、屏幕文字渲染(文字/时间戳/位置/字号/颜色/字体)、因果事件(触发/结果/物理)、音频(对白逐句带 speaker 与 delivery、环境声变化、特殊音效带 visual_sync 说明与画面如何对齐)。 I2V 模板则是镜头制的:reference_bank + shot_timeline(每个镜头带时间区间、镜头 caption、镜头光照构图、运动与物理逻辑、引用的参考对象、关联的音频事件)+ audio_event_timeline + visible_text + generation_requirements。 这份 schema 把博客的说法验证得很扎实: causal_events 里专门有 physics 字段 → 对应"物理合理性"的诉求; text_render 和 visible_text 独立成项 → 字幕和屏幕文字确实没被过滤掉,而且是逐条带时间戳标注的; I2V 的 shot_timeline 允许多个镜头 → 多镜头数据确实保留,跨镜头身份一致靠 reference_bank 的 identifier 串起来; 音频事件带 visual_sync 和 synchronization_note → 音画同步是显式标注出来的,不是指望模型自己对齐。 顺着这个思路还能看出音画同步的另一半是架构层面做的:配置里 audio_latent_fps = 25.0,视频也是 25fps,一个视频帧配一个音频 latent token。代价是 Stable Audio Open 1.0 的 VAE 原生 latent 频率是 44100/2048 ≈ 21.53Hz,21.53 × 512/441 = 25.0,所以解码之后必须做一次 441/512 的 sinc 重采样把时长掰回来。为了 token 级 1:1 对齐,宁愿在解码端补一次重采样——这个取舍很能说明他们对音画同步的重视程度。 11 两阶段推理:100 步预览 + 5 步精修 生成分两段,magi2_preview 在低分辨率去噪,magi2_refiner 把结果拉到 1080p。 (图片来源:本文根据两份 config 与 inference/pipeline/inference_engine.py 推算绘制) 预览阶段跑 512×896。按 vae_stride = (8,16,16) 和 10 秒推算,latent 是 32 × 32 × 56 = 57,344 个视频 token,加 250 个音频 token 和文本 token。100 步 UniPC,每步 batch=2 同时算条件与无条件分支(等价 200 次单样本前向),CFG 强度视频 5.0、音频 7.0,负面提示词是一段写死的长串——视觉、音质、播音腔三段拼起来,光"AI voice / synthetic / TTS / 念稿感"就列了十几个词。上下文并行用 Ulysses,cp_size = 8,ep_size = 8。 精修阶段换成一个约 6.7B 的稠密 DiT(30 层、宽 4096、num_query_groups = 8 走 GQA),做的事比"超分"多: 把预览 latent 三线性插值到 63 × 68 × 120——时间维 32 → 63,等于顺手做了 2× 时间插帧,最终输出 25fps; 按 σ[220] 部分加噪,latent × σ + noise × √(1-σ²),是 SDEdit 那个套路; 5 步 UniPC 重新去噪,CFG 降到 2.0。 这一阶段的视频 token 是 63 × 68 × 120 = 514,080 个,比预览阶段多 9 倍。50 万 token 显然不能全注意力,所以 30 层全部走滑窗:8×4×4 分块、块半径 2,也就是每个查询块看周围 5×5×5 的块邻域。 有两个数字对不上直觉,值得单独拎出来: 算力分配极不均衡:预览阶段用 5.7 万 token 跑 200 次 114B 前向,精修阶段用 51 万 token 只跑 10 次 6.7B 前向。绝大部分 wall-clock 都花在预览阶段,官方也承认瓶颈就是没蒸馏的步数。 refiner 完全不管声音:magi2_refiner_audio_noise_scale = -1.0,代码注释写得很直接——the refiner is asked to improve the video and nothing else。音频 token 直接置零,最终音质完全由 512×896 那一阶段决定。 解码用的是蒸馏过的 turbo_vae(TurboV3-Wan22-TinyShallow),时间滑窗,每个视频只在一个 rank 上跑。视频 VAE 本身来自 Wan2.2-TI2V-5B,48 通道;文本编码器是 Qwen3.5-27B,56GB,输出 5120 维。 12 评测:只有一个第三方数字,官方一个都没给 这一节短,因为实在没什么可写。 官方材料里没有任何量化评测。 没有 VBench,没有内部人评,没有和 Wan / Veo / Kling 的对比表,甚至没有 loss 曲线。博客里两处"能力涌现"的描述都标注为 qualitative observations。 唯一可查的第三方数字是上面那张图:Artificial Analysis Image-to-Video Arena,Elo 1105,95% 置信区间 ±9,5650 张盲测投票,排第 6,API 价格栏写着 Coming soon。 所以现在能下的判断只有: 画面质量落在"开放权重里可用、但不是最好"这一档,被 MiniMax H3 明显拉开; 作为架构与系统的研究物料,它的价值和 Elo 排名基本无关; 想知道这套 Ultra-Fine-Grained MoE 到底值不值,得等 Sand.ai 补 scaling 曲线和受控消融,或者等社区自己做。 一份标题叫 Scaling Video Generation Models Efficiently 的报告,没有 scaling 曲线——这句吐槽我在第 02 节说过一次,这里还得再说一次。 13 本地跑起来要什么,以及你大概不该跑 硬件与环境: NVIDIA Hopper × 8(H100/H800 这一档)。发布配置把 cp_size 和 ep_size 都写成 8,想换卡数得自己改 config 并承担形状对不上的风险; Python 3.12 + 较新 CUDA toolkit; ffmpeg 必须在 PATH 上,否则视频照样出,但是静音的; 还需要 MagiAttention 和 MagiCompiler,pin 的版本记在 Dockerfile 的 build args 里。 权重 307GB。按 HuggingFace API 返回的文件大小统计,89 个文件的构成是:preview 228.1GB(56 个 safetensors 分片)、text_encoder 55.6GB、refiner 13.5GB、stable-audio-open-1.0 4.9GB、vae 2.8GB、turbo_vae 1.9GB。 最省事的路是 Docker: docker pull sandai/magi-2-preview:latest docker run --gpus all -it -v /path/to/ckpt:/workspace/ckpt sandai/magi-2-preview:latest 顺手提一句官方的好习惯:镜像有 per-commit tag,报告结果时应该写 sandai/magi-2-preview:<commit> 而不是 latest,镜像里 /etc/magi2-build-info 也记着构建来源。 下权重和跑 demo: hf download sand-ai/MAGI-2-preview --local-dir ckpt bash scripts/run_demo.sh 单条生成直接调 entry point: torchrun --nproc_per_node=8 inference/pipeline/entry.py \ --prompt "a red fox in snow" --output output/ 显存策略要留意:MAGI2_TEXT_ENC_OFFLOAD_MODE、MAGI2_PREVIEW_OFFLOAD_MODE、MAGI2_REFINER_OFFLOAD_MODE、MAGI2_VAE_OFFLOAD_MODE 四个环境变量分别控制四个大组件在阶段之间放哪,取值 cpu / gpu / roundtrip。preview 和 refiner 默认都是 roundtrip——1080p 时这两个模型在 80GB 卡上放不下彼此的激活,只能进出倒腾。这也意味着每次生成都要吃一轮 CPU↔GPU 搬运的时间。 我的建议: 做视频生成研究的:值得下,但重点看的应该是 inference/flash_mh_moe/、MultiHeadMoELayer 和两份 config,而不是生成效果。这是目前唯一能读到的百亿级视频 MoE 实现。 做业务落地的:现在不要上。10 秒固定时长、100 步未蒸馏、8 卡 Hopper 起步、Elo 落后同档开放权重模型,这四条里任意一条都够劝退。等蒸馏版和 API。 想学 MoE 工程的:这份代码质量很高,Triton 融合算子、静态形状通信、offload 编排、确定性开关都是能直接抄的范式,而且 Apache 2.0。 14 横向对比 模型 参数量 架构 音频 时长 分辨率 硬件 开放程度 I2V Arena Elo MAGI-2 Preview 114B 总 / 6B 激活 单流 Multi-Head MoE + 稠密 refiner 联合生成,含对白/环境声 固定 10s 1088×1920 Hopper × 8 权重 + 代码 Apache 2.0 1105(第 6) MiniMax H3 33B 稠密 单流 Omni Transformer 联合生成,32kHz 立体声 4–15s 768p 开放 / 2K 需闭源链路 — 权重开放,自定义社区协议 1190(第 3) MAGI-1 / 1.1 24B 稠密 分块自回归去噪 无 可延长,支持续写 720p H100 × 8(4.5B 版单卡 4090) Apache 2.0 — Wan 2.7 — DiT(2.2 起用高噪/低噪双专家 MoE) 部分版本支持 5s 起 720p/1080p 消费级可跑小版本 Apache 2.0 1094(第 7) Dreamina Seedance 2.0 未公开 未公开 支持 — 720p 云端 闭源,$9.07/min 1198(第 1) Veo 3.1 未公开 未公开 支持 — — 云端 闭源,$24.00/min 1085(第 10) (Elo 与价格取自 Artificial Analysis I2V Arena 2026-08-07 快照;"—"表示官方未公布或该榜未收录。) 这张表里最扎人的一行对比是前两行:114B 总参对 33B 稠密,输了 85 分 Elo。 这不能说明 Ultra-Fine-Grained MoE 路线错,因为 MAGI-2 明说自己是 intermediate release、没蒸馏、没调够;但它确实说明总参数量在这个赛道不是可以直接换成画质的硬通货。 15 总结感受 先说我最欣赏的地方:这是一份诚实的技术报告。 Sand.ai 没把 MAGI-2 Preview 包装成"新 SOTA",从标题到结论都在说这是路径验证。博客最后那句话我觉得写得相当好—— 模型架构决定容量如何组织,数据决定这份容量能学到什么,系统决定这份容量能否被可靠地训练和部署。 三者必须一起 scale,缺一个都不行。这个框架比"我们把模型做大了"要清晰得多。 然后说我觉得可惜的地方,主要是三条: 第一,最该有的东西没有。 一份讲 scaling 的报告,没有 scaling 曲线、没有受控消融、没有能力边界分析。作者把这三样列进了 next stage 的优先事项,但"下一步会做"和"这次做了"对读者的价值差得很远。现在社区能验证的只有"这套东西跑得起来",验证不了"这套东西比稠密/常规 MoE 更好"。 第二,代码比博客诚实。 mHC、共享专家、模态专属专家、attention sink——这些真正影响训练稳定性和多模态平衡的设计,配置和源码里实现得完完整整,博客里一个字没提。反过来,博客花很大篇幅讲的 Head Parallel 通信优势,其实主要来自一篇 ASU 的 4B 规模工作。该署名的没说清,该自夸的没说出来,这个信息分布挺奇怪的。 第三,能力面收得太紧了。 固定 10 秒、只支持首帧、没有音频编码器、refiner 不管声音、不支持续写——比 MAGI-1 少了流式和长视频,比 MiniMax H3 少了尾帧、音色参考、动作参考。可以理解(要控制系统变量),但这也意味着它现在只能是研究物料,不是生产工具。 最后回到那个真问题:把 token 切成 12 份、每份从 256 个小专家里挑 6 个,这个方向对吗? 我的看法是:方向值得追,但这次没被证明。 值得追的理由是那张参数拆解图——它让人看清了一个反直觉的事实:114B 里 95% 的参数是专家池,可"每 token 激活 6B"里却有 57% 是注意力和恒定稠密件。MoE 把 FFN 的容量-算力解耦做到了极致,但视频生成真正贵的是长序列注意力,那部分一点都没省。 所以在视频上继续堆专家池,边际收益到哪一层会掉下来,这是个必须靠实验回答的问题,而这次没答。 如果 Sand.ai 下一版能补上"同算力预算下,Ultra-Fine-Grained MoE 对稠密、对常规 MoE 的对比曲线",这套东西的分量会完全不同。在那之前,MAGI-2 Preview 最大的价值是:它让一个百亿级视频 MoE 的架构、路由行为和推理特性,第一次可以被外面的人直接读、直接跑、直接质疑。 就一次开源来说,这已经不算小。 本文只依据公开博客、模型卡、配置文件与推理源码分析,未下载权重、未实际运行推理。文中"推算"的参数量与 token 数为作者根据 config 与源码计算所得,可能与官方口径存在差异,欢迎指正。 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月07日
20 阅读
0 评论
0 点赞
2026-08-07
AIGC 每日速读|2026-08-07|Meta实测视觉懒惰生成数据只留5%反而更强
今日 AIGC 论文速览 今日共 10 篇 · 统一多模态预训练与Tokenizer 2 篇 · 统一音视频生成 3 篇 · 生成后训练与奖励对齐 3 篇 · 自回归与长视频生成 2 篇 重点论文标题列表 MM-Pretraining Physics(Meta FAIR·Reality Labs·牛津大学):生成数据只留5%反而更强 Vorch-Omni(Vorch Team):一个模型吃下30种音视频配置 Vorch-Streamer(Vorch Team·同济大学·哈工大深圳·上海交大):27.12FPS边说边生成数字人 Vorch-Director(Vorch Team·浙江大学):22个镜头分钟级不掉线 KVAE(Kandinsky Lab):音图视三件套PSNR多涨1dB 今日论文速览 1. MM-Pretraining Physics:生成数据只留5%反而更强 Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes | Meta FAIR·Reality Labs·牛津大学 | arXiv:2608.05000 关键词:统一多模态预训练,视觉懒惰,MoE,数据配方,Meta FAIR 前序问题:统一多模态预训练已经成为共识路线,但语言、视觉理解、视觉生成三种能力在联合训练时到底怎么互相传递知识、什么时候协同什么时候打架、视觉数据该在训练的哪一刻加入,业界基本靠经验和直觉,公开的对照实验很少。 本文贡献:用严格的单变量控制实验系统拆解统一预训练,给出四条结论:一是知识流动高度不对称,语言是万能助推器、视觉理解是生成的强先验,而生成几乎不反哺前两者;二是数据复杂度决定模态是协同还是竞争,共享注意力与归一化、拆开前馈层的架构最有利于协同,且换视觉 tokenizer 结论不变;三是必须早期统一、同步联训,晚接视觉会触发作者命名的「视觉懒惰」;四是把这些结论合成非对称数据配方 L70/U25/G5(语言 70%、理解 25%、生成 5%)。 实验效果:在 13.5B MoE(256 专家、每 token 激活 16 个、其中 2 个模态专属,激活参数 1.5B)上用 2T token 做单变量对照:非对称配方相比均衡配方 L50/U25/G25,语言准确率 54.31% 对 52.86%,视觉理解均值 43.08 对 41.42,GenEval 从 0.467 升到 0.482、DPG 从 0.676 升到 0.689——生成 token 少了五倍,文图对齐反而更好,5 万张图的 FID 5.234 与均衡配方的 5.131 基本持平。视觉懒惰有四路机械证据:语言预热从 0B 拉到 800B token 后,视觉 FFN 的训练态与推理态激活幅度、图像包裹 token 的嵌入范数、推理时落在图像 token 上的注意力占比全线下滑。 批判点评:这类「控制变量做到底」的实证研究比又一个新架构更稀缺,尤其「生成数据只给 5%、生成指标反而更好」直接冲击了「想让模型会画就多喂图」的直觉,而视觉懒惰给「强 LLM 接视觉后仍然看图犯低级错误」提供了可测量的解释。局限也明显:结论建立在 Meta 自有数据与 RAE 编码器体系上,2T token 的对照跑一次成本极高,外部团队几乎无法复现;L70/U25/G5 是在这套设定下搜出来的,换数据分布未必照搬;GenEval 0.482 本身离商用文生图还有距离,说明配方优化的是预训练起点而非最终生成力。 2. Vorch-Omni:一个模型吃下30种音视频配置 Vorch-Omni: Multi-Task Orchestration of Sight and Sound | Vorch Team | arXiv:2608.05803 关键词:统一音视频生成,任意条件到任意输出,LTX-2.3,流匹配DiT,多任务 前序问题:文生视频、参考图生成、视频续写、指令编辑、视频配音这些能力今天大多各自训一个模型。一旦把目标视频、源视频、参考图、参考音频塞进同一条序列,模型就分不清哪段该生成、哪段要原样保留、哪段只提供身份或风格;加上音频既可能是条件又可能是输出,任务空间会成倍膨胀。 本文贡献:把所有任务统一成「任意条件到任意输出」的一次条件去噪:每个任务由视频目标、视频条件、音频目标、音频条件四个集合描述,token 级条件掩码决定谁保持干净、谁被去噪,任务标识区分目标/源/主体参考/音频参考/编辑条件,位置类型再区分「与目标共享连续时间轴」(如续写)和「独立参考网格」。视觉条件走两条互补通路——视觉语言模型读采样帧加文本指令给语义,视频 VAE 把完整条件编码成干净 latent 保结构。底座是单个 LTX-2.3 音视频流匹配 DiT(48 层,视频流 32 头×128 维、音频流 32 头×64 维),新任务只改配置不改结构。 实验效果:同一套权重覆盖 10 类以上任务、30 多种条件—输出组合,包括文生视频、文生音视频、图像与参考驱动生成、时间续写、音频驱动生成、视频转换以及单模态和跨模态编辑。人评部分组织 527 组样本、11361 条维度级判断与 Wan 2.7 盲测:81.4% 的判断认为两者相当,Good 与 Bad 各占 7.7% 和 8.0%,总体净胜率 -1.9%;但在最考验统一能力的维度上净胜率为正——音频指令遵循 +7.1%、参考一致性 +6.6%、音画同步 +5.9%、音频质量 +3.3%。 批判点评:把任务差异全部下沉到「token 角色 + 位置类型」的配置层、而不是每个任务加一个分支,是目前统一音视频模型里比较干净的一种抽象,作者也没有粉饰总体净胜率是负的这一点。但代价同样清楚:底座是别人的 LTX-2.3,全参数微调 5 万步,单卡 batch 只有 1;总体 -1.9% 意味着「统一」眼下换来的是特定维度的优势而非全面超越;作者自己也承认长时程一致性、精细局部编辑和多语言多说话人语音仍未解决。Vorch Team 未公开所属机构,权重与代码也没给出时间表。 3. Vorch-Streamer:27.12FPS边说边生成数字人 Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming | Vorch Team·同济大学·哈工大深圳·上海交大 | arXiv:2608.05663 关键词:实时流式生成,数字人,Self Forcing,DMD蒸馏,语音规划token 前序问题:实时数字人要求边生成边播放,模型只能看历史不能看未来。把预训练的双向音视频扩散模型改成因果流式有两个坎:一是自回归复用自己生成的块会累积曝光偏差,几十秒后身份漂移、画面糊掉;二是给定一整段要说的话,因果生成器在只有局部上下文时并不知道当前这一块该说到哪一句。 本文贡献:在 22B 的 LTX2.3 音视频底座上做三阶段后训练。先用同一个底座合成 8 万条 12–21 秒的数字人音视频语料,保证监督信号与初始化同源;再以样本级混合 Teacher Forcing 与 Diffusion Forcing 训出 20 步因果短流式模型;最后做长时程 Self Forcing,让因果学生在完整 12–21 秒时域上自我 rollout,冻结的原双向模型作为 real-score 教师做 DMD 蒸馏,把双向模型的画质迁移到因果长轨迹上,同时把去噪压到 4 步。语音进度用外部语言模型预测 25 Hz 的离散「说话规划 token」——与 LTX 音频 latent 同频率,因此每个因果块都能拿到属于自己那一秒的语音内容。 实验效果:768×512、24 FPS 设定下,单张 H200 上端到端 DiT 吞吐 27.12 FPS,是评测中唯一越过 24 FPS 实时播放线的原生 T2AV 方法,且不需要外部音频或参考首帧。约两分钟的连续 rollout 在 0/30/60/90 秒采样帧上仍保持身份与场景一致,音唇同步 Sync-C/Sync-D、词错率、VBench2 身份与人体结构指标均有竞争力。推理用 3+1 因果窗口(三个常驻前缀块加最近一块)。训练侧第二阶段 64 张 H200 跑 6000 步,第三阶段 32 张 H200 跑 1000 步。 批判点评:「实时」这次是有明确定义的:24 FPS 播放线、单卡、四步去噪、有界上下文,比笼统说加速可信得多,25 Hz 说话规划 token 也确实解决了因果生成器不知道该说哪句的具体问题。但 27.12 FPS 建立在 H200 和 768×512 这个不算高的分辨率上,换消费级显卡或上 1080p 结论就不成立;训练语料是底座自己合成的 8 万条,风格和多样性都受限于教师,真人视频上的泛化没有验证;两分钟的 rollout 也还不是「无限长」。 4. Vorch-Director:22个镜头分钟级不掉线 Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification | Vorch Team·浙江大学 | arXiv:2608.05776 关键词:长视频续写,曝光偏差,噪声感知残差,多镜头故事,ST-Bench 前序问题:分钟级音视频靠自回归续写实现:把长视频切段,第 t 段以前面已生成的画面和声音为条件。但训练时喂的是干净的真值历史,推理时喂的是模型自己带着漂移、模糊和音画错位的输出,误差一段段滚雪球,最终身份跑偏、画面变平、声画不同步。已有做法把预测残差当作合成噪声注入历史来缩小这个落差,但都用一个与噪声水平无关的固定强度。 本文贡献:作者观察到残差修正是否有效,关键取决于残差是在流匹配的哪个噪声水平上产生的。于是把每条残差连同它产生时的噪声水平 σ 一起存下来,训练某个 σ 步时只采样同一噪声区间的残差并缩放到该区间,让注入的错误和去噪过程真正对齐;这样既保留了 teacher forcing 的训练效率,又造出接近推理分布的历史。配套设计包括始终不加噪的干净锚定窗口(clean sink),以及区分历史视频、参考图像、目标视频的任务嵌入,支持多镜头、多主体、参考引导的长时音视频生成。 实验效果:在 30 个用例、每例约 10 个镜头的多镜头故事基准 ST-Bench 上,用统一评测器重跑全部方法(不混用已发表数字),四项跨镜头一致性指标全面领先,ViCLIP 达 0.7887 而最强基线只有 0.5900,两项长程指标 ARC 与 Reappear 同样领先;对比对象包括 StoryDiffusion+Wan、StoryMem、HoloCine、Memento。另在 200 例的 UnityShots 上跑了 T2V 与 R2V 两种设定,并自建带同步语音、音乐和音效的长音视频基准,每例连续 22 个镜头达到分钟级,配套提出质量漂移和锚定相对一致性两个长程退化指标。 批判点评:「残差要按噪声水平配对注入」是个很具体也很容易被忽略的细节,作者还老老实实用同一评测器重跑所有基线,避免了各家用各自设定报数字的常见问题,新增的长程漂移指标也补上了平均分掩盖退化的缺口。但基线的画质与文本一致性其实并不输,领先主要集中在跨镜头一致性这一类指标上;ViCLIP 0.7887 对 0.5900 的巨大差距有多少来自方法本身、多少来自 LTX-2 底座与基线不同,论文没有拆开;自建基准由自己定义、自己评测,说服力要等第三方复现。 5. KVAE:音图视三件套PSNR多涨1dB KVAE: Family of Tokenizers for Multimodal Generative Models | Kandinsky Lab | arXiv:2608.05798 关键词:视觉tokenizer,VAE,音频编解码,因果压缩,开源 前序问题:潜空间扩散的天花板一半压在 tokenizer 上:压缩率、通道数、因果性直接决定生成模型的学习速度和最终画质。但开源社区里 tokenizer 的训练细节、选型方法和设计取舍几乎都藏在大模型报告的角落,后来者只能反复踩坑。 本文贡献:一次性放出覆盖三种模态的 KVAE 全家桶并开源:KVAE-Audio 是 48 kHz 全带宽连续音频 tokenizer,latent 帧率 50 Hz、64 通道;KVAE-3D 是两个因果视频 tokenizer,压缩率分别为 4×16×16(64 通道)和 4×8×8(16 通道);KVAE-2D 是空间 8 倍压缩、32 通道的图像模型。视频侧刻意做成无注意力的纯 Conv3D 结构,配合缓存机制可以处理任意长序列,归一化用空间 RMSNorm 以便推理时调整分段大小,上下采样把时间和空间操作拆成先后两步。编码器解码器故意不对称:4×8×8 的解码器约为编码器的 1.3 倍,4×16×16 直接做到 5.3 倍,把容量押在需要生成能力的解码侧。 实验效果:在 MCL-JCV 720p 重建评测上,同压缩率分组内平均比 Wan-2.1(PSNR 34.3)、Wan-2.2(34.2)和 HunyuanVideo 高出 1 dB 以上 PSNR,LPIPS 损失可以忽略。生成侧用统一的 2B CrossDiT(Qwen-2.5VL 文本编码器、流匹配损失、同一批数亿图文数据和超参)只换 tokenizer 做对照:KVAE-4×16×16 与指标完全一致,相比 Wan-2.2 让出一点视觉观感换来更好的提示词遵循,对 HunyuanVideo-1.5 则在全部类别上被更多人选中;有意思的是 KVAE-4×8×8 出现客观指标与人评打架的情况——PSNR 不占优,盲测却名列前茅。整体对标 Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio、MMAudio,代码已在 GitHub 公开。 批判点评:肯把训练细节、选型方法和消融一起交出来的 tokenizer 报告非常少,这份等于给中小团队省掉一轮昂贵的试错,「客观指标与人评打架」的坦白也比一味报 PSNR 有价值。但要注意重建指标只在 MCL-JCV 一个数据集上测,生成对照又只用 2B 模型和数亿量级图文数据,能否外推到十亿级视频数据和更大生成骨干是未知数;1 dB PSNR 的领先在下游生成里究竟折算成多少可感知收益,论文自己的人评已经说明关系并不线性。 6. Latent Reward Register:寄存器读奖励省33倍GPU时 Latent Reward Registers for Diffusion Preference Alignment | 快手可灵Kling Team·中科大 | arXiv:2608.03929 关键词:偏好对齐,latent奖励模型,寄存器token,on-policy蒸馏,可灵 前序问题:扩散模型对齐人类偏好,通常只在最终生成图上算一个稀疏的终点奖励,几十步去噪要共享这一个分数,时序信用分配极其困难。想改成稠密奖励,又绕不开把中间 latent 解码回像素空间的高昂代价。 本文贡献:提出 Latent Reward Register:在冻结的 DiT 输入序列前面挂一串可学习、无位置的寄存器 token(实验用 K=32),让它们从中间带噪 latent 里直接读出终点偏好。关键在于这是一条独立读出通路,不改动生成器的隐藏状态和速度场,因此拿到的是贯穿整个去噪过程、可微分的稠密奖励。基于它给出两种用法:训练侧的 RG-OPD 沿 on-policy 轨迹蒸馏奖励引导的更新,绕开标准策略梯度里昂贵的完整 rollout;推理侧的 RGS 用量级匹配的奖励梯度直接引导采样轨迹,一个参数都不用改。 实验效果:在 ImageReward、HPDv2、HPDv3、GenAI-Bench 合计 54170 对样本上,把 latent 前向加噪到高噪声区 u=0.8 打分,寄存器在所有 latent 奖励模型中成对偏好准确率最高。训练侧 SD3-Medium 上 RG-OPD 的 HPSv3 达 11.57,高于 AlignProp 的 11.20、ReFL 的 10.84 和 Flow-GRPO 的 10.26,MUSIQ 74.9、CLIP-IQA 0.726 同时领先,GPU 时最多省到原来的三十三分之一;FLUX.1-dev 上 HPSv3 12.38 同样第一。推理侧 RGS 在免训练方法里刷新 SOTA,SD3-Medium 上 HPSv3 10.70 对 DNO 的 8.85、Demon 的 9.09,且 MUSIQ 与 CLIP-IQA 一并提升而非以画质换分数。代码与权重已开源。 批判点评:「不动生成器、只挂一串寄存器 token 去读奖励」是个很轻的接口设计,33 倍 GPU 时的差距对预算有限的团队几乎是能不能做在线对齐的分水岭,而且训练和免训练两条路复用同一套读出器。需要警惕的是奖励是从生成器自己的特征里读出来的,两者共享盲区时容易一起自我强化,论文报的 MUSIQ 与 CLIP-IQA 都是无参考指标,扛不扛得住长时间优化下的奖励攻击没有给出曲线;实验也集中在 SD3-Medium 和 FLUX.1-dev 两个文生图骨干,视频扩散上还是空白。 7. SURE:让奖励先说自己有多不确定 Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training | 中国电信TeleAI·上海交大 | arXiv:2608.06125 关键词:latent奖励,不确定度,奖励攻击,扩散后训练,TeleAI 前序问题:latent 奖励模型能在不解码回像素的前提下监督扩散模型,效率很高,但它们只吐一个标量分数。生成器无从判断这次反馈到底可不可信,一旦在模型本就没把握的样本上照单全收,优化方向就会跑偏,进而演变成奖励攻击。 本文贡献:让奖励模型同时输出「打多少分」和「这个分有多不确定」。SURE-LRM 为每个带噪 latent 预测一个高斯效用:均值是奖励分数,方差是预测的不确定度,且完全从成对偏好中学出来,不需要额外人工标注。SURE-REFL 再把这份不确定度用起来——在选定的去噪转移点上查询冻结的 SURE-LRM,把 detach 后的方差换算成同一转移点内样本之间的可信度权重,每个加权奖励只沿本地转移回传。整条链路留在 latent 空间,既不需要像素解码,也不需要展开完整去噪图。 实验效果:偏好预测上跨三个骨干的均值从 DiNa-LRM 的 70.51 提升到 72.14,FLUX.1-dev 上单点最大提升 2.30。不确定度确实有信息量:排错的样本残差方差平均高 24.26%,用方差识别排序错误的 AUROC 为 0.6941,只保留方差最低的一半样本可把成对准确率从 79.40% 抬到 90.10%。视频侧 VisionRewardDB 72.31%、T2V Ranking 71.70%,均为最好。图像后训练在三个生成器、九个骨干—指标组合里拿下八项第一;视频用 Wan2.1-480P-T2V-14B 后训练,VBench 质量、语义、总分均为评测中最高。作者还给出对照曲线:DiNa-LRM-REFL 的优化奖励持续上升而独立的 HPSv3 已经开始下跌(典型奖励攻击),SURE-REFL 两条曲线则能同步更久。 批判点评:把「奖励可不可信」显式建模出来,比事后加正则更对症,方差—错误率的诊断也做得实在。但不确定度是无监督学出来的,AUROC 0.6941 说明它只是弱信号,离可靠的置信度校准还有距离;作者自己也承认「保留低方差一半准确率涨到 90.10%」这组样本训练时见过,属于分布内诊断而非留出校准。更根本的是,可信度只在同一转移点内做相对比较,如果整个时间步的奖励模型集体偏了,加权也救不回来。 8. LC-GRPO:动态度从12.5救回45.8 LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction | 普林斯顿大学·加州大学圣地亚哥分校 | arXiv:2608.05600 关键词:Flow-GRPO,Langevin修正,训练推理错配,奖励攻击,强化学习 前序问题:流匹配模型推理时解确定性 ODE,而在线强化学习需要随机 rollout 来探索,于是现有 GRPO 训练时把 ODE 换成 SDE。连续时间下两者边缘分布相同,但有限步离散化后差别很大:探索噪声一大,SDE rollout 就发糊,拿这些糊掉的样本算奖励去训练,和最终 ODE 采样器生成的东西对不上号。 本文贡献:每一步 rollout 先走一步与推理对齐的 ODE Euler,再补一步针对该时刻边缘分布的随机 Langevin 修正。修正需要的 score 直接从流速度里换算出来,不用额外训练 score 模型;修正后的转移仍是各向同性高斯,似然可解析,能直接喂给策略优化。理论上作者证明:在合适条件下一步 Langevin 修正能降低不完美 ODE Euler 步的 Wasserstein 误差;在随机性水平匹配时,该转移比反向 SDE 的标准 Euler–Maruyama 离散更准确。 实验效果:SD3.5-Medium 上文字渲染 OCR 奖励做到 0.960,高于 Flow-GRPO 的 0.914 和 CPS 的 0.935,且 ImageReward 1.00、CLIP 0.291 等旁路质量指标不掉;人类偏好对齐 HPS-v2.1 达 0.393 对 0.381。FLUX.1-Dev 上 HPS-v2.1 0.384、PickScore 23.28 均第一。最刺眼的是视频:HunyuanVideo 用 VideoAlign 视觉质量做奖励,DanceGRPO 把 VBench 动态程度从原模型的 52.8 压到 12.5(画面几乎不动来骗高分),LC-GRPO 保住 45.8,同时 VideoAlign 视觉质量从 -0.205 提到 0.063、VBench 总分 79.10。计算上并不占便宜:Langevin 每步两次前向,作者让基线跑同样和两倍的 rollout 步数取更好结果。 批判点评:指出「训练用 SDE、推理用 ODE」这个人人默认却没人细究的错配,还给了 Wasserstein 误差的理论支撑,而不是纯经验 trick,视频那组动态程度 12.5 对 45.8 更是把奖励攻击拍在明面上——很多 GRPO 的涨分其实是靠画面变静态换来的。要留意每步两次前向的开销是实打实的,作者靠给基线加倍步数来对齐算力,但这不完全等价于同等 wall-clock;实验只覆盖 512×512 分辨率和 HPS、CLIP、OCR 这几类可打分奖励,更主观的美学或叙事奖励是否同样受益尚不清楚。 9. In-Context Forcing:上下文加噪反而提速82% In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion | 上海科技大学·腾讯优图·浙江大学 | arXiv:2608.05237 关键词:自回归视频扩散,噪声上下文,跨帧并行,推理加速,Self Forcing 前序问题:少步自回归视频扩散在生成当前帧的每一个去噪步时,都拿前面已经彻底去噪的干净帧当上下文。干净帧泄露了太多局部细节,模型顺手抄过来就行,结果时序语义被削弱、画面越生成越静止。而如果简单地给上下文加同样强度的噪声,引导又不够,时序一致性会崩。 本文贡献:借「扩散即掩码」的视角重新设计上下文:让上下文帧带上递减的噪声水平——离得远的帧掩得少、紧挨着的帧掩得多,形成渐进式自回归范式,既保住时序一致性又留出帧间动态。更实际的收益是,一旦不再严格依赖「前面必须是干净帧」,跨帧就能并行去噪,推理不再是一条串行长链。训练上以 Wan2.1-T2V-14B 为教师、其因果版 1.3B 为学生,batch 64 跑 1900 步。 实验效果:VBench 上视觉保真度和推理速度双双超过现有方法。逐帧设定下吞吐从 Self Forcing 的 8.9 FPS 提到 16.2 FPS,相对提速 82%,总推理时间减少 45.1%;即便在本已优化过的分块设定下也还能再省 9.3% 时间。30 秒长视频差距最明显:动态程度 86.40 对 Rolling Forcing 的 40.63——后者训练测试不一致的问题会随着滚动窗口反复传播,越长越静止。盲测 A/B 用户研究中相对 Wan2.1、CausVid、Self Forcing 三个基线均获偏好。 批判点评:「给上下文加噪反而更好」违反直觉但解释得通:干净帧提供的是模型可以偷懒复制的捷径。更漂亮的是解开干净帧依赖后顺带解锁跨帧并行,质量和速度不再是二选一。不过 82% 提速是在逐帧这个本身效率最差的设定下取得的,切到实际常用的分块设定就只剩 9.3%,标题数字有挑好看的成分;学生模型只有 1.3B,是否能迁移到 14B 级别未验证;动态程度高也不等于运动合理,86.40 里有多少是有意义的运动仍需人眼确认。 10. Diff-VF:免训练把短视频拉长4倍 Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model | 上海交大·上海人工智能实验室 | arXiv:2608.05976 关键词:免训练长视频,窗口融合,噪声初始化,VBench-Long,即插即用 前序问题:现有视频扩散模型基本都用 10 秒以内的短视频训练,直接外推到长视频就会崩:要么长程语义漂移,要么为了保一致性把画面拍成几乎静止。而重新训练长视频模型既缺数据也缺算力。 本文贡献:提出免训练、即插即用、与骨干无关的 Diff-VF,全部操作只在噪声 latent 上做,因此不挑空间时间建模方式。三招配合:混合噪声初始化用第一段噪声锚定全局语义、后续段追加噪声补充内容多样性;加权窗口采样给每个窗口内的帧按到窗口中心的距离分配权重,让重叠区平滑过渡而不是简单平均出接缝;时间扩展采样把视频按固定间隔抽成若干等距子片段分别去噪再还原顺序,用随时间步变化的融合建立长程依赖。此外用跳跃残差引导把框架扩展到长视频增强,在保真与真实感之间做时间步相关的平衡。 实验效果:在 LaVie 上做 VBench-Long 评测,相比基座模型(主体一致性 0.8546、动态程度 0.9722)和免训练基线,Diff-VF 主体一致性升到 0.9164、动态程度 0.7208,高于 FreeNoise 的 0.6958 和 FreeLong 的 0.5625;整体一致性 0.2795 与人物动作 0.9580 均为最好,运动平滑度 0.9529 也居首。换到 HunyuanVideo 同样有效,说明对 2D+1D 与 3D 注意力两种结构都适用,生成长度是基座原生输出的 4 倍。对比对象包括 FreeNoise、FreeLong 和 RIFLEx。 批判点评:一行权重都不改就把短视频骨干拉长 4 倍,这类方法的部署成本几乎为零,权重函数和等距采样的设计也确实比简单平均更讲究,作者跨两种注意力结构验证了通用性。但要看清代价:基座原本 0.9722 的动态程度被压到 0.7208,只是压得比 FreeLong 的 0.5625 少而已,「一致性—动态性」的跷跷板并没有被打破,只是挪了个位置;评测停在 LaVie 和 HunyuanVideo,没碰 Wan、CogVideoX 这些主流骨干;4 倍长度对分钟级叙事而言仍然偏短。 趋势观察 统一多模态预训练开始有可复现的经验定律 — Meta 用 13.5B MoE、2T token 做单变量对照,得出语言 70%、理解 25%、生成 5% 的非对称配方,生成 token 少五倍反而把 GenEval 从 0.467 抬到 0.482;早期统一还是晚期对齐也不再是口味问题,晚接视觉会留下可测量的「视觉懒惰」。 音视频不再是先出画面再配音,而是同一条序列里的角色分配 — Vorch 三连发把目标、源、参考、历史统一成 token 角色与位置类型:Omni 一套权重覆盖 30 多种条件—输出组合,Director 用噪声配对的残差注入把 22 镜头的分钟级故事撑住,Streamer 在单张 H200 上把文本直出音视频推到 27.12 FPS。 奖励模型集体搬进 latent 空间,并开始交代自己的可信度 — 可灵的 Latent Reward Register 在冻结 DiT 上挂 32 个寄存器 token 直接读奖励,GPU 时最多省 33 倍;TeleAI 的 SURE 让奖励同时输出方差,把不确定的反馈自动降权。稠密、可微、带置信度的中间奖励,正在取代只看最终成图的稀疏打分。 强化学习和自回归都在补同一个洞:训练与推理不一致 — LC-GRPO 用 Langevin 修正让 rollout 与推理时的 ODE 采样对齐,把 DanceGRPO 压到 12.5 的 VBench 动态程度救回 45.8;In-Context Forcing 让上下文带递减噪声以匹配测试分布,30 秒长视频动态程度 86.40 对 Rolling Forcing 的 40.63。两者都说明:很多所谓的涨分,只是模型学会了让画面别动。 Tokenizer 和免训练技巧仍是被低估的杠杆 — Kandinsky Lab 把音频、图像、视频三套 tokenizer 连同训练细节与选型方法一起开源,重建 PSNR 平均比 Wan-2.2、HunyuanVideo 高 1 dB 以上;Diff-VF 不动一行权重,仅靠噪声初始化、加权窗口和等距采样就把短视频骨干拉长 4 倍。不是每个提升都需要重训一个大模型。 人工智能炼丹君 整理 | 2026-08-07 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月07日
13 阅读
0 评论
0 点赞
2026-08-06
AIGC 每日速读|2026-08-06|京东22B音画同修让百年老片复活OmniVR
今日 AIGC 论文速览 今日共 10 篇 · 音视频联合生成与修复 2 篇 · 实时与交互视频创作 2 篇 · 多模态Token高效压缩 2 篇 · 生成后训练与条件对齐 2 篇 · 评测与专业可控生成 2 篇 重点论文标题列表 OmniVR(中科大·京东探索研究院):22B让百年老片音画一起复活 JoyAI-Video-Edit(京东Joy Future Academy):16B单卡30FPS实时剪视频 ContextMaster(清华·南京大学·快手可灵·上科大·港科大):固定预算多镜头创作跑16.74FPS OmniPack(西北工业大学·北大·阿里·清华):无训练6.8%算力保住92.9% STEP-OPD(上海交大·阿里):蒸馏学生越过教师得分0.961 今日论文速览 1. OmniVR:22B让百年老片音画一起复活 OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films | 中科大·京东探索研究院 | arXiv:2608.04224 关键词:音视频联合修复,历史影像,LTX-2,多模态DiT,京东 前序问题:历史影像往往同时存在模糊、噪声、闪烁、曝光不足,以及嘶声、削波、掉音和带宽缺失。现有修复器通常把视频与音频拆开处理,不仅留下单模态质量短板,还可能破坏口型、动作和声音之间的同步。 本文贡献:提出首个音视频联合生成式老片修复模型 OmniVR。系统从 22B 参数 LTX-2 音视频骨干出发,把低质音频和视频编码成联合条件,在统一多模态 DiT 中同步去噪;以联合退化管线模拟真实老片损伤,用近零初始化通道拼接与提示词退火把 T2AV 平滑改造成 AV2AV,再以首帧锚定、模态损失重加权和波形监督支持跨 121 帧窗口的长视频修复。 实验效果:在 200 段真实历史片组成的 OmniVRBench 上,真实轨 MUSIQ 达 61.87,显著高于次优 RealBasicVSR 的 52.38;DNSMOS 从退化输入的 2.04 提升至 2.43,FAD 从 15.93 降至 8.32。12 名标注者给出 80.0% 综合偏好。模型输出 1920×1088,作者还报告在独立 RTN 老片基准的六项无参考视觉指标上全部第一。 批判点评:把“修画面”和“修声音”变成一次联合条件生成,方向比串联两个修复器更完整,指标和人评也有说服力。但 22B 骨干以 rank-384 LoRA 在 64 张 H200 上训练约 5 天,成本很高;强生成先验可能补出原片不存在的纹理与颜色,历史档案、司法取证等场景仍需要真实性约束。代码和权重目前只是承诺公开。 2. JoyAI-Video-Edit:16B单卡30FPS实时剪视频 JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion | 京东Joy Future Academy | arXiv:2608.03974 关键词:实时视频编辑,自回归扩散,两步蒸馏,720p,京东 前序问题:直播和视频通话中的编辑必须边接收边输出,不能偷看未来帧,也不能让显存和计算随视频时长不断增长。把离线编辑器简单切成小段会产生边界跳变,自回归地反复使用生成历史又会累积色偏、身份漂移和背景幻觉。 本文贡献:提出 16B 自回归扩散编辑框架:MLLM 条件编码器理解指令和参考,因果 VAE 与分块双向、跨块因果注意力负责流式输出,滑动窗口加首块全局 sink 把历史状态限制在固定预算。Source-Anchored DMD 将多步扩散蒸馏为两步,并用当前源视频块约束教师目标;长程自回归蒸馏则在分段 rollout 上直接学习累积误差。 实验效果:结合两步生成、固定历史 KV 缓存、FP8 量化和优化 VAE 管线,完整系统在单张 NVIDIA B200 上实现端到端 720p 约 30 FPS。自动指标和人评均显著超过现有流式编辑器,在短视频与长视频上可与强离线系统竞争;代码已经公开。 批判点评:这是今日最硬的工业数字:16B 模型把开放式编辑真正推到实时帧率,而且处理时无需预知视频总长度。但单卡指的是昂贵的 B200,30 FPS 不能外推到消费显卡;两步扩散和 FP8 的细节损失、长达数小时的稳定性以及输入输出延迟分布,还需要独立复现。 3. ContextMaster:固定预算多镜头创作跑16.74FPS ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing | 清华·南京大学·快手可灵·上科大·港科大 | arXiv:2608.04956 关键词:多镜头视频,交互创作,稀疏路由,上下文缓存,可灵 前序问题:真实视频创作会在多轮中交替生成新镜头、引用人物或场景、编辑已有素材,并持续继承历史。若每个去噪步都密集读取不断增长的上下文,延迟会随会话变长;若只保留短窗口,又会忘掉早期角色与约束。 本文贡献:提出交互式多镜头视频创作 IMVC 与统一模型 ContextMaster。角色感知 RoPE 区分参考图、历史镜头、源视频和待生成目标;可缓存的干净上下文只预填一次,块稀疏路由在固定预算内检索相关历史,ConstraintSink 强制保留参考和逐帧编辑约束。两阶段特权上下文蒸馏先用稠密教师做一致性蒸馏,再用分布匹配修复少步 rollout 的细节。 实验效果:在单张 H200、匹配分辨率与帧数的设置下,五镜头任务平均达到 16.74 FPS;跨镜头一致性由强基线的 0.808 提升到 0.836,并在文本生成、参考生成和视频编辑三类任务中取得最强综合表现。固定 6-FE 读取预算接近质量与速度最佳点。 批判点评:这项工作把多镜头创作从一次性提示升级为有状态工作流,并让每轮上下文读取保持定额,产品形态很清晰。但 16.74 FPS 仍依赖 H200;路由器漏掉关键旧镜头会造成不可逆遗忘,角色一致性也不等于剧情因果一致。训练阶段还使用 64 张 H200,复现门槛不低。 4. OmniPack:无训练6.8%算力保住92.9% OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models | 西北工业大学·北大·阿里·清华 | arXiv:2608.03812 关键词:全模态大模型,Token压缩,免训练,音视频理解,推理加速 前序问题:全模态大模型同时接收长视频与音频时,视觉和声音 token 数远超文本。现有压缩要么在进入 LLM 前过早丢掉分散在长时间轴上的证据,要么进入 LLM 后只听文本指令,没有充分利用已经对齐的音视频交互。 本文贡献:提出免训练两阶段压缩框架 OmniPack。LLM 前按模态重要性、全局覆盖和相似度合并结构冗余,把被删除信息回收到代表 token;多模态充分交互后,再用文本问题引导和音视频协作做第二次语义压缩。不同阶段分别处理“结构重复”和“任务相关性”,无需改权重。 实验效果:在 Qwen2.5-Omni-7B 上仅用原始 16.7% FLOPs 即保留 98.0% 性能;极限设置只用 6.8% FLOPs 仍保留 92.9%。15%/7.5% 两阶段保留率下,FLOPs 降低 10 倍、prefill 加速 4.5 倍,同时保留 95.6% 性能,并跨三种骨干、五项基准保持最佳效率折中。 批判点评:无需训练且跨 Qwen 与 MiniCPM 骨干有效,工程接入成本很低;把“先保全局结构、后按问题精炼”拆开也比统一打分更合理。不过结果主要来自 H20 上的 prefill,端到端对话延迟和 KV 缓存收益未完全等同;极低预算仍损失约 7% 综合性能,稀有短暂事件可能最先被压掉。 5. STEP-OPD:蒸馏学生越过教师得分0.961 STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models | 上海交大·阿里 | arXiv:2608.04887 关键词:扩散蒸馏,On-policy,超越教师,表示对齐,图像生成 前序问题:扩散模型的 on-policy 蒸馏通常只让学生在自己的去噪轨迹上拟合教师速度,理论最优点就是“和教师一样”,无法主动超过教师;只看最终输出还会放任各 Transformer Block 的内部表示以错误方式相互抵消。 本文贡献:提出 STEP-OPD:把任务教师相对共享基础模型的速度差视为能力提升方向,将缩放后的差值继续加到教师目标上,构造“教师之外”的输出外推目标;同时不直接硬对齐隐藏状态,而是匹配相邻 Block 表示变化的方向和幅度,让学生学习能力在网络内部如何逐层形成。 实验效果:在组合对齐、文字渲染与人类偏好三组能力上统一超过标准 DiffusionOPD,并使 GenEval 从 0.927 提升到 0.961;统一学生在三类能力上分别超过对应的单任务教师,证明多教师能力整合不必以教师上限为终点。 批判点评:“教师减基础模型”的差向量能否稳定代表可继续外推的能力,是很有启发性的假设,内部变化对齐也补上了只看终点的盲区。但外推系数依赖任务调参,走得太远可能放大教师偏差;目前只验证图像生成,扩展到视频等更长序列后,中间层监督的显存和计算成本会更突出。 6. TD-V2A:帧间差分让视频配音FAD降至0.53 Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation | 清华·南洋理工等 | arXiv:2608.04902 关键词:视频配音,帧间差分,音频扩散,时间对齐,视觉表征 前序问题:视频配音区别于看图配音的核心不是多看几张静态图,而是捕捉帧间运动变化。现有方法常外挂音视频对比模型、声学结构预测器或多模态大模型,系统复杂,且可能把真正决定声音时机的低层运动细节压掉。 本文贡献:提出 TD-V2A,直接把相邻帧差分作为额外视觉条件。作者比较像素帧差与编码后特征差,发现编码前差分保留的细粒度运动更有效;训练时以文本到音频预训练、原始视频条件、差分增强条件三阶段持续学习,采样时用退火差分引导在早期先确定全局声音动态,后期逐渐回到原始视觉语义。 实验效果:在约 1.5 万段 VGGSound 测试片上,FAD 达 0.53,优于 MMAudio 的 0.81;IS 达 16.9、ImageBind Score 达 33.8,均明显高于对比方法,时间对齐准确率 89.1。它甚至超过需要额外训练的 CAVP 音视频表示,且没有新增预测网络。 批判点评:把“视频比图片多出来的信息”直接定义为帧差,简单而有效,指标也说明低层运动不应过早被语义编码器抹掉。但逐帧差分对镜头切换、抖动和光照闪烁同样敏感,可能把无关变化误当声源;其时间对齐 89.1 仍略低于专门以对齐目标训练的 Diff-Foley 89.9。 7. CAPE-T2V:训练推理两头对齐提示词 CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation | 复旦·快手可灵 | arXiv:2608.03046 关键词:文生视频,提示增强,训练推理对齐,Caption,可灵 前序问题:视频 DiT 训练时看到的是详尽视频 caption,线上却由 Prompt Enhancer 把用户短句改写后再喂给模型。即使双方使用同一字段模板,细节选择、组织方式、粒度和措辞仍不同,形成残余 PE-Caption 分布缺口。 本文贡献:提出两步 Captioner-Anchored 对齐:先用外部视频描述器产生统一目标,把简短描述、详细描述和伪用户提示都训练成同一种 Anchored PE 输出;再让这个已经冻结的 PE 重写视频训练 caption 并微调 DiT,部署时仍由同一个 PE 改写用户提示,使训练侧与推理侧真正共享同一文本算子。 实验效果:在 Wan2.2 与 LTX-2.3、StoryEval/VBench-2.0/T2V-CompBench 的六个组合上全部超过只做 schema 对齐的基线。Wan2.2 分别提升 1.6、1.12、0.30 分,LTX-2.3 提升 1.4、0.92、0.65 分;caption 到推理改写的 MMD² 从 0.0764 降至 0.0682。 批判点评:工作指出“字段相同不等于分布相同”,并把 Prompt Enhancer 正式视作生成模型接口,诊断很贴近真实部署。但绝对增益多数只有 0.3–1.6 分,StoryEval 又使用 GPT-5.5 判定;一旦线上 PE 更新,就要重新改写训练 caption 并适配 DiT,维护成本仍然存在。 8. Two-Stage Token Pruning:只留10%视频Token还涨7分 Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models | Amazon | arXiv:2608.03112 关键词:视频语言模型,Token剪枝,免训练,自适应预算,Amazon 前序问题:视频语言模型每帧可产生数百视觉 token,数分钟视频很快进入万 token 区间。现有图像剪枝方法既忽略跨帧重复,又对所有视频使用固定保留率;静态访谈和高速运动显然不该被压成相同预算。 本文贡献:提出完全后处理的两阶段自适应剪枝:先在时间轴选择差异最大的代表帧,再在保留帧内做 token 级裁剪。第二阶段对 token 相关矩阵做特征值分解,用谱衰减速度估计当前视频冗余度,并据此动态决定保留比例,无需训练或微调原模型。 实验效果:在三种 VLM、五项视频基准上持续增益;平均仅保留 10% token 时,VideoDC 准确率达到 76.75%,比同预算 DivPrune 的 68.47% 高 8.28 分,论文摘要按跨设置概括为约 +7%;同时 TFLOPs 降低约 95%,其他问答基准基本保持。 批判点评:把“删哪些帧”和“每帧删多少 token”分开,并让谱结构决定预算,符合视频冗余的实际差异。代价是特征值分解本身有额外开销,当前实验以短视频理解基准为主;突发但关键的一帧或小目标,仍可能在两轮剪枝中被不可逆丢失。 9. OmniEdit-Bench:五赛道揭穿视频编辑假高分 OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing | 港大·阿里通义万相·浙大·北大 | arXiv:2608.05049 关键词:视频编辑评测,音频编辑,时间编辑,推理编辑,通义万相 前序问题:很多视频编辑评测沿用图像编辑任务,只看逐帧空间变化;模型即使没有执行指令,只要保留原视频的高画质和一致性,也可能得到高分。音频、时间操作、参考条件和隐式推理因此长期缺席。 本文贡献:构建覆盖空间 240、时间 200、参考 200、音频 100、推理 50 个案例的五赛道基准,并区分显式与隐式指令。评测把质量拆成准确性、保留度、真实感和一致性,再以准确率作为门控缩放后三项,避免“看起来很好但改错了”获得虚高总分。 实验效果:商业与开源模型整体都远未过关:KlingV3-Omni 综合最高也仅 38.3/100,Seedance 2.0 为 37.3;时间赛道最好 Wan2.7-Edit 只有 29.0,推理赛道最好 Seedance 2.0 也只有 29.8。商业模型在空间编辑领先,但优势在音频、时间和推理任务明显收窄。 批判点评:把准确性设为其他质量分的前提,能有效纠正原视频先验造成的假高分;五赛道也比图像式评测更接近真实需求。不过大量评分仍依赖 VLM,门控权重是人为设计;部分商业模型因功能或版权限制没有覆盖全部赛道,横向平均并非完全同条件。 10. CSGen:2.4万样本守住血管道路裂缝 CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion | ACM MM 2026·海南大学·广东海洋大学 | arXiv:2608.04655 关键词:可控生成,曲线结构,拓扑保持,专业数据,ACM MM 前序问题:血管、道路、叶脉和裂缝只占图像极少像素,却要求细长分支持续连通。通用扩散模型更擅长生成大物体,普通 MSE 又被背景像素主导,容易把这些稀疏结构画断或偏离控制图。 本文贡献:提出基于 SD3.5 的层次多模态扩散模型 CSGen,并汇集 24678 个样本,覆盖血管、冠脉、混凝土裂缝、叶脉和道路五域及七类标注。分阶段注入 CLIP 拓扑属性与 T5 场景描述,先锁定结构再补环境;稀疏感知损失按等效直径提高细小脆弱分支的权重。 实验效果:相同提示下 FID 达 98.525,优于 SD3.5-ControlNet 的 131.256;完整模型将拓扑 clDice 从基线 0.628 提升到 0.766。合成数据用于下游分割时,道路域 mIoU 最高增加 4.73 分,说明生成结果不只视觉像真,也能补充结构学习。 批判点评:这是 ACM MM 2026 已接收工作,数据、代码和结构指标较完整,说明专业生成不能只看通用审美分。但五个领域仍共享相对简单的二值拓扑先验,跨域统一性有限;合成图提升分割不等于临床或基础设施诊断可靠,专业场景还需真实分布验证。 趋势观察 音视频联合模型开始从内容生成反向进入修复 — OmniVR 直接复用 22B 音视频生成骨干,同时恢复老片画面、声音与同步关系;统一生成先验正在吞并过去彼此独立的增强管线。 视频编辑从固定短片走向实时、有状态和开放时长 — JoyAI 用两步自回归扩散在单 B200 达到 720p 约 30 FPS,ContextMaster 则以固定预算上下文支撑多轮多镜头创作,视频模型正从一次生成器变成持续工作的创作系统。 Token压缩从固定比例升级为内容与问题共同决定 — OmniPack 先保全局音视频结构、再按问题做语义精炼,Amazon 两阶段方案先删重复帧、再按谱冗余决定每帧预算;高效推理正在告别一刀切剪枝。 生成后训练不再满足于复刻教师或单边修补接口 — STEP-OPD 沿教师相对基础模型的能力方向继续外推,CAPE-T2V 则让同一个 Prompt Enhancer 同时定义训练与推理文本分布,优化目标从局部模仿转向端到端系统对齐。 视频能力评测开始补齐时间、声音与隐式推理 — OmniEdit-Bench 的五赛道显示最强商业编辑模型综合仍不足 40 分;TD-V2A 也证明只看语义无法评价配音,时间差分与同步指标将成为音视频系统的基本维度。 人工智能炼丹君 整理 | 2026-08-06 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月06日
15 阅读
0 评论
0 点赞
2026-07-31
AIGC 每日速读|2026-07-31|Adobe混合DiT算效提升7.3倍Chimera
今日 AIGC 论文速览 今日共 10 篇 · 生成基础范式与高效骨干 2 篇 · 电影叙事与长视频生成 3 篇 · 视频后训练与时间控制 2 篇 · 物理世界建模 2 篇 · 生成式视频编码 1 篇 重点论文标题列表 Chimera(Adobe Research):混合视觉DiT算效提升7.3倍 CineWeaver(上交·中国电信TeleAI):免训练多镜头长视频叙事 XM(UIUC·Harvard):探索成为生成预训练第三轴 cIPO(清华·快手可灵·中山大学):无需标注修复视频时序瑕疵 PhiZero(中科院自动化所):用物理语言显式推演世界 今日论文速览 1. Chimera:混合视觉DiT算效提升7.3倍 Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers | Adobe Research | arXiv:2607.28611 关键词:视觉DiT,混合注意力,MoE,缩放定律,长视频 前序问题:高分辨率图像、长视频和多模态上下文让视觉生成进入高 token 时代,全注意力 DiT 的二次复杂度愈发不可承受;语言模型中的高效结构又不能直接照搬,因为视觉扩散必须保留时空局部性和跨模态双向交互。 本文贡献:提出混合视觉扩散骨干 Chimera:在统一光栅序列中组合 O(N) 的 Kimi Delta Attention 做长上下文状态跟踪、交错的多头潜注意力做全局交互、模态感知短卷积捕捉局部时空结构,并以稀疏 MoE 扩容量而不显著增加激活计算。进一步提出模块级缩放方法 HeteroP,为异构架构拟合 Chinchilla 式最优模型规模、训练 token 数与图像/视频配比规律,最终训练 11B 参数、每次激活 2B 的模型。 实验效果:稠密骨干相较匹配的全注意力 Wan2.1-2B,预训练计算效率提升 1.7 倍;完整系统提升到 7.3 倍。模型只用 5 秒视频训练,无需长度微调即可零样本生成 30 秒视频,最后 5 秒 FID 仅退化 6.5%。 批判点评:Adobe 将线性状态跟踪、全局注意力、局部卷积和 MoE 组合后,再用专门缩放律调参,避免了“高效模块简单拼装”的常见陷阱,7.3 倍算效与 6 倍时长外推都很亮眼。但系统结构复杂、工程优化依赖强,预训练损失和 FID 并不等价于真实指令遵循与长视频观感;11B/2B 激活规模的复现门槛也不低。 2. CineWeaver:免训练多镜头长视频叙事 CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling | 上交·中国电信TeleAI | arXiv:2607.26529 关键词:多镜头视频,长视频,参考控制,免训练,电影叙事 前序问题:电影级视频生成需要同时满足多镜头切换、人物与场景的逐镜头精细控制,以及跨长时间范围的一致性。现有方法通常针对单项需求定制或重训,难以用一个框架兼顾三者。 本文贡献:提出免训练统一框架 CineWeaver,指出预训练视频扩散模型对时间连续性的结构偏置正是多镜头生成困难的根源。推理时操纵位置编码与注意力模式,主动打破时间连续性以形成清晰转场;设计按镜头路由的参考条件,实现人物和场景的逐镜头控制;再用锚点记忆跨长视频保存全局外观线索。 实验效果:据作者所述,这是首个同时支持长视频、参考可控和多镜头生成且无需重训的统一框架。实验可生成身份一致、全局外观稳定、转场清晰的长时电影级视频。 批判点评:把“视频模型过度追求连续”反过来视为多镜头障碍,并仅在推理期改位置编码与注意力,洞察直接且部署成本低。但免训练控制的上限受基础模型约束,复杂叙事中的因果推进、镜头语言和跨镜头表演一致性仍不能只靠外观锚点解决,长片级验证也有待扩大。 3. XM:探索成为生成预训练第三轴 Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation | UIUC·Harvard | arXiv:2607.27372 关键词:生成模型,端到端生成,预训练扩展,探索建模,扩散替代 前序问题:生成模型虽然能力强,却仍不像分类模型那样真正端到端:训练时与推理时的采样过程并不一致。现有可扩展方法通过拆分生成过程处理多峰分布,这种分解既阻碍端到端生成,也让生成能力主要只能沿参数量和数据量两个维度扩展。 本文贡献:提出 Explorative Modeling(XM),不再拆分生成过程,而是拆分训练循环:每次探索模型生成与真实数据之间的 K 个候选匹配,只用最佳匹配训练,使预测主动落在具体模式而非平均模糊。由此把“探索量”建立为参数与数据之外的第三条预训练扩展轴;同时提出端到端重建式生成,让训练采样与推理采样保持一致。 实验效果:扩大探索量在图像、视频、语言等连续与离散领域均单调增益,且规模越大收益越高:随数据规模增长,增益从 7% 升至 36%;随模型增大,从 13% 升至 23%。FLOP 效率提升 4.1 倍、样本效率提升 6.2 倍、参数效率提升 47%;ImageNet 无引导生成达到 1.43 FID,并在控制任务上以少 16–256 倍推理步数匹配扩散模型。 批判点评:“探索量成为第三预训练轴”是今天最具范式意义的结论,也给端到端生成提供了不同于扩散/自回归分解的新路径。但 K 候选探索会把部分成本前移到训练阶段,最佳匹配准则也可能偏向易选模式;目前的规模仍不足以证明它能全面替代成熟扩散路线,大规模文本到视频与真实产品中的稳定性尚待验证。 4. cIPO:无需标注修复视频时序瑕疵 Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion | 清华·快手可灵·中山大学 | arXiv:2607.28058 关键词:视频扩散,偏好优化,自监督,时序一致性,后训练 前序问题:DPO 等偏好对齐虽能提升视频观感,但运动坍缩、物体闪烁、颜色过饱和往往只短暂出现在少数帧。离线人工偏好昂贵且跟不上模型变化,在线奖励又不稳定;对整段视频均匀监督还会把信用分配给无问题的帧。 本文贡献:提出集中式隐式偏好优化 cIPO,不依赖人工标注或外部奖励模型。对真实视频先加噪再让当前模型迭代重建,把原视频视为偏好样本、带有模型 rollout 错误的重建视为非偏好样本,由去噪过程自动产生贴合当前模型的偏好对;再计算逐帧重建误差,把优化集中到高误差的短时片段。 实验效果:在多个数据集和视频扩散模型上持续提升视频真实性与时间连贯性,尤其能更精准地修复只在少量帧中出现的失败区域,同时省去人工偏好标注和外部奖励模型。 批判点评:可灵团队把模型自己的 rollout 错误变成偏好监督,并按时间集中火力,正面解决视频 DPO 的标注与信用分配瓶颈。不过“真实视频优于重建”主要刻画保真与稳定,不一定等价于用户审美或提示遵循;高误差片段也可能来自困难但合理的运动,需防止优化把动态性一并压平。 5. PhiZero:用物理语言显式推演世界 PhiZero: A World Model Built Around Physical Language | 中科院自动化所 | arXiv:2607.28624 关键词:世界模型,物理语言,显式推理,视频生成,动作仿真 前序问题:现有物理世界模型通常直接在像素空间预测未来视频,世界动力学被隐式藏在高维视觉预测器中,难以解释、组合和显式推理。 本文贡献:提出围绕“物理语言”构建的世界模型 PhiZero:从野外视频中自监督学习描述世界状态转移的紧凑离散表示,并采用先推理、后渲染范式——先把未来演化推断为物理语言序列,再将这些转移渲染成视频,让动力学从像素预测中解耦出来。 实验效果:在生成与理解基准上验证了物理一致世界演化能力,并展示了在写实交互世界建模、细粒度动作条件仿真和零样本运动迁移上的潜力。 批判点评:“物理语言→视频”的显式中间层让世界模型更可解释、可控,也便于组合长期规划,是比纯像素 rollout 更有想象力的路线。但离散语言可能丢掉接触、形变等连续细节,物理语言是否真正学到因果规律而非运动码本仍需更严格反事实测试,渲染器误差也可能掩盖推理质量。 6. Visko Orbis 1.0:4K24FPS实时交互长视频 Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation | Team Visko | arXiv:2607.26694 关键词:实时视频,长视频,交互生成,4K,流式生成 前序问题:真正的实时视频生成不能只快速吐出短片,还要允许用户在生成过程中随时改变提示,并在持续数十分钟乃至数小时的流式 rollout 中保持主体、场景、风格和颜色稳定。 本文贡献:推出实时交互长视频模型 Visko Orbis 1.0,统一支持文生视频、图生视频、视频续写、多语言提示和生成中切换提示。以有界多尺度记忆跨块保存主体、场景与风格,结合蒸馏后的分块流式生成器、流式视频超分器和优化 GPU 服务引擎。 实验效果:作者报告系统可实时输出 4K、24FPS,并将 rollout 延伸到 1 小时而无明显画质或色偏漂移;在长视频 Arena 中获得最高总体偏好与时间稳定性评分,DOVER 和 VideoAlign 多项指标也领先对比系统。 批判点评:4K/24FPS、实时改提示和小时级生成若能稳定复现,产品信号非常强。但技术报告未在摘要中披露实现该吞吐所需的 GPU 数量、模型规模和端到端延迟,Team Visko 的数据与模型细节也较少;这些亮眼数字应视为作者声明,仍需公开代码或独立测试验证。 7. VideoCoCo:用可执行代码推理物理视频 VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System | 港中文·中科大等11机构 | arXiv:2607.27380 关键词:物理视频,代码思维链,Blender,智能体,双引擎 前序问题:文生视频的视觉质量已很高,但文本把完整时空过程压成一句话,模型只能隐式猜测动力学,容易违反物理规律。已有思维链使用的中间计划或视觉状态不可执行、时间又稀疏,无法精确控制全过程。 本文贡献:提出智能体双引擎框架 VideoCoCo,把可执行 Blender 代码作为过程级思维链。编码智能体先把文本写成显式描述场景和时间演化的 Blender 程序,仿真引擎执行后产出确定性时空草图,再由生成式视频引擎通过草图条件编辑渲染成写实视频;并构建 3K 组“草图-指令-目标”数据适配编辑器。 实验效果:相对 OmniWeaving,PhyGenBench 从 0.475 提升到 0.558,VBench-2.0 从 52.18 提升到 77.88,两项均取得最佳平均分,表明可执行代码能充当可控、可检查的物理过程表示。 批判点评:将 Blender 代码变成视频 CoT,把物理推理与写实渲染明确拆开,既可检查又可执行,指标增益也明显。但代码智能体受 Blender 可表达对象和规则限制,真实世界的软体、流体、复杂接触难以准确脚本化;双引擎还会累积代码、仿真和渲染三层误差。 8. ReGenVC:26KB实时生成式视频编码 ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate | Intel | arXiv:2607.28144 关键词:生成式编码,超低码率,实时解码,视频压缩,扩散蒸馏 前序问题:传统视频编码在极低码率下会出现严重块效应;生成式编码能借先验保持清晰,却因扩散 Transformer 与 VAE 多步解码过慢,难以用于直播、弱网通话等交互场景。 本文贡献:提出端到端生成式视频编码器 ReGenVC:编码端只发送神经压缩首帧、逐帧姿态关键点和元数据;解码端以参考帧与姿态为条件,用四步蒸馏 DiT 重建视频。系统再结合 8 GPU 统一序列并行、空间切分 VAE 与三级重叠流水线,并以 CPU 承担编码和一次性条件编码,释放 GPU 显存。 实验效果:77 帧人像视频仅约 26KB,而 x264/x265 达到近乎无瑕疵重建需约 250–280KB;同等极低码率下传统编码出现严重块效应,ReGenVC 仍保持清晰。在 8 GPU 节点上达到 24FPS,每 25 帧窗口 972ms;混合 CPU-GPU 部署把单卡峰值显存从 21.1GB 降至约 7.7GB。 批判点评:Intel 把生成先验真正塞进实时编码链路,在弱网人像通信上用约十分之一数据量维持清晰,方向很实用。但“实时”依赖 8 GPU 节点,而内容又集中于说话人视频;生成式重建可能改变细节,新闻、医疗、取证等强调像素真实性的场景还需明确失真边界。 9. FreqForcing:免训练5秒外推到2分钟 FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring | 上海交大 | arXiv:2607.27110 关键词:长视频,自回归扩散,频谱锚定,免训练,时长外推 前序问题:自回归视频扩散可实时流式生成,但自 rollout 误差会长期累积,逐渐表现为色偏、运动停滞直至画面崩溃。作者发现其本质特征是低频能量明显漂移,注意力 sink 只能部分缓解。 本文贡献:提出免训练框架 FreqForcing,以频谱自锚定 SSA 解决长视频误差累积:局部注意力保留当前动态,锚点注意力提供高质量历史参照;在频域中融合局部注意力的高频成分与锚点注意力的低频成分,用低频稳定长期外观,同时避免锚定抹掉高频运动。 实验效果:无需重新训练,即可把仅在 5 秒片段上训练的 Self-Forcing 扩展到 2 分钟,达到 24 倍时长外推;定量与定性表现超过现有免训练方法,并可与代表性训练式方案竞争。 批判点评:把长视频崩坏定位为低频能量漂移,再让锚点只管低频、局部注意力保高频,是很干净的频域解法,24 倍外推也有说服力。但固定锚点可能限制场景长期演化,频率分解无法替代人物关系与叙事状态记忆;两分钟之后是否仍稳定尚未得到证明。 10. TPD:免训练唤醒视频后段事件 TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models | 马里兰大学 | arXiv:2607.26706 关键词:文生视频,时间先验,反事实引导,免训练,事件控制 前序问题:当提示描述一个持续的早期场景、随后才发生新事件时,视频模型常让早期先验支配整条跨时间注意力轨迹,压制后段事件所需的引导信号。例如沙堡一直存在,浪却没有在后半段将其冲毁。 本文贡献:提出时间先验解耦 TPD。仅以早期场景为条件构造时间反事实,将完整提示与反事实轨迹的差定义为被压制的信号方向;不同于以往投影法删除不想要语义,TPD 在扩散步与视频帧上联合求解帧选择的下界约束,保证被压制信号在应出现的后段帧中贡献,同时不破坏早段连贯。 实验效果:完全运行在标准 classifier-free guidance 采样空间,无需重训、与骨干结构无关。多个文生视频骨干上均发现相同压制现象,TPD 显著提升后段概念实现率,同时保持时间连贯与视觉保真。 批判点评:TPD 把“后段事件没发生”明确解释为早期先验压制,并用下界约束恢复信号,诊断与修复逻辑都很清晰。但它需要能从提示中拆出早期条件,复杂并行事件或语义边界模糊时不易构造反事实;额外条件轨迹也会增加推理成本。 趋势观察 视觉DiT进入混合注意力与专属缩放律时代 — Adobe Chimera 将线性状态、全局注意力、局部卷积与 MoE 协同设计,完整系统算效提升 7.3 倍;高 token 视觉生成不再简单照搬语言模型结构。 生成扩展出现参数和数据之外的第三轴 — XM 把探索量变成第三条预训练扩展轴,FLOP 效率提升 4.1 倍、推理步数减少 16–256 倍,生成模型开始重新思考比扩散分解更端到端的训练范式。 免训练控制正在吞并长视频难题 — CineWeaver 免训练做多镜头长叙事,FreqForcing 把 5 秒模型外推到 2 分钟,TPD 唤醒后段事件;推理期改造正成为低成本增强视频基础模型的主线。 物理视频从隐式像素预测转向显式推理 — PhiZero 用离散物理语言先推理后渲染,VideoCoCo 用可执行 Blender 代码充当视频 CoT,世界动力学开始从黑盒像素 rollout 中被显式抽离。 实时生成从短片扩展到传输与小时级交互 — Visko Orbis 宣称 4K/24FPS 并支持小时级交互长视频,ReGenVC 用约十分之一传统码率实现 24FPS 生成式解码,实时生成正进入流式服务与通信基础设施。 人工智能炼丹君 整理 | 2026-07-31 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月31日
19 阅读
0 评论
0 点赞
2026-07-30
AIGC 每日速读|2026-07-30|Adobe世界模型16FPS实时生成分钟视频
今日 AIGC 论文速览 今日共 10 篇 · 实时世界模型与未来预测 2 篇 · 图像视频生成加速 2 篇 · 全模态推理与数字人 2 篇 · 语音与图像生成控制 2 篇 · 生成安全与任务修复 2 篇 重点论文标题列表 Wonder(Adobe Research·约翰霍普金斯):16FPS实时生成分钟级可探索世界 GARFIELD(ECCV 2026·慕尼黑大学):不生成画面也能快97倍预测未来 PDD(NVIDIA·魏茨曼研究所):一次网络前向并行预测多步去噪 OmniCache(UT Austin):四级缓存让扩散推理最多快35% OmniDelta(阿里Qwen·浙大·CMU·中科院):只留25%音视频Token仍提速1.64倍 今日论文速览 1. Wonder:16FPS实时生成分钟级可探索世界 Wonder: Video World Model Done Better | Adobe Research·约翰霍普金斯 | arXiv:2607.26037 关键词:视频世界模型,实时生成,相机控制,长期记忆,Adobe 前序问题:从一张图构建可交互世界,不仅要按相机控制实时生成新视角,还要在分钟级探索中记住已见区域,允许用户返回旧地点,并维持几何、外观和动态一致。普通视频生成的控制、记忆和训练管线彼此割裂。 本文贡献:提出通用视频世界模型Wonder,联合设计相机控制、稀疏记忆与蒸馏训练。稠密坐标场把相机运动和朝向渲染成空间对齐的视觉证据;稀疏注意力记忆从不断增长的历史中只检索少量相关token,计算不随上下文长度线性增长;多项修正改善Self-Forcing式蒸馏的控制遵循、多样性和长期记忆。 实验效果:可从图片或条件视频构建可玩世界,以16 FPS实时合成分钟级视频,支持相机导航、探索未知区域、重访旧区域和对已有动态场景重新运镜,同时保持长期几何、外观与动态连贯。 批判点评:Adobe把世界模型最关键的实时性、可控相机和长期记忆放进同一系统,16 FPS分钟级结果足以指向交互创作。但“可探索”仍是视频生成而非显式3D模拟,重访一致不代表真实几何闭环;分钟级稳定性的场景复杂度与硬件成本需结合演示判断。 2. GARFIELD:不生成画面也能快97倍预测未来 Schrödinger's Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics | ECCV 2026·慕尼黑大学 | arXiv:2607.25984 关键词:运动预测,概率分布,世界模型,ECCV,不确定性 前序问题:从局部观察预测场景未来,本质上存在多条可能轨迹。视频预测往往把算力花在外观,或只采样少量轨迹,既无法显式表示完整运动分布,也难定位“哪个物体、哪个时刻”最不确定。 本文贡献:提出未来运动潜分布的目标感知表示GARFIELD。给定图像和可选稀疏时空约束,模型学习结构化时空潜变量;同一表示既能联合采样全部轨迹,也可由确定性密度解码器直接读取底层运动分布。新增约束可逐步收窄特定物体与时刻的不确定性。 实验效果:运动规划表现可与大型视频生成模型竞争,轨迹采样快97倍;运动密度估计比对生成模型做Monte Carlo采样快两个数量级,可用于交互探索和不确定性感知规划。 批判点评:它把“未来长什么样”拆成“未来可能怎么动”,避免为规划浪费画面生成算力,97倍数字很有说服力。但潜运动分布不直接保证外观、碰撞和语义合理,复杂可变形物体与长时人类行为可能仍需视频级世界知识。 3. PDD:一次网络前向并行预测多步去噪 Parallel Decoding Distillation for Fast Image and Video Generation | NVIDIA·魏茨曼研究所 | arXiv:2607.26004 关键词:并行解码,扩散蒸馏,NVIDIA,少步生成,Flow Matching 前序问题:视频扩散和流模型采样迭代慢,主流少步蒸馏依赖VSD与对抗损失,训练难稳定且容易模式坍塌,表现为视频多样性下降和运动不足。 本文贡献:提出并行解码蒸馏PDD,以简化、可扩展的轨迹蒸馏替代复杂对抗训练。每次网络评估同时预测多个去噪步,学习平均速度表示,无需JVP或有限差分回归速度导数;架构兼容任意预训练扩散/flow模型,并允许推理时选择不同NFE。 实验效果:在LTX-2.3文生视频/音频、Wan 14B文生视频和Qwen-Image文生图上,仅4到8 NFE即达到SOTA,并显著改善生成视频多样性。 批判点评:PDD横跨图像、视频和音频,说明并行解码可能成为通用少步蒸馏接口;不依赖VSD和GAN也降低训练风险。不过摘要只报4–8步SOTA,缺少相对速度与训练成本;一次预测多步是否会在极端动作中积累轨迹偏差仍需细看。 4. OmniCache:四级缓存让扩散推理最多快35% OmniCache: Multidimensional Hierarchical Feature Caching for Diffusion Models | UT Austin | arXiv:2607.23844 关键词:扩散缓存,免训练,推理加速,视频生成,层级复用 前序问题:高分辨率图像和视频扩散在多步采样中反复计算相似中间特征。现有缓存通常只利用单一维度冗余,或通过token合并求平均,容易破坏位置顺序和时空结构。 本文贡献:提出免训练多维层级缓存OmniCache,系统利用帧内、帧间、运动和去噪步四类冗余,并设计Token、Frame、Block与Layered四级缓存。方法通过相似度选择可缓存特征、跳过重复计算,再恢复位置一致的激活;空间特征可在时间层复用,时间特征也可在空间层复用。 实验效果:在保持视觉保真与运动连贯的同时,SD3、SVD-XT和Latte推理延迟分别最多降低35%、25%和28%,无需改权重或重新训练。 批判点评:OmniCache把缓存从“跨步复用一层”扩成时空、模块与层级协同,覆盖图像和视频骨干。局限是三组模型的最高收益不同,缓存命中率高度依赖内容运动;快速镜头和大形变可能减少复用,四级策略本身也增加调度复杂度。 5. OmniDelta:只留25%音视频Token仍提速1.64倍 OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs | 阿里Qwen·浙大·CMU·中科院 | arXiv:2607.25669 关键词:全模态LLM,Token压缩,Qwen,预算分配,推理加速 前序问题:全模态LLM的音频和视频token很长,现有压缩多关注“保留哪些token”,却默认模态间和模态内预算固定。查询与音视频的直接相似度难判断该给哪种模态更多预算,均匀切分又会漏掉关键片段。 本文贡献:提出免训练技能驱动框架OmniDelta。音频与视频skill pool先根据查询意图在两种模态间移动固定总预算,再依据局部复杂度和时间冗余,把各模态预算细分到音频片段与视频帧;局部预算可与已有剪枝器组合,总保留率不变,只改变算力花在哪里。 实验效果:在四个音视频基准和两款Qwen2.5-Omni模型上建立新的准确率—效率Pareto前沿。Qwen2.5-Omni-7B仅保留25% token时,GPU内存降低22%,端到端提速1.64倍。 批判点评:OmniDelta抓住了压缩前更上游的问题:先决定预算给谁,再决定删谁。数字实用且无需训练。但skill pool若误判意图,会在剪枝前就饿死关键模态;复杂跨模态推理可能无法被单一预算分配准确刻画。 6. FacialTalker:看懂人脸表情再生成共情语音 Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis | 内蒙古大学·港中文深圳 | arXiv:2607.24430 关键词:对话语音,表情建模,DPO,视觉Token,TTS 前序问题:对话语音合成需要生成符合上下文的自然、共情声音,但现有系统常忽略说话人面部表情这一细腻情绪信号;同时缺少大规模自然对话的同步语音—视频数据。 本文贡献:提出基于LLM的表情感知语音系统FacialTalker。AUTokenizer以单码本将逐帧Action Unit组合离散成紧凑视觉token;DualDPO同时对视觉token和语音token施加偏好约束,联合优化表情理解与语音语义。团队还通过自动流水线从真实网络对话构建VSDD-1K。 实验效果:VSDD-1K含超过1033小时同步说话人视频与语音,85%以上帧有人脸。客观和主观实验均超过强基线,语音更自然、富表现力且与对话情境更一致。 批判点评:从“听上下文”扩展到“看对方表情”,更贴近真实对话Agent;1033小时数据也是重要资产。但网络视频中的表情、声音与身份偏差复杂,自动采集可能带来隐私和标注噪声;Action Unit离散token也未必覆盖微妙文化差异。 7. TaoMate:固定身份锚撑住长时实时数字人 TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation | 阿里淘天 | arXiv:2607.24359 关键词:数字人,音视频生成,持久记忆,身份锚,阿里 前序问题:长时实时数字人的有界缓存只能保留近期动作和语音,旧身份信息会被遗忘;看完整历史又昂贵且会传播累积错误,导致跨分段外观漂移和音画失步。 本文贡献:提出锚点引导持久记忆TaoMate:保留不可变视觉身份锚,将完成的音视频块压缩成定容动态状态,并用模态专用残差注意力检索,不扩展活动缓存。参考感知调制联合动态与锚点外观统计;保持锚点的因果上下文蒸馏覆盖不同rollout长度、前缀来源和历史可靠性,且支持跨块阶段并行。 实验效果:在自回归长视频延续中保持跨提示分段的稳定外观和强音画同步,并通过阶段并行加速少步联合音视频生成,无需为特定流水线重新训练。 批判点评:AptAvatar解决两步速度,TaoMate则补长期记忆,两者显示淘天正搭建数字人完整栈。不可变锚可稳身份,却可能压制随时间合理变化的发型、光照或服饰;摘要没有绝对FPS和长视频时长,实时结论还需硬件指标。 8. PRISM:让模型看生成结果自己改提示词 PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation | 哈工深·中大·华南理工·广工 | arXiv:2607.24353 关键词:提示优化,文生图,自奖励,VLM,图像诊断 前序问题:文生图对提示词写法高度敏感,现有优化多在文本侧改写、扩写,或依赖外部奖励,缺少对实际生成图的结构化诊断,也难学到可复用的提示优化策略。 本文贡献:提出图像接地自奖励提示优化PRISM,闭合“提示—生成图—视觉诊断—再改提示”反馈环。统一VLM先经多任务监督微调,识别语义一致、审美质量和人类偏好问题;再以理想点与Chebyshev混合奖励进行自奖励优化,学习针对具体视觉缺陷的提示策略。 实验效果:实验显示PRISM同时提升整体图像质量与细粒度语义对齐,并能输出可解释的视觉反馈,支持有针对性的提示修正;代码已开放。 批判点评:让模型先看成片再改提示,比盲目扩写更接近人类创作迭代。风险在于VLM既当诊断器又参与自奖励,可能强化自身偏好与评分漏洞;提示变好也可能只是对特定生成器过拟合。 9. I2VShield:低算力主动阻止照片被做成视频 I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models | 中山大学 | arXiv:2607.25522 关键词:图生视频,隐私保护,对抗扰动,DiT,主动防御 前序问题:图生视频被用于未经授权地驱动个人照片。现有主动保护主要针对模型做梯度对抗攻击,防御者自己就需要大显存GPU,普通用户难以使用。 本文贡献:提出面向DiT图生视频的生成式对抗防御I2VShield。文本自适应扰动生成器结合对抗学习,以较低计算产生视觉不可察觉扰动;无目标多模态注意力破坏(MAD)直接放大DiT内部注意力特征与干净输入的偏差,破坏后续时空一致生成。 实验效果:在多个数据集和主流DiT图生视频模型上获得有竞争力的保护效果,尤其能破坏时空连贯,同时显著降低防御扰动生成的计算成本。 批判点评:它把隐私保护从事后检测前移到上传前防御,且试图摆脱大GPU门槛,现实意义强。但扰动可能被平台压缩、裁剪或重编码削弱,跨黑盒模型转移性与对抗升级仍是关键;主动破坏也可能影响合法编辑。 10. Noise-Free LoRA:去掉随机噪声一步修图反超多步扩散 Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors | 首尔大学 | arXiv:2607.25390 关键词:图像修复,一步扩散,LoRA,无噪声,任务驱动 前序问题:任务驱动图像修复既要画面好看,又要提升分类、分割、检测和OCR。扩散先验有帮助,但随机噪声让同一输入输出不稳定,可能破坏下游任务一致性。 本文贡献:论文发现预训练扩散先验可以直接做确定性、无噪声的一步前向,关键在适配器选择:LoRA能稳定提升,而ControlNet式条件并不奏效。在此基础上加入任务保持GAN训练,用感知质量约束与任务目标共同优化,避免修得好看却损伤识别。 实验效果:无噪声一步LoRA超过传统多步扩散TDIR基线,在分类、分割、检测上持续提升,并在真实退化图像与OCR中验证泛化;GAN阶段进一步改善观感而不牺牲任务表现。 批判点评:“去掉噪声、只跑一步”反而更适合任务修复,说明生成多样性在恢复场景可能是负资产。结论对端侧预处理很有价值,但优势依赖预训练扩散先验与LoRA任务适配;不同退化混合下的确定性输出也可能固化错误细节。 趋势观察 世界模型开始同时追求实时、分钟级与可回访 — Wonder以16FPS生成分钟级可探索世界并支持重访,系统重点从短视频画质转向控制、稀疏记忆和长期一致性的协同设计。 预测未来不必先生成完整视频 — GARFIELD直接建模多未来运动分布,轨迹采样快97倍、密度估计快两个数量级,规划模型正从像素预测转向结构化运动不确定性。 生成加速从单一技巧走向跨模型接口 — PDD用并行解码覆盖LTX、Wan与Qwen-Image,OmniCache则在SD3、SVD和Latte间复用四类冗余,通用性成为加速方法的新门槛。 全模态系统开始精细分配每一个Token预算 — OmniDelta只保留25%音视频token仍提速1.64倍,说明压缩关键不只是选token,而是先根据任务决定预算给音频还是视频。 生成系统从内容质量扩展到情感、隐私与任务可靠性 — FacialTalker看表情生成共情语音,I2VShield保护照片免被视频化,Noise-Free LoRA则优先保证下游识别一致性,生成技术开始承担更多系统责任。 人工智能炼丹君 整理 | 2026-07-30 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月30日
12 阅读
0 评论
0 点赞
2026-07-29
AIGC 每日速读|2026-07-29|Apple端侧Siri语音16倍实时仅21MB
今日 AIGC 论文速览 今日共 10 篇 · 端侧音频与数字人生成 2 篇 · 视觉生成推理加速 2 篇 · 可控视频编辑与专业评测 3 篇 · 全模态表示与扩散蒸馏 2 篇 · 视频模型视觉推理 1 篇 重点论文标题列表 Apple Audio DiT(Apple):端侧Siri语音16倍实时仅21MB Sol-Attn(NVIDIA):在线稀疏注意力让视频快2.3倍 UniGen-AR(CMU·UIUC·Toyota Research):一个自回归模型做15项视觉任务 AptAvatar(阿里淘天):14B数字人两步720P提速60倍 EgoPlay(Snap·KAUST):看到事件发生后才开始编辑视频 今日论文速览 1. Apple Audio DiT:端侧Siri语音16倍实时仅21MB Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers | Apple | arXiv:2607.23811 关键词:端侧TTS,Siri,音频DiT,RVQ,Apple 前序问题:Siri Expressive Voices要在设备上实时生成可配置、富表现力的语音,但语义音频token转高保真波形的detokenizer受AMX算力和内存严格限制。传统Transformer或GAN随序列长度线性甚至平方增长,难以持续合成长音频。 本文贡献:Apple提出解耦时间与RVQ深度的三组件架构:流式编码器、时间解码器和深度解码器。单个可复用的DiT式深度解码器通过stage conditioning自回归生成全部RVQ层,取代每层一个解码器;因果滑窗注意力配合固定窗口KV缓存,使运行内存不随语音长度增长。 实验效果:部署在Apple Matrix Coprocessor上,每步约10ms、约16倍实时,峰值运行内存仅21MB,端侧资产329MB,可连续合成20到320秒音频。AFM 3 Core Advanced中以10亿参数激活规模运行,相比上一代端侧TTS,整体MOS从3.87升至4.15,对话语音从3.82升至4.24。 批判点评:这是今日最强工业落地:Apple不仅给结构,还给AMX上的时延、内存、资产和MOS,证明十亿级音频生成可真正驻留端侧。代价是方案深度绑定Apple硬件与AFM token体系,16倍实时不能直接外推到通用CPU/GPU;320秒以上稳定性和多语言覆盖也未披露。 2. Sol-Attn:在线稀疏注意力让视频快2.3倍 Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification | NVIDIA | arXiv:2607.24027 关键词:稀疏注意力,视频生成,NVIDIA,免训练,推理加速 前序问题:视频DiT的长token序列让注意力成为推理瓶颈。现有免训练动态稀疏要么固定保留比例、要么按累计概率动态分配,路由预算僵硬或失衡,还要显式生成代理分数图;直接丢掉未选块则在高稀疏率下明显伤质量。 本文贡献:提出免训练Sol-Attn,将动态路由、稀疏计算与近似修正合进同一次online softmax。在线块阈值直接比较代理分数选关键KV块,不物化完整代理图,预算动态且可控;未选块的代理分数被复用来近似其贡献,避免keep-or-drop造成的信息断崖。 实验效果:在保持视觉质量的同时,视频生成端到端提速2.1倍、视频编辑提速2.3倍,并在图像与视频任务上推进免训练稀疏注意力的质量—效率前沿。 批判点评:Sol-Attn的价值不只是稀疏,而是把路由开销和遗漏补偿塞进online softmax一遍完成,NVIDIA背景也意味着内核可落地。但提速依赖模型、序列长度和阈值;代理分数对被丢块的近似在快速运动、小目标或精细文字场景中仍可能失真。 3. UniGen-AR:一个自回归模型做15项视觉任务 UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling | CMU·UIUC·Toyota Research | arXiv:2607.24157 关键词:统一视觉生成,自回归,VAR,MLLM,VQ-VAE 前序问题:文生图、编辑、修复和传统感知仍由不同模型负责;扩散虽能统一多种图像输出,但迭代采样延迟高,限制统一视觉生成在交互场景落地。 本文贡献:提出UniGen-AR,将通用MLLM与next-scale视觉自回归(VAR)解码器结合。MLLM把自由文本指令和控制信号编码为统一序列,VAR用一套权重和统一提示接口生成图像输出,覆盖四大家族15项以上任务且无需任务专用头。消融指出VQ-VAE码本大小和层级是VAR扩展的关键。 实验效果:相对扩散基线推理延迟最多降低19倍,同时保持或提升输出质量;单模型覆盖文生图、图像编辑、修复、感知等15项以上任务。 批判点评:用VAR替代扩散解码器,把统一视觉生成的效率问题正面解决,19倍延迟优势非常醒目。但自回归速度会受视觉token数量影响,VQ-VAE码本带来的量化误差仍在;15任务统一不等于每项都超过专用SOTA。 4. AptAvatar:14B数字人两步720P提速60倍 AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars | 阿里淘天 | arXiv:2607.24013 关键词:数字人,音频驱动,两步生成,分布蒸馏,阿里 前序问题:生产级音频驱动数字人既要快,又要保持身份、动作表现力和长视频稳定。现有加速常靠因果注意力、短时间窗、缩小模型或分辨率换速度,在极端两步生成时质量尤其容易塌。 本文贡献:提出14B长视频数字人AptAvatar。端点锚定分布蒸馏在普通DMD外加入Anchor Score Estimator,用冻结四步桥接生成器定义可达到的轨迹端点,指导两步学生;Self-Generated History Replay复用早期checkpoint输出作为分块训练历史,近似推理时自生成上下文而无需昂贵在线rollout。 实验效果:仅2次函数评估即可生成720P长视频数字人,推理提速60倍,同时保持视觉保真、鲜活动作、长时身份一致和文本动作控制。 批判点评:14B、720P、两步和60倍同时成立,说明淘天已瞄准直播与营销生产链。端点锚降低了两步蒸馏难度,但训练依赖四步桥接器和历史checkpoint缓存,流水线并不轻;摘要也未给绝对FPS,生产“实时”仍需硬件数据。 5. EgoPlay:看到事件发生后才开始编辑视频 EgoPlay: Event-Triggered Video Editing for Egocentric Streams | Snap·KAUST | arXiv:2607.24560 关键词:视频编辑,事件触发,第一视角,Snap,流式生成 前序问题:第一视角连续视频需要“当X发生时再做Y”,模型既要识别事件发生与否和时刻,又必须完整保留事件前画面、只改后续。检测器串联编辑器容易误触发并产生误差传递。 本文贡献:提出端到端事件触发V2V编辑器EgoPlay,在一个视频扩散模型中联合学习事件识别、时间克制和像素编辑,支持未发生事件与多事件提示。团队构建10.6万组事件触发片段—提示数据,训练双向编辑器并导出可逐块流式推理的因果版本;评测拆分触发后质量、触发前保持和假触发鲁棒性。 实验效果:相对EgoEdit,编辑质量、视觉质量和背景一致性分别提升17.7%、16.9%、16.4%;相对VLM检测器+编辑器串联基线分别提升15.7%、14.5%、13.5%,GPU内存还不到其一半。 批判点评:EgoPlay把视频编辑从“全片执行指令”升级为事件驱动程序,对AR眼镜和第一视角Agent很关键。风险是模型同时承担检测与生成,触发判断难单独校准;Ego4D里的事件覆盖有限,安全敏感场景不能只依赖生成模型自判。 6. FilmBench:电影学院用专业镜头语言重测视频模型 FilmBench: A Film-Grade Benchmark for Cinematic Video Generation | 阿里·北京电影学院·虎鲸文娱 | arXiv:2607.24241 关键词:视频评测,电影语言,多镜头,阿里,FilmOps 前序问题:多数视频生成基准用网页或LLM提示,并由通用多模态模型打总体画质、文本一致和流畅度,测到的是“像视频”,而非导演真正关心的镜头设计、动态美学和多镜头叙事。 本文贡献:提出电影级T2V/R2V基准FilmBench,与导演、北电教师和制片团队共同设计。1169条提示反推自20类获奖电影片段,其中1056条为多镜头真实shot list;评价体系含3轴、12组件、T2V 35项加R2V 3项子指标,并开放电影语言算子FilmOps和专家级自动评测Agent。 实验效果:评测9个T2V和7个R2V模型,自动评测对人类模型排名的Spearman相关分别达0.95和0.96。现有模型在动态美学上普遍不足,且从单镜头到多镜头性能明显下降,弱模型跌幅更大。 批判点评:FilmBench把视频评测从VBench式通用指标拉到专业电影语言,是生成视频走向影视生产的重要基础设施。但获奖电影反推提示可能偏向成熟电影美学,自动Agent即使排名相关高,也不代表每个镜头级解释都可靠;版权与参考片段可复现性同样重要。 7. OmniVAE:音视频VAE先对齐再联合生成 OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation | 复旦·上海创新院·MOSI·上交 | arXiv:2607.23855 关键词:音视频生成,VAE,跨模态对齐,复旦,全模态 前序问题:联合音视频生成通常分别训练音频VAE和视频VAE,两套潜空间没有细粒度对应,下游生成器不得不从零学习“哪个画面该配哪个声音”,增加同步学习难度。 本文贡献:提出联合训练的OmniVAE。除重建目标外,以片段级音视频对比学习捕获时间—语义对应并对齐潜空间;同时把预训练音频和视频语义编码器特征分别蒸馏进对应潜变量,让两种表示既保留重建能力,又更容易被下游联合生成模型学习。 实验效果:两种对齐目标持续提升潜空间可学习性,使下游文生音视频获得更高生成质量与更准确跨模态同步,验证统一表征应从VAE底座开始。 批判点评:多数工作把同步压力全留给生成DiT,OmniVAE提前在tokenizer阶段对齐,方向很对。但对比目标可能把音画关系压成粗语义相似,口型、碰撞声等毫秒级同步仍需生成器建模;联合VAE也会降低替换单一模态编码器的灵活性。 8. PDM:拆开CFG正负分支修复扩散蒸馏 Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation | 阿里通义千问 | arXiv:2607.24731 关键词:扩散蒸馏,CFG,在线策略,PDM,视频控制 前序问题:在线策略扩散蒸馏通常直接匹配教师与学生经CFG合成后的速度,但这个总目标无法唯一约束正、负两个分支:两边误差可互相抵消。当教师负分支含学生拿不到的特权信息时,正分支变好反而会伴随负分支恶化。 本文贡献:论文将该失败模式命名为负分支不对称(NBA),并提出分支感知的Positive-Direction Matching(PDM):分别约束正条件预测与CFG条件方向,使监督可识别,不再让合成结果掩盖分支错误。方法用于从稠密到稀疏的视频控制蒸馏。 实验效果:朴素CFG匹配对推理guidance scale高度敏感,PDM在不同引导尺度下实现更稳健、有效的知识迁移,修复教师负分支存在特权条件时的对抗误差动态。 批判点评:它揭示了一个容易被总loss掩盖的蒸馏病灶:CFG结果对了,不代表两个分支学对了。分析价值高于单项榜单。不过当前验证集中在稠密到稀疏视频控制,PDM对文生图少步蒸馏、不同负提示schema的普适性仍需实证。 9. VIPE:先改输入图片再让视频模型推理 Visual Prompt Engineering for Video Models | Google DeepMind | arXiv:2607.25537 关键词:视觉提示工程,视频模型,视觉推理,Google DeepMind,图像编辑 前序问题:视频生成模型正成为视觉推理基础模型,但用户仍主要优化文字提示。对于迷宫、物理轨迹等任务,原始抽象图像可能不符合模型训练分布,仅改文字无法消除视觉输入本身的表达障碍。 本文贡献:提出视觉提示工程VIPE:调用图像编辑模型自动修改任务图像的呈现方式,例如把抽象草图转成写实场景,再交给视频模型推理。它不改目标问题,只优化视觉prompt,使输入更贴近视频模型容易理解和模拟的分布。 实验效果:VIPE在多种任务上提升视频模型视觉推理,效果甚至可超过传统文本提示工程和测试时扩展,且额外计算较低。 批判点评:“不是改问题文字,而是改给模型看的世界”是很有启发的提示工程范式,Google DeepMind视频模型背景也值得关注。但编辑器可能偷偷改变物理条件或答案线索,提升不一定来自更强推理;必须验证语义与几何约束在改图前后严格等价。 10. TriLayer:视频扩散直接生成可编辑RGBA图层 Explicit Layer Modeling for Video Object Insertion and Layer Decomposition | POSTECH | arXiv:2607.25802 关键词:视频编辑,RGBA,图层分解,物体插入,扩散模型 前序问题:多数视频编辑没有显式图层表示,物体插入、复用和后期调整只能隐式推断或逐场景优化。缺少前景RGBA监督,也让阴影、反射等伴随视觉效果难与背景正确合成。 本文贡献:构建TriLayer大规模三元视频数据,逐帧对齐合成画面、背景和含物体外观及视觉效果的前景层。基于此提出双分支DBL-Diffusion,通过共享去噪和跨分支交互联合建模RGB合成与RGBA前景;DBL-Insert生成可后期编辑的插入图层,DBL-Decompose恢复前景与背景。 实验效果:显式图层建模显著提升视频物体插入保真度和图层分解质量,并让生成结果可用于真实合成与灵活后期修改。 批判点评:从最终RGB转向可编辑RGBA资产,是视频生成接入专业后期管线的重要一步。难点在于TriLayer数据如何获得真实透明度和复杂光效监督;半透明、运动模糊、反射及跨层光照很难被单一RGBA层完整表达。 趋势观察 生成模型开始进入端侧十亿参数时代 — Apple在AMX上以21MB峰值内存运行十亿参数激活规模音频生成,达到16倍实时;端侧生成竞争从小模型转向架构与硬件协同。 视觉生成加速分化为稀疏与自回归两条路线 — Sol-Attn用在线稀疏让视频编辑快2.3倍,UniGen-AR以VAR替代扩散让统一视觉任务延迟最多降19倍,计算范式本身成为核心变量。 视频产品同时追求极少步与事件驱动 — AptAvatar把14B数字人压到两步并提速60倍,EgoPlay则只在事件发生后编辑;视频生成正从整段离线采样走向低延迟、条件触发的连续服务。 评测和输出格式开始对接专业生产 — FilmBench用电影学院镜头语言重测模型,TriLayer直接生成RGBA图层;行业关注点从画面像真转向镜头设计、资产复用和后期可编辑性。 统一模型向底层表征与视觉提示延伸 — OmniVAE在VAE阶段对齐音视频,PDM拆解CFG分支监督,VIPE直接优化模型看到的图像;性能提升越来越依赖输入、tokenizer和训练目标的联合设计。 人工智能炼丹君 整理 | 2026-07-29 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月29日
15 阅读
0 评论
0 点赞
2026-07-28
AIGC 每日速读|2026-07-28|Meta单H200实时视频22.84帧MsForcing
今日 AIGC 论文速览 今日共 10 篇 · 实时与长视频生成 2 篇 · 视频测试时扩展与多人物生成 2 篇 · 理解生成统一表征 1 篇 · 可控视频与图像编辑 3 篇 · 生成部署与音频创作 2 篇 重点论文标题列表 Ms. Forcing(Brown·MIT·Meta):单卡实时视频生成22.84帧 Self Gradient Forcing(京东探索研究院):5秒训练窗口外推数分钟 CachedSearch(Google·UT Austin·CU Boulder):63%成本保留94.7%搜索收益 Twins(ICML 2026·腾讯混元·港中文):理解生成共享视觉Token GroupVideo(中科院自动化所·蚂蚁):多人物定制视频不再串脸 今日论文速览 1. Ms. Forcing:单卡实时视频生成22.84帧 Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention | Brown·MIT·Meta | arXiv:2607.20940 关键词:流式视频,实时生成,多尺度Patch,滚动扩散,DMD 前序问题:流式视频扩散虽可支持交互式世界模拟,但传统逐帧生成同时嵌套自回归与多步去噪,难以实时。滚动窗口把不同噪声级的连续帧并行去噪,却仍用同样细的空间粒度处理所有状态,浪费大量计算。 本文贡献:提出 Ms. Forcing:多尺度 Patchification(MSP)按噪声级给高噪状态分配更粗 patch,使活动窗口 token 减少45%;多尺度自注意力(MSSA)按查询尺度匹配可见 KV 密度,继续压低注意力成本。固定窗口位置决定全部尺度,计算图保持静态且硬件友好;同噪声级 DMD(H-DMD)则用来自同一源噪声级的干净预测组装训练视频,缩小训练序列与推理滚动的错位。 实验效果:单张 H200 上达到22.84 FPS,比 Rolling Forcing 快39.6%;同时在短视频和长视频设置中显著提升 VBench。 批判点评:这是今日最硬的工业数字:单 H200 首次把流式扩散推到实时帧率,而且不是单纯牺牲质量换速度。关键洞察是高噪帧无需看清每个像素。但22.84 FPS依赖H200与固定窗口配置,分辨率、模型规模和端到端编码开销需一并看;高噪粗粒度也可能损伤快速出现的小物体。 2. Self Gradient Forcing:5秒训练窗口外推数分钟 Self Gradient Forcing: Native Long Video Extrapolation | 京东探索研究院 | arXiv:2607.20368 关键词:长视频,自回归扩散,Self Forcing,KV缓存,梯度训练 前序问题:Self Forcing让模型在自身生成历史上训练,缓解训练看真值、推理看生成结果的暴露偏差;但历史KV缓存只是冻结状态,未来帧损失无法反向教会早期帧“如何写入更有用的记忆”,形成历史上下文梯度缺口。 本文贡献:提出两遍训练的Self Gradient Forcing(SGF),无需穿过完整串行 rollout 反传。第一遍无梯度执行与推理一致的自回归滚动,在抽样退出步记录自生成上下文与噪声潜变量;第二遍并行重算该步的上下文KV和未来对上下文的因果注意力,让未来视频潜变量损失监督历史记忆的写入方式。 实验效果:在逐帧与分块长时实验、不同初始化下,角色身份、背景布局和时间稳定性均强于Self Forcing;仅用5秒训练窗口即可原生外推到数分钟视频。 批判点评:它把长视频问题从“怎样读取历史”推进到“怎样写好历史”,5秒训练到数分钟外推非常抓眼。两遍法避免全序列反传,工程上也现实。不过数分钟不等于全程有意义,身份和背景稳定之外,长期叙事、动作因果与新内容丰富度仍可能衰减。 3. CachedSearch:63%成本保留94.7%搜索收益 CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion | Google·UT Austin·CU Boulder | arXiv:2607.23159 关键词:测试时搜索,视频扩散,缓存加速,Best-of-N,免训练 前序问题:测试时best-of-N搜索能让小视频模型接近大模型,却需2到10倍计算,因为所有候选都完整去噪、最后大多被丢弃。缓存可让单次生成快2到3倍,但若近似误差打乱验证器排序,就可能选错赢家。 本文贡献:首次系统研究缓存对视频候选排序的影响,并提出免训练CachedSearch:用激进缓存低成本探索所有种子,仅把缓存阶段的赢家用全计算重生成。缓存与完整生成的每提示中位Spearman相关达0.905,错误主要集中在分数近乎打平的候选,因而影响自限;方案与验证器和搜索算法解耦。 实验效果:N=8时以63%成本保留best-of-N的94.7%收益;同预算可搜索两倍宽度,收益高38%。结论覆盖1.3B到14B、Wan/LTX/CogVideoX/Hunyuan六个模型;叠加中途剪枝可节省3.11倍探索计算并保留88.6%收益。 批判点评:“便宜试遍、只精修赢家”是测试时扩展最直接的降本路线,跨四个模型家族也增强了可信度。但它仍依赖奖励器排序是否符合人类偏好,近似搜索会放大奖励黑客;新架构还需重新校准缓存参数,并非完全零配置。 4. Twins:理解生成共享视觉Token Twins: Learn to Predict Unified Representations with Focal Loss | ICML 2026·腾讯混元·港中文 | arXiv:2607.22531 关键词:统一多模态,视觉Token,ViT,VAE,Flow Matching 前序问题:统一多模态模型常用ViT语义特征做理解、VAE低层潜变量做生成,两套连续表征不一致。直接联合预测时,DiT容易拟合ViT却学不好VAE分布,难以同时满足理解、重建和生成。 本文贡献:提出Twins连续统一表征:在同一token网格按通道拼接SigLIP2 ViT特征与FLUX.2 VAE潜变量,不增加序列长度和注意力成本。团队将失衡归因于频率偏置、内在维度及条件相关/无关不确定性差异,并把Focal Loss思想改造成flow matching焦点回归,重点提升误差大的VAE维度。 实验效果:ImageNet上相对朴素MSE最高改善10.57 gFID,且不使用classifier-free guidance;多模态理解表现保持竞争力,重建保真度也提升。 批判点评:它用最简单的通道拼接绕开两套视觉接口,再用损失重加权处理“语义易学、细节难学”,ICML与混元背景值得关注。但共享token仍是两种预训练特征的并置而非真正涌现的统一空间,推理通道宽度和解码链路成本并未消失。 5. GroupVideo:多人物定制视频不再串脸 GroupVideo: Multi-Identity Customized Text-to-Video Generation | 中科院自动化所·蚂蚁 | arXiv:2607.21027 关键词:视频生成,多人物,身份保持,Video DiT,定制视频 前序问题:身份定制视频大多只支持单人;把多张人脸简单拼接成条件会造成身份混淆,人物表情与动作像把静态脸“贴”到视频上,缺乏自然性。 本文贡献:提出基于Video DiT的GroupVideo。视觉对齐联合编码多张人脸提供稳健身份参考,语义感知器负责提升动作自然度;带空间引导的ID定位模块配合边界框约束与mask正则,将身份信息限制在对应脸部区域,抑制人物间特征串扰。团队还构建2万条高质量多身份视频数据集。 实验效果:在多角色视频中,身份一致性与动作自然度均超过现有方法,并改善多人物同时出现时的身份保真;新增2万条多ID数据为后续研究提供基础。 批判点评:多人物是定制视频迈向真实叙事必须补的一环,显式ID定位比条件拼接更靠谱。局限是训练仍依赖框和mask约束,2万条数据对人物组合、遮挡与长时交互的覆盖有限;多人身份正确也不保证彼此动作逻辑自然。 6. AgentHOI:多Agent先推理再生成人物交互 AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment | 腾讯混元·中科院大学 | arXiv:2607.22241 关键词:HOI视频,多Agent,动作规划,腾讯混元,视频扩散 前序问题:人和物体交互视频不仅要让主体动起来,还要理解接触、受力与动作先后。现有方法依赖显式姿态或运动轨迹,扩展到不同物体和复杂指令时成本高、泛化弱。 本文贡献:提出thinking-before-generation的AgentHOI:感知、交互和运动规划多个Agent先把高层文本意图拆成带秒级时间区间的执行计划;再用隐式文本-运动对齐,将文本到动作先验蒸馏进视频扩散模型,使推理时无需额外运动输入。 实验效果:在穿戴、骑乘等高难物体中心场景中,显著提升交互自然度、物体外观保持和复杂文本指令遵循;代码已开源。 批判点评:混元把Agent推理从提示改写推进到动作规划,适合HOI这种先讲逻辑再画运动的任务。但文本计划无法完整表达连续接触力学,Agent链中的错误会被生成模型忠实放大;“自然”仍主要靠视觉评价而非物理正确性。 7. InnoText:一个DiT同时生成编辑中英文字 InnoText: A Unified Model for Visual Text Generation and Editing | 中山大学·京东·中科院 | arXiv:2607.22101 关键词:视觉文字,DiT,图像编辑,中文生成,统一模型 前序问题:视觉文字既要求字形结构规则又要求可读,小字号和中文尤其困难。UNet常生成乱码,现有DiT又多只做生成或编辑单项任务,造成重复训练、风格不一致和跨任务泛化不足。 本文贡献:提出统一DiT框架InnoText,在单模型内同时完成视觉文字生成与编辑。字体大小感知调制(FSAM)适配不同尺度,小字符感知增强专攻细粒度字形,任务特定区域加权损失按生成/编辑区域自适应优化;同时构建覆盖多字体、字号和背景的高质量中英双语数据集。 实验效果:实验显示生成准确率和编辑质量均优于对比方法,可输出更清晰、连贯且与背景融合自然的中英文字图像。 批判点评:把生成与编辑合并对海报、电商和本地化设计很实用,中英双语也比只测拉丁字母更有说服力。但摘要缺少量化幅度,视觉文字真正难点还包括长段排版、罕见字和任意语言,当前双语数据的外推边界待验证。 8. WhereEdit:一步编辑自动找到该改哪里 WhereEdit: Mask-aware Local Latent Editing for One-Step Image Editing | 中科院西安光机所·西交·武大 | arXiv:2607.20883 关键词:一步编辑,局部控制,AutoMask,免训练,图像编辑 前序问题:一步文生图模型让实时编辑成为可能,但现有方法主要靠文字做全局语义搬运,缺少“改哪里”的显式空间控制;即便加入区域约束,目标区修改强度也常不够,背景还容易被连带改变。 本文贡献:提出免训练、免反演的WhereEdit,把一步编辑改写为局部自适应语义运输。AutoMask从模型内部token注意力自动发现相关区域,Amplified Conditional Transport只在局部强化条件变化,同时保护非目标区域与结构一致性;额外区域监督实验进一步验证显式空间推理的价值。 实验效果:PIE-Bench上持续超过现有一步图像编辑方法,在保持一步生成效率的同时取得更高编辑质量;使用真值mask还能继续提升。 批判点评:WhereEdit补上了一步编辑最关键的空间控制,且无需训练和反演,适合交互产品。但AutoMask依赖模型注意力能正确指向目标,抽象属性、多个同类物体和大范围几何变化时容易选错区域;真值mask继续提升也说明自动定位尚未到顶。 9. KroQuant:DiT权重激活都压到4比特 KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers | EPFL·AMD | arXiv:2607.21446 关键词:DiT量化,W4A4,Kronecker变换,AMD,后训练量化 前序问题:DiT做W4A4后训练量化时,线性层输入中的离群激活超出4-bit表示范围,生成质量会严重下降。已有通道缩放损精度,Hadamard变换块大且在线成本高,完整可学习变换又要每层每步执行昂贵矩阵乘。 本文贡献:提出KroQuant,对每32个激活元素应用可学习的Kronecker结构可逆变换,参数不到逐通道缩放一半;块内结构可由tensor core小GEMM执行。离线LoRaQ权重校准再吸收剩余逐权重量化误差,把激活侧变换与权重侧修正结合。 实验效果:MI350 GPU上量化器内核最多比SmoothQuant快14%;PixArt-Σ、SANA、FLUX.1-schnell在W4A4(MXFP4e2)下,比SVDQuant和LoRaQ更接近全精度参考,同时保持或提升图像质量。 批判点评:权重和激活同时4-bit才真正触及DiT部署成本,AMD与EPFL给出的硬件内核数字比只报离线指标更可信。但14%是量化器kernel而非整条生成链路,端到端提速取决于去噪步数和算子占比;Kronecker块大小也可能需按新架构重调。 10. SoundscapeAgent:Agent把声景拆成可编辑时间线 SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision | 武汉大学·腾讯混元 | arXiv:2607.21857 关键词:音频生成,创作Agent,声景,腾讯混元,音频语言 前序问题:单次文本到音频把规划、音源选择、时间布局和混音都藏在黑盒里,用户难以控制多事件声景,也无法获得包含事件角色与时间关系的结构化音频语言监督。 本文贡献:提出SoundscapeAgent:LLM Agent把用户意图转成可执行场景计划,通过检索和按需生成获取音频素材,再按可控时间线渲染多事件混音并导出对齐元数据。用户可指定工具并直接编辑计划,实现human-in-the-loop;同一流水线还能规模化生成结构化音频语言训练数据。 实验效果:听测和客观指标显示其生成质量可与文本到音频基线竞争;使用Agent合成数据训练的模型,在下游音频推理上持续超过仅用真实数据的基线。 批判点评:它把“生成一段声音”升级为可检查、可修改的音频工程时间线,既服务创作又反哺理解数据。但检索素材的版权、来源域偏差和混音物理真实性会进入训练集;Agent生成元数据规模大不等于监督准确,仍需质量过滤。 趋势观察 流式视频正式跨过实时帧率门槛 — Ms. Forcing按噪声级动态分配空间精度,单H200达到22.84 FPS;生成加速开始从缓存和蒸馏转向更细的计算粒度调度。 长视频训练开始补上记忆写入梯度 — Self Gradient Forcing让未来损失反向监督历史KV如何写入,仅用5秒窗口外推数分钟,长时一致性从扩展上下文转向优化内部记忆。 测试时扩展进入低成本探索阶段 — CachedSearch证明缓存近似基本保留候选排序,只对赢家全精度重生成,以63%成本拿回94.7%收益,best-of-N正在变得更可部署。 理解生成统一不再只靠共享架构 — Twins直接拼接ViT语义与VAE细节表征,并用焦点回归修复优化失衡;统一模型竞争转向token空间和训练目标的共同设计。 创作Agent从改写提示走向显式规划 — AgentHOI先规划人-物动作,SoundscapeAgent把音源与时间线变成可执行计划;图像、视频、音频生成都在从单次提示走向可检查的中间状态。 人工智能炼丹君 整理 | 2026-07-28 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月28日
7 阅读
0 评论
0 点赞
2026-07-27
AIGC 每日速读|2026-07-27|NVIDIA单卡视频生成提速120倍SANA2.0
今日 AIGC 论文速览 今日共 5 篇 · 高效视频生成 1 篇 · 交互式世界模型与生成渲染 2 篇 · 可控视频生成 1 篇 · 人像图像编辑 1 篇 重点论文标题列表 SANA-Video 2.0(NVIDIA):混合线性注意力高效视频生成 WorldWeaver(UCLA·Adobe):多智能体流式世界模型 Closing the Loop(Roblox·宾州州立):免训练解决生成渲染回访不一致 GraphVid(UIUC):交互图可控的图生视频 MagicMakeup(浙大·vivo):区域可控的高保真妆容迁移 今日论文速览 1. SANA-Video 2.0:混合线性注意力高效视频生成 SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation | NVIDIA | arXiv:2607.21553 关键词:视频生成,线性注意力,扩散Transformer,高效推理,视频DiT 前序问题:视频扩散 Transformer 用全 softmax 注意力质量高但随序列二次增长、长高清视频代价大;纯线性注意力可 O(N) 扩展却缺全秩 token 交互、质量受损。 本文贡献:提出统一架构下 5B/14B 的混合视频扩散 Transformer SANA-Video 2.0:混合线性-softmax 注意力以 3:1 比例把门控线性注意力(O(N) 为主的混合)与周期性门控 softmax 锚点结合,恢复纯线性注意力缺失的全秩交互;块注意力残差(AttnRes)把完成的块摘要路由进后续线性层、复用锚点特征并把深层有效秩提升约 12%;从零训练直接学完整混合(而非线性化预训练模型),降分辨率代理实验确定 25% softmax 为质量-效率最优点。 实验效果:40 步采样下单张 H100、480p 生成 13.2s 达 VBench 84.30,与远大的 softmax 视频 DiT 具竞争力却延迟极低;编译后 DiT 前向在 720p/60s 比匹配全 softmax 基线快 3.2 倍(时长越长差距越大);再加 Sol-Engine 全栈优化(核融合/缓存/稀疏注意力)提速 3.58 倍,5B 管线 720p/5s 达 13.06s,比 Wan2.2-A14B 快 120 倍。 批判点评:用「混合线性-softmax+块注意力残差」在大幅降本下恢复 softmax 级表达力、且从零训得完整混合,单卡 720p 与 120× 提速对长高清视频落地意义大(NVIDIA 出品)。但混合比例/锚点设计的通用性、从零训练的成本、以及极长时长与更高分辨率下质量与效率的平衡仍需更多验证。 2. WorldWeaver:多智能体流式世界模型 Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers | UCLA·Adobe | arXiv:2607.21594 关键词:世界模型,多智能体,自回归扩散,状态寄存器,流式生成 前序问题:多智能体交互世界模型不仅要生成一致观测,还要维持跨智能体持久、随视角演化的世界状态;现有自回归视频扩散把观测历史作条件上下文,难在多智能体/多视角下维持共享状态。 本文贡献:提出流式多智能体视频扩散模型 WorldWeaver(W²),用跨智能体世界状态寄存器增强 rollout:可学习 token 存储共享世界信息、跟踪各智能体状态、并在每生成一块后动态更新;用跨越个体智能体状态、含鸟瞰的全局状态视图与场景文本的监督信号为寄存器提供 grounding;架构上用 Mixture-of-Transformers 让世界状态建模与视觉帧建模各用独立权重。 实验效果:在双智能体 Minecraft 视频生成上,显式世界状态建模提升了逻辑一致性与生成质量。 批判点评:用「世界状态寄存器+MoT 分权」把多智能体共享状态显式化,直指现有 AR 世界模型只靠观测历史的短板,UCLA·Adobe 出品思路扎实。但目前主要在 Minecraft 双智能体上验证,真实复杂场景、更多智能体与更长时程下的状态一致与可扩展性仍待检验。 3. Closing the Loop:免训练解决生成渲染回访不一致 Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering | Roblox·宾州州立 | arXiv:2607.21848 关键词:生成渲染,自回归视频,回环一致,免训练,3D世界 前序问题:条件视频生成可把 3D 引擎渲染(深度/无纹理几何)转成写实视频用于游戏与沉浸内容,需长时程自回归持续合成新帧并保持持久 3D 世界;但 AR 生成器用有界 KV cache 分块合成,当相机在上下文被淘汰后回访某地,即使条件渲染仍与几何对齐,模型也常重新生成不一致外观。 本文贡献:提出无需任何后训练的方案,利用 3D 引擎已提供的对应关系解决回访不一致:时间对应把位姿匹配的历史潜块检索回 KV cache 作回环记忆;空间对应用相机位姿与深度重投影,把 token 级注意力偏向检索块中几何对应区域。 实验效果:在从 TartanAir/TartanGround 挖掘的回环轨迹上(贴近复杂真实场景),在回访一致性上超过现有免训练基线,且不损整体视频质量。 批判点评:把 3D 引擎自带的时空对应变成免训练的回环记忆,精准命中 AR 生成渲染的回访漂移,Roblox 背景贴近游戏落地、零后训练很实用。但依赖 3D 引擎提供精确对应(纯生成场景不适用)、检索与重投影的额外开销,以及大幅动态/光照变化下的一致仍需更多验证。 4. GraphVid:交互图可控的图生视频 GraphVid: Interactive Graph-Controllable Video Generation | UIUC | arXiv:2607.21580 关键词:图生视频,可控生成,交互图,多主体,数据集 前序问题:可控视频生成难在用文本或主要约束像素移动的运动控制精确指定多物体交互;基于轨迹的控制常需为多物体画准确轨迹,随场景复杂度扩展差、遮挡/重叠下含糊。 本文贡献:提出图条件的图生视频模型 GraphVid,通过结构化交互图实现灵活而精确的多主体交互控制;并构建大规模、以交互为中心、带结构化关系标注的视频数据集 GraphVid-Bench 以训练交互感知的视频生成模型。 实验效果:尽管训练数据与可训练参数远少于此前运动控制方法,GraphVid 仍具强可控性与画质:相比 Motion-I2V,FID 最多降 39.9%、FVD 降 37.6%,PSNR 从 9.87 升至 15.98、SSIM 从 0.38 升至 0.61。 批判点评:用「交互图」作结构化语义接口控制多主体视频,比画轨迹更省数据、更抗遮挡歧义,指标提升明显、范式有启发。但交互图的构建与交互标注成本、复杂/开放场景下图到视频的忠实度,以及相比像素级控制的精细度边界仍需更多检验。 5. MagicMakeup:区域可控的高保真妆容迁移 MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer | 浙大·vivo | arXiv:2607.20924 关键词:妆容迁移,图像编辑,扩散Transformer,区域控制,身份保持 前序问题:妆容迁移要把参考妆容迁到源脸同时保源身份;扩散方法虽推进整脸编辑,但强区域可控、妆容保真与身份保持仍难——像素-注意力错位致溢出到非目标区、双图条件下迁移/保持概念不清致妆容属性与身份耦合、且缺身份一致且区域标注的高分辨率数据集。 本文贡献:提出基于扩散 Transformer 的区域可控高保真妆容迁移框架 MagicMakeup,建立在空间约束与概念解耦上:Token 对齐区域门控把像素 mask 与注意力对齐并施加区域特定 logit 门控以实现精确区域编辑并保身份;跨模态感知引导对齐文本与图像特征以厘清迁移与保持概念;并设计经区域特定卸妆生成 1024×1024 数据对的流程、建立合成与真实统一基准。 实验效果:大量定量定性实验表明,MagicMakeup 提升区域可控性、妆容保真与身份保持,且跨风格、种族、姿态具强鲁棒。 批判点评:用「区域门控+概念解耦」对症妆容迁移的溢出与身份耦合,配区域标注高分辨率数据与统一基准,工程扎实、vivo 背景贴近手机影像落地。但依赖卸妆合成的数据对质量、极端妆容/复杂光照下的保真,以及区域门控在细小部位的精度仍有提升空间。 趋势观察 线性注意力把视频生成推向高效 — NVIDIA SANA-Video 2.0 用混合线性-softmax 注意力,单卡 H100 生成 720p、比 Wan2.2-A14B 快 120 倍,效率成为长/高清视频生成的主战场。 世界模型走向多智能体与持久状态 — WorldWeaver 用跨智能体世界状态寄存器维持多智能体/多视角共享世界,交互式世界模型开始正视'共享状态一致'难题。 自回归生成渲染死磕长程一致 — Closing the Loop 免训练用 3D 引擎对应关系做回环记忆,解决相机回访时的外观不一致,生成式渲染向可用的持久 3D 世界靠拢。 可控生成走向结构化语义接口 — GraphVid 用交互图控制多主体视频生成、比轨迹控制更省数据更精确,'结构化语义'成为可控生成的新范式。 扩散编辑深入区域级精细控制 — MagicMakeup 用 token 对齐区域门控+概念解耦做高保真区域可控妆容迁移,图像编辑正从整脸走向部位级精修。 人工智能炼丹君 整理 | 2026-07-27 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月27日
18 阅读
0 评论
0 点赞
2026-07-25
深度解读|清华SLA2|97%稀疏对比DeepSeek DSA
SLA2 深度解读:97% 稀疏、18.7 倍注意力加速,它和 DeepSeek DSA 的可学习 Indexer 到底差在哪 论文:SLA2: Sparse-Linear Attention with Learnable Routing and QAT 机构:清华大学 · UC Berkeley 作者:Jintao Zhang、Haoxu Wang、Kai Jiang、Kaiwen Zheng、Youhe Jiang、Ion Stoica、Jianfei Chen、Jun Zhu、Joseph E. Gonzalez 日期:2026-02-13(arXiv v1) 相关代码:thu-ml/SLA(仓库已引用 SLA2,但当前公开用法主要对应前代 SLA) 重点对比:DeepSeek-V3.2 技术报告 · DeepSeek-V3.2-Exp 官方实现 论文状态:arXiv 预印本;源码使用 ICML 2026 preprint 模板,不等于已被 ICML 接收 01 先说说这东西是干嘛用的 简单讲:SLA2 是给视频扩散模型做的“注意力分流器”。 生成视频时,Transformer 里的每个视觉 token 原本要和大量其他 token 做完整注意力,序列一长,计算量就按平方增长。SLA2 不想把 97% 的连接粗暴删掉,而是把连接分成两路: 少数重要连接走稀疏 Softmax Attention,保留精确计算; 大量剩余连接走线性注意力,用低秩聚合保留背景信息; 一个可学习 Router决定哪些块进入哪一路; 一个可学习的 $\alpha$ 决定两路输出各占多少; 稀疏分支再叠加低比特计算和 QAT,继续压低耗时。 在 Wan2.1-1.3B-480P 和 Wan2.1-14B-720P 上,论文把稀疏率推到 97%。此时考虑线性分支后,作者给出的实际计算节省约为 96.7%;RTX 5090 上前向 Attention Kernel 从 FlashAttention2 的 219 TOPS 提高到 4079 TOPS,按图中数字约为 18.6~18.7 倍。 但先别把这个结果理解成“整个视频生成快 18.7 倍”。端到端加速是: Wan2.1-1.3B-480P:159 秒降到 69 秒,约 2.30 倍; Wan2.1-14B-720P:3043 秒降到 700 秒,约 4.35 倍。 原因很直接:Attention 之外还有 FFN、VAE、调度与数据搬运。Kernel 快 18.7 倍,不代表整条流水线同倍率加速。 02 主要亮点,以及别被数字带偏的地方 主要亮点: 找到了前代 SLA 的一个明确数学错位:稀疏 Softmax 会重新归一化,输出并不等于原注意力矩阵被 mask 后的那部分; 用可学习的 $\alpha$ 显式修正稀疏分支的行缩放,并用 $1-\alpha$ 约束线性分支,避免总输出幅度漂移; Router 不再直接对池化后的 $QK^\top$ 做启发式 Top-k,而是在 $Q$、$K$ 上增加可学习投影; 训练时用 SoftTop-k 让 Router 可反传,推理时切回硬 Top-k; QAT 只在前向模拟低比特,反向仍使用 FP16,兼顾部署速度与训练稳定性; 97% 稀疏下,1.3B 模型 Attention FLOPs 从 52.75T 降到 1.82T,约为原来的 3.45%; 14B 模型 Attention FLOPs 从 292.6T 降到 9.26T,约为原来的 3.16%。 需要冷静看的地方: 训练与评测使用同一批私有 3000 段、每段约 5 秒的视频,文本由 Qwen3-VL-Flash 生成,外部可复现性有限; Full Attention 没有经过同样的 500 步高质量数据微调,SLA2 超过 Full Attention 不能全部归因于稀疏结构; “29 倍”对应的是 52.75T / 1.82T 的理论 FLOPs 比,不是 Kernel 实测,也不是端到端速度; 论文写“INT8 或 FP8”等低比特形式,并说明方案沿用 SageAttention2++,但没有把最终实验所用精确数据格式、逐张量尺度配置交代完整; 14B 延迟实验在单张 RTX 5090 上启用了顺序 CPU Offload,论文排除了 Offload 开销,因此不等同于普通单卡真实墙钟时间; 当前 thu-ml/SLA 仓库能明确跑的是前代 SLA,README 虽已加入 SLA2 引用,但未给出完整 SLA2 训练和 QAT 复现命令。 03 前代 SLA 的思路:删掉之前,先给“长尾”找个去处 传统稀疏注意力的做法比较像裁员:只保留 Top-k 连接,其余直接置零。问题是,视频注意力里被删掉的大量小权重可能单个不重要,但合起来仍承载全局色调、背景一致性和长程运动信息。 SLA 的思路更柔和: 大权重连接交给稀疏 Softmax Attention; 剩余连接交给线性注意力; 两路结果相加,线性分支前再放一个可学习投影。 它依赖一个观察:扩散模型的完整注意力矩阵 $P$ 往往可以拆成“高稀疏部分 $P_1$ + 低秩部分 $P_2$”。稀疏分支精确处理尖峰,线性分支近似处理长尾,理论上比纯 Top-k 更适合高稀疏率。 前代 SLA 的 Router 却比较朴素:先对相邻 token 的 $Q$、$K$ 做平均池化,再按池化注意力分数大小选 Top-k。分数最大的一批进稀疏分支,其余进线性分支。这个规则能用,但“权重大”不等于“必须由精确 Softmax 计算”;有些权重搬到线性分支后仍容易被低秩结构表达。 SLA2 的目标不是简单找“大权重”,而是找出“哪一组连接留给线性分支后,整体近似误差最小”。 04 SLA2 修了前代什么:关键不是 Router,而是先补上缩放错位 (这段稍微技术一点,不感兴趣可以跳到 05。) 设完整注意力概率矩阵为: $$P=\mathrm{softmax}(QK^\top/\sqrt d)$$ 给定二值 mask $M$,理想分解是: $$P_1=P\odot M,\qquad P_2=P\odot(1-M),\qquad P=P_1+P_2$$ 直觉上,稀疏分支应该计算 $P_1V$。但实际的 Masked Softmax 会在保留位置上重新归一化。设每一行被 mask 选中的概率质量为: $$\alpha=P_1\mathbf 1$$ 真正由稀疏 Softmax 得到的是: $$P_s=P_1/\alpha$$ 所以目标并不是 $P_sV$,而是: $$P_1V=\alpha\odot(P_sV)$$ 这就是前代 SLA 的尺度错位:稀疏分支每行都被强行归一化到和为 1,把本来只占 $\alpha$ 的概率质量放大了。前代让线性分支后面的投影同时做两件事——近似 $P_2V$,再抵消稀疏分支多出来的缩放误差。一个分支承担两个目标,学习难度自然更高。 SLA2 改成: $$O=\alpha\odot O_s+(1-\alpha)\odot O_l$$ 这里 $O_s$、$O_l$ 都先做行归一化。$\alpha$ 恢复稀疏分支本来应占的概率质量,$1-\alpha$ 给线性分支分配剩余质量,两路相加后仍保持归一化。这个改动看起来只多了一对系数,实际上把“谁负责什么”重新理顺了。 需要留意:理论推导里的 $\alpha$ 是完整注意力在 mask 内的真实概率和;工程实现中的 $\alpha$ 是训练得到的参数。它是对真实比例的学习近似,不是推理时先算完整注意力再精确求和——否则加速就没有意义了。论文也没有说明具体如何把学习参数约束到 $[0,1]$,例如是否经过 Sigmoid。 (图片来源:论文 Figure 1。Router 从 Q/K 产生块级 mask;被选块走稀疏低比特 Softmax,未选块进入线性分支,最后由 α 和 1-α 混合。) 05 Learnable Router 到底学什么 (技术细节,可选阅读。) 视频 token 数量很大,如果 Router 自己也计算完整 $N\times N$ 分数,加速收益会被它吃掉。SLA2 先对相邻 token 做块级平均池化: $$\bar Q=\mathrm{pool}(Q),\qquad \bar K=\mathrm{pool}(K)$$ 实验使用的块大小是: Query Block:$b_q=128$; Key/Value Block:$b_{kv}=64$。 然后加两组可学习投影: $$P_c=\mathrm{proj}_q(\bar Q)\mathrm{proj}_k(\bar K)^\top$$ 每一行选最高的 $k\%$: $$M_c=\mathrm{Top\mbox{-}k}(k\%,P_c)$$ 其中 $k\%=5\%、4\%、3\%$,分别对应大约 95%、96%、97% 的稀疏率。得到的是块级 mask,不是逐 token mask。GPU Kernel 直接按块跳过乘法,不必把 $M_c$ 展开成巨大的 $N\times N$ 矩阵。 可学习的部分不是 Top-k 本身,而是 $\mathrm{proj}_q$ 和 $\mathrm{proj}_k$。它们把 Q/K 映射到一个“更适合做分流”的空间。如果两个投影都设为单位矩阵,就退化成前代 SLA 的启发式 Router。 这也解释了它和 DeepSeek DSA 的第一个共同点:两者都不是直接相信主注意力的原始点积,而是训练一个便宜的旁路打分器,提前预测哪些连接值得进入昂贵注意力。 这里要区分“前向输入”和“训练监督”:SLA2 Router 前向只读取 Q/K,但 Stage 1 用 Full Attention 与 SLA2 最终输出的 MSE 训练,目标经过了 $PV$,所以监督信号间接依赖 V。DeepSeek DSA 的 Indexer 前向和注意力分布 KL 目标都不直接依赖 V。 06 两阶段训练:为什么 Router 只在第一阶段真正学习 SLA2 的训练分成两个阶段。 Stage 1:先把 Router 和 $\alpha$ 初始化好 从扩散模型每层、每个扩散时间步采样 Q/K/V; Full Attention 输出作为目标; SLA2 输出作为学生; 优化目标是两者输出的 MSE; 分别针对 5%、4%、3% 保留率训练 Router 与 $\alpha$。 硬 Top-k 不可导,所以训练时换成 SoftTop-k: $$\mathrm{SoftTop\mbox{-}k}(P_c)_{ij}=\sigma((P_c)_{ij}/\tau+\lambda_i)$$ $\tau=0.1$。$\lambda_i$ 通过二分搜索求解,使每行的软选择总和严格接近目标预算。这个设计不是随便用个 sigmoid,而是让软 mask 仍然保持固定的稀疏预算。 Stage 2:换回硬 Top-k,微调整个视频扩散模型 用 SLA2 替换原 Attention; Router 使用与推理一致的硬 Top-k; Router 不再更新; 微调整个扩散模型参数 $\Theta$ 和 $\alpha$; 优化标准扩散损失。 这个安排很务实:第一阶段解决“Top-k 不可导”,第二阶段解决“软选择和真实部署不一致”。代价是 Router 学到的是第一阶段 Full Attention 输出近似,后续端到端训练不会继续按最终生成损失调整路由边界。 07 QAT 怎么接进稀疏注意力 SLA2 只量化稀疏分支的核心矩阵乘法。 前向过程可以拆成两段: 量化 Q/K,低比特计算 $\hat Q\hat K^\top$,再反量化后做 Softmax; 量化概率 P 和 V,低比特计算 $\hat P\hat V$,再反量化得到 $O_s$。 此外,Kernel 先对 K 做列均值平滑,量化/反量化方案沿用 SageAttention2++。整个计算基于 FlashAttention 风格的在线 Softmax,只对 mask 命中的块做 QK 和 PV,不会先生成完整分数矩阵再遮掉 97%。 反向传播则全部使用原始 FP16 Q/K/V 和前向输出计算梯度。也就是说: 前向看到真实量化误差,让模型学会适应低比特噪声; 反向不强行做低比特梯度,避免训练不稳定; 论文称低比特部分额外带来约 1.3 倍 Kernel 加速。 Table 2 的消融也支持 QAT 有用:同样做量化推理,去掉 QAT 后,1.3B 模型的 AQ 从 64.62 降到 61.85,Vision Reward 从 0.1039 降到 0.0850。 不过论文没有把最终实验精确采用 INT8 还是 FP8、各张量尺度粒度和完整 Kernel 配置写透。工程复现时,这不是小细节,而是决定误差和速度的关键参数。 08 推理时 GPU 到底少算了什么 SLA2 的高效不只来自“mask 很稀”,还来自两条分支都避免了完整 $N^2$ 物化。 命中 mask 的块: 做量化 QK; 在线计算局部 Softmax; 做量化 PV; 累积到稀疏输出 $O_s$。 未命中 mask 的块: 不做逐 Query-Key 的 QK; 先按块累积 $(K^\phi)^\top V$; 再由 $Q^\phi$ 与聚合结果相乘; 得到线性输出 $O_l$。 最后按块对应的 $\alpha$ 混合两路。论文算法给出的 $\alpha$ 输入形状是 $N/b_q\times1$,说明工程实现实际上是 Query Block 级混合,而不是每个 Query token 各自一套完全独立比例。 这点很重要:论文正文常把 $\alpha$ 写成 $N\times1$,算法实现则使用 $N/b_q\times1$。两者表达的是同一思路,但粒度不同;复现时应以 Kernel/算法描述为准。 09 实验结果:哪些数字真的有说服力 实验底模是 Wan2.1-T2V-1.3B-480P 和 Wan2.1-T2V-14B-720P。训练集是私有的 3000 段公开视频,每段约 5 秒;每种方法微调 500 步,1.3B batch size 64,14B batch size 15。 在 1.3B 模型、97% 稀疏率下: IQ:66.64,Full Attention 为 63.67; OC:21.42,Full Attention 为 20.27; AQ:64.62,Full Attention 为 64.41; MS:98.04,Full Attention 为 98.95; SC:94.83,Full Attention 为 95.40; Vision Reward:0.1039,Full Attention 为 0.1084; FLOPs:1.82T,Full Attention 为 52.75T。 所以更准确的说法是:SLA2 在图像质量、整体一致性和审美分上高于未微调 Full Attention,但运动平滑、主体一致性与偏好奖励仍略低。不能概括成“所有指标超过 Full Attention”。 14B、97% 稀疏时,SLA2 的 IQ/OC/AQ 为 66.93/21.12/65.14;Full Attention 为 68.01/22.44/64.66。它在审美分更高,但 IQ 和 OC 没超过 Full Attention。相较于 90% 稀疏的 VMoBA、VSA、SLA,SLA2 整体更稳。 (图片来源:论文 Figure 2。第一人称化妆视频案例;这是作者选择的单个定性样例,不代表平均质量。) (图片来源:论文 Figure 3。草地奔跑猫咪案例;SLA2 97% 稀疏与 Full Attention 的关键帧接近。) 10 SLA2 Router 和 DeepSeek DSA Indexer:相同点 先说结论:两者共享的是“Learned Retrieval before Attention”范式,不是同一种稀疏注意力实现。 共同点主要有六个: 前向路由都由 Q/K 相关信号驱动,不读取 V。 但训练目标不同:SLA2 的输出 MSE 经过 $PV$,监督间接依赖 V;DSA 的注意力分布 KL 目标不直接依赖 V。 都有独立于主注意力的轻量打分空间。 SLA2 用 $\mathrm{proj}_q(\bar Q)\mathrm{proj}_k(\bar K)^\top$;DSA 用多头 Indexer 的投影 q/k 和门控权重。 最终都执行硬 Top-k。 Router/Indexer 只负责候选检索,真正的主注意力只在选中位置计算。 都先学习近似 Full Attention,再让主模型适应稀疏模式。 SLA2 Stage 1 拟合 Full Attention 输出;DSA Dense Warm-up 对齐主注意力分布,随后稀疏继续训练。 Router/Indexer 自己仍有全局扫描成本。 它们不是让选点免费,而是用便宜打分替代昂贵主注意力。DSA Indexer 的 Prefill 仍是 $O(L^2)$,只是常数远小于主 MLA;收益取决于旁路足够轻、主 Attention 足够重。 都要求 Kernel 真正按索引跳过计算。 只生成 mask、仍调用 Dense Attention 并不会获得论文速度。SLA2 依赖块稀疏 FlashAttention 风格 Kernel;DSA 依赖 Indexer Logit Kernel 与 FlashMLA 稀疏 Kernel。 这个共同范式可以概括成:先花小钱做检索,再花大钱做精算。 11 根本差异一:DSA 是“保留或丢弃”,SLA2 是“精算或近似” 这是最重要的区别。 DeepSeek DSA 对每个 Query token 从历史 KV 中选 Top-2048。选中的 token 进入主 MLA Attention,未选中的 token 不参与该 Query 的主注意力计算。 SLA2 则没有把未选连接直接丢掉: 选中的块走精确稀疏 Softmax; 未选中的块走线性注意力聚合; 两路由 $\alpha$ 加权组合。 所以两者的 Router 优化目标不同: DSA 要找“哪些历史 token 最值得保留”; SLA2 要找“哪些连接必须精确算,哪些可以交给低秩近似”。 这也是为什么 SLA2 不能照搬 DSA 的 KL Attention Map Distillation。它不仅要排序重要性,还要考虑剩余矩阵是否容易被线性分支表达。 12 根本差异二:两个可学习打分器具体怎么学 (技术细节,可选阅读。) DeepSeek DSA 的 Lightning Indexer 对 Query token $h_t$ 和历史 token $h_s$,DSA 的分数是: $$I_{t,s}=\sum_{j=1}^{H_I}w^I_{t,j}\cdot\mathrm{ReLU}\left((q^I_{t,j})^\top k^I_s\right)$$ 官方配置为: Indexer Heads:64; Index Head Dim:128; 每个 Query 选择 Top-2048; 历史长度不足 2048 时全部保留,因此“约 98.4% 稀疏”只适用于 128K 序列末端,不能当成整条因果注意力矩阵的平均稀疏率; Key 是单份共享表示,符合 MQA 模式; Query 来自 MLA 的低秩 Query Latent; 每层各自运行 Indexer,不跨层共享 Top-k; 官方实现对 Indexer Q/K 使用部分 RoPE,并以 FP8 + Hadamard Transform 加速。 Dense Warm-up 时,DSA 把主注意力各 Head 的分数汇总、L1 归一化为目标分布,用 KL 散度训练 Indexer: 1000 步; 每步 16 条 128K 序列; 总计约 2.1B token; 只训练 Indexer,主模型冻结。 稀疏训练阶段: 每个 Query 选 2048 个 KV; 主模型用语言建模损失训练; Indexer 继续用选中集合上的 KL 对齐; Indexer 输入从主模型计算图 Detach; 15000 步、每步 480 条 128K 序列; 总计约 943.7B token。 SLA2 的 Router SLA2 只有两组投影后的块级点积,没有 DSA 的 64 个 Indexer Head、ReLU 聚合和 Query 自适应 Head 权重。它在 Stage 1 通过 SoftTop-k 可微选择,以最终 Attention 输出 MSE 训练 Router 和 $\alpha$。 这个差别可以理解为: DSA 学的是“注意力分布排序器”; SLA2 学的是“两种近似算子之间的分区器”。 13 效率数字不能直接横比 (图片来源:论文 Figure 4。SLA2 97% 稀疏达到 4079 TOPS;FlashAttention2 为 219 TOPS。) (图片来源:论文 Figure 5。上:1.3B-480P;下:14B-720P,14B 数据排除了 CPU Offload 开销。) SLA2 报的是 RTX 5090 上视频扩散 Attention Kernel 和视频生成延迟。DeepSeek DSA 报的是 H800 集群上 128K 文本模型的 Prefill/Decode 成本,并用每 GPU 小时 2 美元估算服务成本。 两者至少有五个不可控变量: 模型域:视频扩散 vs 自回归语言模型; 硬件:RTX 5090 vs H800 集群; 主注意力:普通视频 DiT Attention vs MLA; 稀疏粒度:块级百分比 vs token 级固定 Top-2048; 输出指标:TOPS/秒数 vs 服务成本曲线。 因此不能说“SLA2 18.7 倍,比 DSA 更快”,也不能反过来说 DSA 更适合所有场景。能比较的是机制和复杂度,不能把两篇论文的速度数字放在同一排行榜。 14 横向对比:SLA2 与 DeepSeek DSA 的 14 个维度 维度 SLA2 Learnable Router DeepSeek DSA Lightning Indexer 目标模型 视频扩散 Transformer 自回归大语言模型 主注意力 稀疏 Softmax + 线性 Attention MLA 的稀疏主注意力 路由对象 Query Block × KV Block Query token × 历史 KV token 未选连接 进入线性分支近似 不进入该 Query 的主 Attention Router 输入 池化后的 Q/K Hidden/Query Latent 投影出的 q/k V 的角色 前向路由不读 V;Stage 1 输出 MSE 经 $PV$ 间接依赖 V 前向与注意力分布 KL 目标均不直接依赖 V 打分函数 两个可学习投影后的点积 64 Head、ReLU、Query 门控加权求和 选择预算 每行 3%/4%/5% 块 每个 Query 固定 Top-2048 token 训练监督 Full/SLA2 输出 MSE + 扩散损失 主注意力分布 KL + 语言建模损失 Top-k 可微性 Stage 1 用 SoftTop-k 反传 用独立 KL 训练 Indexer,不穿过硬 Top-k 第二阶段 Router 冻结 继续由 KL 单独优化 分支混合 学习 $\alpha$ 与 $1-\alpha$ 无线性补偿分支,无 $\alpha$ 量化角色 QAT 直接训练低比特稀疏 Attention Indexer 可用 FP8;模型本身为 FP8 部署体系 官方复现状态 SLA 仓库公开,SLA2 完整训练链尚不明确 权重、推理代码与高性能 Kernel 已公开 再补一个容易混淆的点:DeepSeek 还有 MoE Expert Router。DSA Lightning Indexer 不是专家路由器,它路由的是“当前 Query 应该看哪些历史 KV”;SLA2 Router 路由的是“某个注意力块应走稀疏 Softmax 还是线性近似”。三者名字相似,但对象不同。 15 总结感受:两条路线会合流,但不会互相替代 我对 SLA2 的评价是:数学修补比 97% 稀疏这个标题数字更有价值。 它首先把前代 SLA 的缩放错位讲清楚,再用 $\alpha/(1-\alpha)$ 让两条分支各归其位。Learnable Router 和 QAT 是建立在这个正确分解上的工程增强,不是孤立的技巧堆叠。 与 DeepSeek DSA 对比后,技术路线也更清晰: 如果未选连接可以安全丢弃,DSA 的 token 级 Top-k 更直接; 如果未选连接数量巨大但合起来仍重要,SLA2 的线性补偿更稳; DSA 的多头 Indexer 更像高容量检索器; SLA2 的块级 Router 更便宜,也更容易映射到视频 GPU Kernel; DSA 用 KL 拟合注意力分布,SLA2 用输出误差学习“精算/近似”分区; 两者未来最可能的合流点,是用更强 Indexer 做块或 token 检索,再为未选部分保留低秩残差通道。 研究者建议:值得跟进的方向不是单纯继续把稀疏率从 97% 推到 98%,而是验证 Router 是否跨 Prompt、分辨率、时长和模型层稳定;也可以尝试 DSA 式多头 Indexer + SLA2 线性残差,比较 KL 分布蒸馏与输出 MSE 哪个更适合扩散模型。 工程师建议:目前先把 SLA2 当成有潜力的 Kernel/训练方案,不要当作即插即用库。你需要定制块稀疏 Kernel、线性分支、QAT 和两阶段微调;没有官方完整脚本时,复现成本明显高于普通 FlashAttention 替换。 产品侧建议:这项工作真正能带来的不是“同一张卡快 18.7 倍出视频”,而是在 Attention 成为主要瓶颈的高分辨率、长视频场景中,把端到端耗时压到原来的约 43% 或 23%。是否值得接入,要看你的 FFN、VAE 和数据搬运占比。 最后给一句最短判断: DSA 是学会“该看谁”,SLA2 是学会“谁要精看、谁可以略读”;共同方向是把 Attention 从固定算子变成可学习的计算资源分配器。 作者:人工智能炼丹君 日期:2026-07-25 声明:个人观点,仅供参考。数据来源于 SLA2、DeepSeek-V3.2 原始论文及官方实现,如有偏差以原文为准。
2026年07月25日
10 阅读
0 评论
0 点赞
2026-07-23
AIGC 每日速读|2026-07-23|阿里高德5090单卡实时世界模型ABot-World-0
今日 AIGC 论文速览 今日共 10 篇 · 交互式世界模型 2 篇 · 高效图像/视频生成与编辑 3 篇 · 可控与电影级视频生成 2 篇 · 生成新用途与安全 2 篇 · 音乐生成 1 篇 重点论文标题列表 ABot-World-0(阿里·高德AMAP):单卡5090实时交互世界模型 AlayaWorld(Alaya Lab):15B交互式长时程世界模型开源 Mage-Flow(Microsoft):微软4B高效图像生成与编辑 OSVE(高丽大学):首个单步视频编辑快155倍 HeadCast(快手可灵):免训练按注意力头加速AR视频 今日论文速览 1. ABot-World-0:单卡5090实时交互世界模型 ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU | 阿里·高德AMAP | arXiv:2607.19191 关键词:世界模型,实时交互,自回归视频,蒸馏,单卡部署 前序问题:交互式视频世界模型要同时具备交互、持久时空一致、稳定长时程生成与高效响应,且此前多依赖重型算力,难在消费级单卡上实时长时程运行。 本文贡献:提出动作条件视频世界模型 ABot-World-0,配套横跨 AAA 游戏/仿真引擎/互联网视频的多源数据基建(WorldExplorer 训练反馈驱动采集 + 14 项确定性质检 + VLM 评估 + 动作/文本同步标注);训练上把双向动作条件教师经 teacher forcing 与 ODE 蒸馏渐进蒸成因果学生,并提 LongForcing 对齐长自 rollout 与扩展时程教师、抑制分布与自回归漂移;原始键盘动作作统一控制接口,参考角色记忆保第三人称身份一致;部署上协同设计流式推理栈(轻量 VAE 解码、高效注意力、内存感知调度、低比特 DiT)。 实验效果:在优化的低比特配置下,单张 NVIDIA RTX 5090 桌面 GPU 上以最高 16FPS 流式生成 720P 视频,动作到首帧延迟 1.2s、峰值显存约 19GiB;在 WorldRoamBench 与长交互 rollout 上展现有竞争力的可控性与连贯的长时程世界演化。 批判点评:把交互式世界模型压进消费级单卡(5090/16FPS/19GiB)是极硬的工程落地,多源数据基建+LongForcing 抑漂移思路完整、阿里高德背景也贴近实景重建。但 16FPS/720P 距真正丝滑仍有距离、低比特下的画质代价、超长时程一致与物理合理性、以及对开放动作的泛化仍需检验。 2. AlayaWorld:15B交互式长时程世界模型开源 AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report | Alaya Lab | arXiv:2607.18367 关键词:世界模型,交互生成,自回归蒸馏,长时程,开源 前序问题:视频世界模型能即时从文本/图像/视频生成可交互环境,但要落地需同时具备交互、持久时空一致、稳定长时程生成与高效响应四大耦合能力。 本文贡献:提出交互式长时程视频世界模型 AlayaWorld:基于 15B 视频扩散 Transformer,在相机轨迹与可切换文本提示下自回归生成短潜块;有界视觉上下文融合持久 sink 帧、压缩时序历史、几何对齐空间记忆与近帧条件;用自 rollout 收集的损坏历史与预测残差训练以降长期漂移;提出离散自回归蒸馏(结合分布匹配蒸馏、self-forcing++、一致性蒸馏)把推理从约 30 步降到每块 4 步。 实验效果:生成 540p/720p、24fps 视频,在 iWorld-Bench 上长时程生成最佳;定位为全栈、开源、长期项目,为交互式视频世界模型研究提供可扩展基座。 批判点评:15B 世界模型+四步蒸馏+全栈开源,对社区推进交互式世界模型很有价值,几何对齐空间记忆+损坏历史训练也对症长程漂移。但 24fps/720p 的实时性、复杂交互下的一致与可控、以及开源基座的训练成本与数据获取门槛,仍是从 demo 到产品要迈的坎。 3. Mage-Flow:微软4B高效图像生成与编辑 Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing | Microsoft | arXiv:2607.19064 关键词:图像生成,图像编辑,原生分辨率,VAE,少步蒸馏 前序问题:大规模视觉生成器越来越强,但训练、微调与部署成本高昂,难以兼顾高分辨率质量与交互级效率。 本文贡献:推出紧凑 4B 生成栈 Mage-Flow:由轻量高保真潜表征分词器 Mage-VAE 与原生分辨率多模态扩散 Transformer(整流流匹配)协同设计。Mage-VAE 用单步扩散式编解码+锚定潜表征正则,在保持强公开 VAE 重建质量的同时把分词成本降一个数量级以上;配合原生分辨率打包与栈级 CUDA 核融合,端到端训练吞吐提升约 2.5 倍。基于此构建 Base/RL 对齐/Turbo 三档、覆盖生成与编辑:Diffusion-NFT 提升指令遵循/文字渲染/美学/编辑保真,配对抗感知引导的少步蒸馏产出 4 步 Turbo。 实验效果:尽管规模紧凑,Mage-Flow 与 Mage-Flow-Edit 在标准生成/编辑基准上具竞争力;Turbo 变体让高分辨率交互实用——单张 A100、1024² 下生成仅 0.59s、编辑仅 1.02s,显存占用小。 批判点评:微软用「分词器-骨干-系统」协同把 4B 小模型的高分辨率生成/编辑做到 0.59s/1.02s,工业化落地感很强、成本友好。但 4B 规模在极致画质/复杂语义/长文本渲染上的天花板、与十亿级大模型的差距,以及 RL 对齐/蒸馏带来的多样性与保真权衡,仍需在更广场景验证。 4. OSVE:首个单步视频编辑快155倍 OSVE: One Step Video Editing with One Step Diffusion Models | 高丽大学 | arXiv:2607.19895 关键词:视频编辑,单步扩散,噪声预测,时序一致,实时 前序问题:扩散模型的文本引导视频编辑因多步采样与反演而慢得不实用。 本文贡献:提出 OSVE,首个成功把单步文生图(T2I)模型适配到高质量视频编辑的框架,攻克反演、可编辑性与时序一致三大难题:训练一个可学习编码器单次前向预测每帧初始噪声以绕开慢速迭代反演,并用结构感知编辑(SAE)损失在结构对齐图对上训练以在编辑中保留源视频几何;提出统一帧编辑(UFE)拼接帧潜表征在单步生成中促成跨帧注意力保时序连贯;对长视频用带锚帧的滑窗保全局一致。 实验效果:编辑质量匹配或超过 SOTA 多步方法,同时快约 155~171 倍,为实用实时视频编辑铺路;代码开源。 批判点评:把单步 T2I 迁到视频编辑、直接预测初始噪声避开反演,155~171 倍提速+结构保持的设计很漂亮,实时编辑价值大。但依赖结构对齐图对训练编码器、单步生成对大幅/复杂编辑的上限、以及长视频滑窗拼接处的一致,仍需更强样例检验。 5. HeadCast:免训练按注意力头加速AR视频 HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation | 快手可灵 | arXiv:2607.20125 关键词:自回归视频,推理加速,KV缓存,注意力头,免训练 前序问题:自回归(AR)视频扩散是长视频/流式合成的有力范式,但持续增长的 KV cache 让注意力成为主导推理成本(高分辨率下每帧 token 众多);现有缓存淘汰用粗糙启发式致帧间闪烁,或需重训。 本文贡献:提出免训练、即插即用的加速框架 HeadCast:基于「预训练 AR 模型注意力头呈稳定异质行为」的观察,短暖机后在最大噪声步一次性把每个注意力头分为 Sink/Dummy/Spatial/Global 四类,并把单体 KV cache 重构为按头分路径;关键是保留维持长程时序一致的 Global 头。因 Spatial 路径在固定网格上运算,其节省随分辨率增长。 实验效果:在多个 SOTA AR 模型上,720P 加速至多 1.62 倍、1080P 至多 1.95 倍,VBench 质量与全注意力持平且基本无闪烁;代码开源。 批判点评:「按注意力头功能分类+分路径缓存」免训练即插即用、且分辨率越高越省,对长视频/流式生成的推理成本是很实用的解法(可灵背景更贴落地)。但一次性分类的稳健性、四类原型对不同模型的普适、以及在极长序列/更高分辨率下保真与加速的平衡,仍需更多模型验证。 6. ShotPlan:可学习规划token做电影级多镜头 ShotPlan: Cinematic Video Generation with Learnable Planning Token | 中国电信TeleAI·哈工大 | arXiv:2607.17675 关键词:电影级生成,多镜头,规划token,转场,视频扩散 前序问题:现有视频生成在单镜头上效果惊艳,但电影级生成需要连贯叙事与有效多镜头组合、需显式镜头规划,仍受限。 本文贡献:提出 ShotPlan,在视频扩散基座上做显式多镜头电影级生成:引入可学习规划 token 捕捉镜头级转场线索、可与原视频生成 token 无缝融合以控制转场时间戳;规划 token 配分数时间旋转位置编码(FRoPE),使镜头转场可在帧级建模。 实验效果:显著超过现有电影级视频生成方法,提供更灵活的镜头管理与更强的镜头间一致性。 批判点评:用「可学习规划 token+帧级 FRoPE」把多镜头转场显式化,是对电影级叙事生成痛点的对症设计,中国电信 TeleAI 出品。但多镜头的叙事连贯不止转场时机,人物/场景跨镜头一致、复杂运镜与更长叙事的可控性,以及与专业剪辑的差距仍需更多验证。 7. The generator is the tracker:视频生成器即多目标跟踪器 The generator is the tracker: Multi-object tracking by painting persistent identity colours | 康奈尔大学 | arXiv:2607.17120 关键词:多目标跟踪,视频生成,身份一致,重识别,LoRA 前序问题:多目标跟踪(MOT)传统被拆成检测+关联,身份靠轨迹缓存、运动模型、外观嵌入等外部状态维护;能否让视频生成器直接用像素维护这种状态? 本文贡献:微调 22B 文生视频扩散模型(LTX-2.3)配轻量上下文 LoRA,把 RGB 片段翻译成 ID-map 片段——每个人被涂成随时间持久的独特纯色(同色=同身份);长视频以链式窗口生成、每窗以上一窗清理后的尾部为条件,短续训教模型延展给定着色,身份便无需跟踪器/运动模型/重识别模块地沿链流动。 实验效果:DanceTrack 测试榜上达 40.3 HOTA(据称首个上榜且无检测器/无跟踪栈的生成式跟踪器),虽低于专用 SOTA(≥70),但误差画像独特——关联分 AssA 44.1 超原基准全部跟踪器,短板仅在检测;同样生成窗改用经典事后关联得分差一倍(18.2 HOTA);383 个遮挡事件中以 42% 条件率在间隙后重获身份(外观嵌入基线为 0),表明其着色是涌现的重识别信号。 批判点评:「让生成器用像素维护身份」把 MOT 重构为着色生成,关联能力与遮挡重识别的涌现很惊艳、思路极具启发。但 40.3 HOTA 距实用尚远(检测是硬短板)、依赖 22B 大模型链式生成成本高、极密集/快速场景下的可扩展性仍是问题,更像范式验证而非即用方案。 8. Keyframe-Anchored:序列动作视频的身份保持 Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation | 中科大 | arXiv:2607.17985 关键词:身份保持,文生视频,关键帧,序列动作,免训练 前序问题:保身份的文生视频要在整段视频中维持指定主体可识别性;IPVG26 挑战把它从单一整体提示扩展到带时间戳的动作序列——主体须按序完成一串不同动作且身份一致,而端到端生成器随运动累积易外观漂移。 本文贡献:提出免训练三阶段流水线:动作感知提示润色阶段先把输入改写为指定每个动作终态的图像生成提示;保身份生成阶段以参考身份与前一帧联合条件产出关键帧序列,从而解耦时不变外观与时变姿态;身份感知推理增强阶段用多参考引导与身份驱动噪声搜索合成中间片段,双重强化采样期身份保真。 实验效果:在 IPVG26 官方 Track 2 榜排名第三,展现有竞争力的性能与较强通用性。 批判点评:用「关键帧锚定+解耦外观与姿态」免训练做序列动作身份保持,工程组合清晰、竞赛第三也证明有效。但依赖关键帧质量与多阶段拼接,中间片段合成的动作流畅、长序列多动作下的累积漂移,以及免训练相对专门训练方法的天花板仍待观察。 9. BSB:时序一致性越狱商用T2V Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models | 中科大 | arXiv:2607.17279 关键词:文生视频,越狱攻击,时序一致性,MCTS,AI安全 前序问题:文生视频(T2V)模型广泛部署,其对越狱攻击的鲁棒性引发担忧;现有方法多从文生图迁移,未利用视频固有的时序一致性、需大量视频查询优化(黑盒不可行)、且对抗提示搜索靠启发式局部信号缺结构化探索。 本文贡献:提出结构化、查询高效的 T2V 越狱框架 BSB:利用时序一致性,把有害意图编码为两个各自无害的「边界状态」之间的转变,攻击那些插值时易在中间帧产生不安全内容的边界状态对;为避免在视频空间直接评估所有候选的高昂开销,BSB 在更廉价的文本代理空间做蒙特卡洛树搜索(MCTS),并用稀疏视频级评估定期校准。 实验效果:在 Veo 3.1、Sora 2、Seedance、Kling v1 等主流商用 T2V 上,BSB 超越所有现有越狱基线,攻击成功率较最强对手平均相对提升 18.6%;揭示时序一致性是被忽视却关键的攻击面。 批判点评:把「时序一致性」从能力变成攻击面、用文本代理空间 MCTS 做查询高效黑盒越狱,视角新颖且对主流商用模型有效,安全警示意义大。但作为攻击方法需警惕滥用、防御侧的对应缓解未深入,攻击在持续迭代的商用安全策略下的长期有效性也存疑。 10. Full-Song:分层自回归+流匹配全曲生成 Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering | 阿里(Token Foundry) | arXiv:2607.20253 关键词:歌曲生成,自回归,流匹配,RVQ,翻唱 前序问题:从歌词、文本描述与音乐属性生成高质量全长歌曲仍具挑战,且需统一支持词到歌、纯器乐、翻唱等多任务。 本文贡献:提出统一歌曲生成框架,支持歌词到歌、器乐生成、翻唱三任务:语义感知分词器把音频编码为 8 码本 RVQ token;hybird-LM 在其上做分层自回归音频 token 建模生成全曲;FullDiT 在连续 VAE 潜空间以码本 token/歌词/文本为条件做全曲流匹配以提升保真;翻唱用旋律模块从参考音频抽取并离散化旋律线索、在保留原旋律的同时引导生成;并探索 DPO/GRPO/OPD 做 hybird-LM 后训练、对 FullDiT 用基于流的 GRPO 提升音乐性与渲染质量。 实验效果:在多语种自动基准与 Artificial Analysis 带人声音乐榜上,框架在所评设置下取得有竞争力的表现。 批判点评:「分层自回归规划+流匹配渲染」的双阶段设计兼顾结构与音质、还统一了词到歌/器乐/翻唱三任务(阿里出品),工程完整。但全曲生成对长程结构、人声吐字与音乐性要求极高,多任务统一下各子任务的上限、翻唱的版权与旋律保真边界,以及主观音乐性的稳定性仍需更多盲测检验。 趋势观察 世界模型冲进消费级实时 — ABot-World-0 单张 RTX5090 跑 720P/16FPS 实时交互世界、AlayaWorld 15B 开源长时程世界模型,交互式世界模型正从云端走向桌面单卡。 高效小模型吃下生成与编辑 — 微软 Mage-Flow 用 4B 栈把 1024² 生成压到 0.59s、编辑 1.02s,'紧凑协同设计'让高分辨率生成编辑走向交互实用。 少步/免训练把视频推向实时 — OSVE 首次让单步 T2I 做视频编辑快 155~171 倍、HeadCast 免训练按注意力头分类加速 AR 视频,效率优化在编辑与长视频两端并进。 视频生成能力外溢到感知与叙事 — '生成器即跟踪器'用视频生成做多目标跟踪、ShotPlan 用规划 token 做多镜头电影级叙事,生成模型的能力正外溢到跟踪、导演等新任务。 生成的可信与安全被正面拷问 — BSB 用时序一致性越狱主流商用 T2V(攻击成功率相对+18.6%),揭示视频生成安全的新攻击面,安全治理需跟上能力跃迁。 人工智能炼丹君 整理 | 2026-07-23 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月23日
9 阅读
0 评论
0 点赞
1
...
4
5
6
...
10
粤ICP备2021042327号