AIGC 每日速读|2026-08-27|浙大清华19B音视频4步2.5秒出片TurboT2VA

人工智能炼丹君
2026-08-27 / 0 评论 / 6 阅读 / 正在检测是否收录...

今日 AIGC 论文速览

今日共 10 篇 · 推理加速与少步蒸馏 1 篇 · 扩散后训练与奖励对齐 2 篇 · 音频统一理解与生成 1 篇 · 视觉 tokenizer 与表征组织 2 篇 · 图生 3D 与 PBR 资产 1 篇 · 物理接地图像编辑 1 篇 · 世界模型数据引擎 1 篇 · 大规模开源数据集 1 篇

重点论文标题列表

  • TurboT2VA(浙江大学、清华大学、天津大学、青岛大学、新加坡国立大学):19B音视频4步蒸馏2.5秒出片
  • DiffusionOPSD(字节跳动 Seed、新加坡国立大学、加州大学圣地亚哥分校、牛津大学、香港科技大学、马里兰大学、加州大学伯克利分校、杜克大学):把奖励梯度变成中间去噪目标
  • RVM(佐治亚理工学院、NVIDIA):奖励加权速度匹配替代策略梯度
  • FireRedAudio(小红书):理解与生成各走一条连续表征
  • AffineTok(复旦大学、阿里巴巴 Token Hub(Wan 团队)):语义仿射一致把gFID压到1.10


今日论文速览

1. TurboT2VA:19B音视频4步蒸馏2.5秒出片

TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation | 浙江大学、清华大学、天津大学、青岛大学、新加坡国立大学 | arXiv:2608.24674

关键词:少步蒸馏,一致性蒸馏,音视频联合生成,LTX-2,稀疏注意力,W8A8量化,浙大清华

  • 前序问题:文本到「视频+音频」的联合生成能一次产出画面与声音同步的内容,但这类模型的推理成本高得离谱:采样轨迹长(40 步)、参数量大(19B)、而且视频流与音频流的计算特性完全不同,异构多模态计算让常规加速手段难以直接照搬。把大规模 T2VA 模型蒸馏成少步学生具体卡在三处:一是模态不均衡优化——视频与音频的损失尺度、收敛速度差异显著,共用一套归一化会让某一路主导梯度;二是连续时间一致性训练在这个规模上很难稳住,学生容易在训练中后期崩掉;三是质量与多样性的权衡——分布匹配类目标(DMD)虽然能把画质拉上去,却容易把生成多样性压塌,退化成少数几个模式。
  • 本文贡献:TurboT2VA 的主体是一套双散度蒸馏框架加一条渐进课程。框架分三块:左侧对视频与音频分别做前向一致性蒸馏(各自沿教师 PF-ODE 学自己的一致性场,同时带跨模态一致性约束);中间是 T2VA 双流骨干,视频流与音频流各有 self-attention 与 text cross-attention,再通过 VA cross-attention 相互耦合;右侧做反向散度精修,用分布匹配把学生输出分布拉向教师分布。课程按 dCM 预热 → sCM 精修 → sCM+DMD 联合优化三段推进,先建立稳定且多样的生成轨迹,只有到最后才引入分布级精修——顺序反了就会先塌多样性。模态不均衡用 per-modality normalization 解决。除蒸馏之外还配了一套架构感知的推理栈:guarded W8A8 量化与算子融合、padded-text compaction、模态感知稀疏注意力,但明确保留跨模态与文本条件路径为 dense,不对音画同步这条链路做近似。
TurboT2VA 的双散度蒸馏框架:前向一致性 + 双流骨干 + 反向散度精修
Overview of the proposed Dual-Divergence Distillation framework for T2VA acceleration. The left panel illustrates forward consistency distillation for video and audio modalities, the middle shows the T2VA backbone with cross-modal interaction, and the right panel depicts reverse divergence (distribution matching) refinement.
  • 实验效果:在 LTX-2 上做 4 步蒸馏,标准评测分辨率 512×768 下生成器延迟从 50.52 秒降到 2.51 秒,20.1 倍加速,同时维持视觉质量、音频保真度、多样性与音画同步。高分辨率部署(1024×1792、121 帧、单卡 NVIDIA H20、batch size 1)下的完整栈拆解得很清楚:40 步教师基线 318.74 秒;加 W8A8 与算子融合得 1.37 倍,降至 233.34 秒;换成 4 步学生再得 19.18 倍,降至 12.16 秒;最后叠加 SageSLA 稀疏注意力(默认 ρ=0.3)再得 2.08 倍,落到 5.83 秒,整体 54.67 倍(仅生成器)。训练曲线消融跑到 7,500 全局步:分阶段 dCM→sCM→sCM+DMD 在进入联合阶段后反超直接做 sCM+DMD,并在训练后期保持更强表现;从同一段 dCM+sCM 前缀出发,分阶段 sCM+DMD 的 Javis 分数也高于纯 DMD 精修或只继续 sCM。
高分辨率部署的四段加速拆解:318.74 秒到 5.83 秒,整体 54.67 倍
High-resolution inference acceleration, achieving a 54.67$\times$ generator-only speedup on one NVIDIA H20.
  • 批判点评:20.1 倍与 54.67 倍都是 generator-only 延迟,不含 VAE 解码、文本编码与音频后处理,端到端加速会明显低于这两个数字,读者不要直接当成「出片时间快 54 倍」。更需要留意的是 54.67 倍把蒸馏(19.18 倍)和推理工程栈(1.37×2.08≈2.85 倍)的功劳乘在了一起——工程栈那部分与蒸馏方法本身无关,换任何一个模型都能拿,混在一个标题数字里报有夸大之嫌。质量侧只给了「strong visual quality / audio fidelity / synchronization」这类定性表述,没有 FVD、CLAP、AV-Sync offset 的绝对值,也没有与 40 步教师的逐项差距,而少步蒸馏最该被审视的恰恰是「掉了多少」。W8A8 前面挂了 guarded 这个限定词,说明存在必须保护的敏感层,但哪些层回退高精度、回退比例多少没有交代,这会影响别人复现时的实际加速比。稀疏注意力保留了 dense 跨模态路径,意味着收益会随音视频 token 配比波动,不同视频时长下的敏感性没测。全部结论只在 LTX-2 一个骨干上得到;H20 是国内特供算力卡,其显存带宽与算力配比和 H100 差异不小,量化与稀疏化的收益能否平移过去论文没有讨论。

2. DiffusionOPSD:把奖励梯度变成中间去噪目标

On-Policy Self-Distillation in Diffusion Models | 字节跳动 Seed、新加坡国立大学、加州大学圣地亚哥分校、牛津大学、香港科技大学、马里兰大学、加州大学伯克利分校、杜克大学 | arXiv:2608.24646

关键词:扩散后训练,on-policy自蒸馏,奖励梯度,中间监督,人类偏好对齐,字节Seed

  • 前序问题:强化学习能把扩散模型对齐到人类偏好与任务目标上,但奖励是打在端点(生成图)上的,它不告诉某一步的中间去噪预测该往哪个方向改。这就是扩散 RL 的结构性困难:自回归模型有可解析的样本似然,可以直接套策略梯度;扩散模型没有,于是现有方法只能绕——要么从随机去噪转移拼出轨迹似然,要么用证据下界近似端点似然。两条路都要付额外的计算与算法复杂度,而换来的监督信号仍然稀疏地挂在轨迹末端,中间那几十步实际上是在盲走。
  • 本文贡献:DiffusionOPSD 把「图像级奖励引导」直接转成「clean-output 预测的显式目标」。每一轮外循环里,一个冻结的 behavior policy 先生成轨迹,同时提供采样查询状态与 anchor;奖励梯度在每个 anchor 周围构造出有界的正目标与负目标;可训练 policy 以 detached supervision 的方式拟合这些目标(作者称之为 finite fitting),拟合完成后用指数移动平均更新刷新 behavior policy。这个结构的价值不只在效果——它把「目标构造」和「有限实现」拆成两个可以分别度量的环节,从而让扩散 RL 第一次变得可诊断。论文特意做了同 query 的受控实验来分别观测这两环。
四种奖励到策略的范式对比:DiffusionOPSD 的显式中间目标是第四种
Reward-to-policy paradigms. We contrast trajectory credit, late-state reward backpropagation, and endpoint supervision with our explicit intermediate targets constructed before finite fitting.
  • 实验效果:在 SD 3.5-M 与已做过步蒸馏的 Z-Image-Turbo 两个骨干、10 个 evaluator 组成的 20 个 reward-matched 设置中,19 个取得最佳 held-out 分数;相比最强竞争方法最高提升 44.0%。训练成本上,相比 DiffusionNFT 在 SD 3.5-M 上省 40% GPU-hours、在 Z-Image-Turbo 上省 63%(实验用单节点 8×NVIDIA A800-SXM4-80GB)。人类标注偏好中,标注者在 64%、71%、90%、61% 的 prompt 上更喜欢 DiffusionOPSD 而非 base 模型、FlowGRPO、DiffusionNFT、ReFL;胜出原因的构成显示提示词对齐与视觉质量各占大头。鲁棒性 sweep 表明 query noise 从低到中、目标半径 ρ 从 0.08 到 0.40 都稳定在默认水平附近。最耐人寻味的是那个负面发现:受控同 query 实验里,reward 梯度目标的构造增益是 +0.03511、DiffusionNFT 端点是 −0.03551,但一次拟合更新之后,HPSv2.1 的目标序在 62.3% 的 prompt 上发生反转——构造阶段赢得多,不代表落地得多。
鲁棒性扫描与人类偏好:默认超参附近稳定,对 DiffusionNFT 胜率 90%
Robustness and human preference. Low-to-mid query noise and target radii from $0.08$ to $0.40$ remain near the default, while query noise $0.90$ and branch coefficient $10$ fall to $0.2884$ and $0.2961$. Annotators prefer DiffusionOPSD over the base model, FlowGRPO, DiffusionNFT, and ReFL on $64\%$, $71\%$, $90\%$, and $61\%$ of prompts.
  • 批判点评:这篇最有价值的结论其实是负面的:目标构造增益与单次拟合实现增益之间只有弱相关(62.3% 反转率)。它说明方法的两个部件耦合得比论文正面叙事更松,但论文没有据此给出「目标半径该怎么选」的可操作准则,把一个诊断工具停在了诊断阶段。19/20 的胜率听起来压倒性,可 10 个 evaluator 背后只有少数几类 reward,同一 reward 下多个 evaluator 高度相关,等效独立比较数远小于 20,这个分母是被放大过的。44.0% 是「相对最强对手的最大提升」而不是中位提升,属于挑最好看的那一格报。鲁棒性图自己也暴露了边界——query noise 取 0.90、branch 系数取 10 时 ClipScore 掉到 0.2884 与 0.2961,说明超参窗口并不宽,而实际调参时未必知道自己在窗口的哪个位置。作者共 14 人以上、横跨 8 家单位,正文却以「DiffusionOPSD Team」匿名署名(真实名单只在附录),这类大团队技术报告的工程细节历来难以被外部独立复现。

3. RVM:奖励加权速度匹配替代策略梯度

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching | 佐治亚理工学院、NVIDIA | arXiv:2608.23664

关键词:扩散奖励微调,速度匹配,免轨迹更新,VBench,动态跟踪奖励,NVIDIA

  • 前序问题:奖励微调正在成为把扩散模型对齐到人类偏好与任务目标的主要工具,但现有方法基本是把大语言模型那套策略梯度机制整体继承过来的。问题在于扩散模型不像自回归模型,它对生成样本没有可计算的似然。结果是当前方案只能从随机去噪转移构造轨迹似然,或者用证据下界近似端点似然,两者都引入额外计算与算法复杂度。作者要论证的是一个更激进的判断:这套基于似然的机制对扩散奖励微调根本不是必需的。另外还有个实践层面的坑——标准偏好奖励在视频生成上会偏爱画面干净但几乎静止的输出,等于奖励模型在鼓励模型偷懒。
  • 本文贡献:提出 reward-based velocity matching(RVM),一个直接作用在速度场上的免轨迹更新。流程是:从高斯噪声出发做 16 步 ODE rollout(不用 CFG)得到分组样本,用公开奖励模型加上自研的 dynamic-tracking(DT)运动奖励打分;每个生成样本只加噪一次得到 x_t,其速度目标为 v = ε − x0;然后用奖励加权的速度匹配损失做回归,额外带一个可选的 anchor 项控制相对参考速度场的漂移。方向上它强化高奖励生成对应的速度方向、抑制低奖励方向,不需要沿轨迹反传,也不需要任何似然项。论文进一步指出这是一个通用框架,RAM 与 DiffusionNFT 都可作为特例被恢复。文中还给出了轨迹损失与速度匹配的机制对比:轨迹损失提升的是被采样单步转移的似然,因而朝下一个去噪状态移动,而那个中间状态是随机的、不保证比当前更接近干净端点,目标方向因此含噪。
RVM 总览:分组 rollout 打分后直接做奖励加权的速度匹配
Overview of RVM. Left: RVM fine-tunes Wan2.1-1.3B with a simple reward-weighted velocity-matching loss. Grouped rollouts are scored using public reward models together with our dynamic-tracking (DT) reward, and each generated sample $\bm^i_0$ is noised once to $\bm^i_t$ and regressed toward its velocity target $\bm{v}^i=\bm{\epsilon}^i-\bm^i_0$, with an optional anchor velocity $\bm{v}_{\mathrm{anc}}$ controlling model drift, avoiding trajectory storage and likelihood estimation. Right: on Wan2.1-1.3B, RVM achieves the best VBench Overall score at a fraction of the training cost of trajectory-based methods.
  • 实验效果:在 Wan2.1-T2V-1.3B 上,RVM 用 525 GPU-h(8×H100,含 rollout、奖励评估、梯度更新三段)完成微调,FlowGRPO 需 1,159 GPU-h(2.2 倍)、DanceGRPO/TaRoS 需 6,171 GPU-h(11.8 倍);成本最低的同时拿到最高的 VBench Overall 84.13,FlowGRPO 为 75.91。引入 DT 奖励后运动幅度大幅改善,而 VBench 整体表现同时上升,说明「动起来」和「好看」并非必须二选一。另一个实用发现是:速度更新一旦简化,具体用哪种损失变体的影响就小于奖励与 anchor 的设计——这把调参重心从损失工程挪到了奖励工程。少步推理测试中,把训练好的 16 步时间网格子采样到 5 步与 4 步、保持同一 timestep schedule,VBench Total 仍然保持稳健。
训练成本对比:RVM 525 GPU 小时,DanceGRPO/TaRoS 要 11.8 倍
GPU-hour cost comparison on Wan2.1-T2V-1.3B. Training time is decomposed into rollout, reward evaluation, and gradient update. % Note that despite being the cheapest, RVM attains the highest VBench Overall ($84.13$ vs. $75.91$ for FlowGRPO).
  • 批判点评:提交件里作者块留的还是 ICLR 会议模板的占位符(Cranberry-Lemon University 那一段),真实作者信息在另一份 tex 文件里,说明投稿版本管理相当仓促,这类细节多少反映了工作的成熟度。「统一了 RAM 与 DiffusionNFT」的说法要打折看——特例关系通常依赖特定的权重函数与 anchor 取值,论文没有给出这些约化成立的严格条件表,缺了它这个 claim 更像叙事包装。VBench Overall 84.13 对 75.91 的差距确实不小,但作者自己就指出 VBench 系偏好奖励会偏爱静态高清画面、并因此专门做了 DT 奖励,那么再把 VBench Overall 当作主指标来宣布胜利,逻辑上有循环论证的味道。GPU-h 对比中 RVM 的 rollout 只用 16 步且不开 CFG,而基线是否在同等 rollout 预算与采样配置下测量没有交代清楚,成本优势里有多少来自算法、多少来自采样设置无法分离。主实验集中在 1.3B 规模,14B 级别模型上速度场回归是否仍然稳定、anchor 项该怎么随规模调整,都还是空白。

4. FireRedAudio:理解与生成各走一条连续表征

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation | 小红书 | arXiv:2608.24168

关键词:音频语言模型,统一理解生成,连续表征解耦,零样本TTS,语音编辑,小红书

  • 前序问题:一个统一的音频模型既要识别和理解语言、副语言(情绪、说话人)与环境信息,又要支持语音合成与编辑。矛盾集中在表征这一层:理解任务偏好紧凑特征,因为长上下文建模吃不下高帧率细节;而语音生成需要可重建的特征,必须保留细粒度声学信息。用一套离散 token 同时服务两端,往往两头都不讨好——压得够紧就重建不回来,留得够细就撑不起一小时长音频的上下文。
  • 本文贡献:FireRedAudio 共享一个 9B 参数的 LLM,但为理解与生成分设两条独立的连续输入表征。待识别或分析的音频走专用 Audio Encoder 加 Adapter;用于生成条件的语音输入走 RedAE 路径——RedAE 本身是个自编码器,把 50Hz 的音频帧压成 25Hz latent,训练时由一个冻结的教师 Audio Encoder 提供高层监督,并通过 iSTFT head 重建波形。LLM 直接输出文本,或者经 Flow Head 去条件一个 flow-matching DiT,产出连续声学 latent 再由 Decoder 还原成波形;DiT 的条件里同时包含历史干净 latent 与当前含噪 latent 以及 LLM 隐状态。经渐进多任务训练后,同一个模型支持 ASR、音频理解(可覆盖长达一小时的录音)、零样本 TTS、Instruct TTS,以及语义级与声学级两类语音编辑。作者称这是首个公开披露的、在单个可训练自回归 LLM 内为理解与生成分别提供连续输入表征的统一音频语言模型,代码已开源。
FireRedAudio 总览:理解与生成两条连续路径共享一个 9B LLM
Overview of FireRedAudio. Decoupled continuous pathways encode inputs for understanding and generation. The shared LLM produces text or conditions a DiT to generate RedAE latents, which are decoded into waveforms. The inset illustrates the DiT conditioning for one audio step.
  • 实验效果:综合评测下,音频理解与多语种 ASR 达到有竞争力或领先的水平;零样本 TTS 在内容准确率与说话人保持两项上都强;Instruct TTS 的指令跟随领先;语义与声学两类语音编辑相比 Ming-UniAudio-Edit 有大幅改善。长音频侧展示了四类能力:结构化组织(把录音解析成带 start/end、说话人、背景音、情绪的时间戳表格,量化的时间定位评测就聚焦这一项,达到秒级时间戳精度)、长文摘要(可按对象聚焦,如「只总结 Guest B」并给出 02:15/14:40/37:05 这类带时间锚点的要点)、时间↔内容双向检索(既能问「12:00 谁在说什么」也能问「定价模型在哪几个时间点被提到」)、以及跨录音证据的全局分析(如「为什么 Guest A 在 24:10 笑」需要串起 03:10 到 24:10 的多个证据节点)。这些结果支撑了一个结论:中等规模模型上,解耦的连续输入表征足以统一音频理解与连续潜空间语音生成。
长音频理解的四类能力示例:结构化组织、聚焦摘要、双向检索、全局分析
Four representative long-form audio-understanding capabilities: structured organization, long-form summarization, bidirectional retrieval between time and content, and global analysis over evidence distributed across a recording. Our quantitative temporal-grounding evaluation focuses on structured organization.
  • 批判点评:「首个公开披露」这个 claim 叠了三层限定词——publicly disclosed、within a single trainable autoregressive LLM、separate continuous input representations——本质是在一个足够窄的定义里宣称首创,读者要看清边界再决定这个「首个」值多少。9B LLM 的底座是什么、是否从某个开源模型继续训练,摘要完全没提,而这直接决定了工作量、复现难度与结果的归因。「competitive or leading」是典型的选择性表述,缺少与 Qwen-Audio、Step-Audio、Ming-UniAudio 等同类在主流 benchmark 上的逐项数字,读者无从判断领先幅度。一小时长音频理解的量化评测只覆盖「结构化组织」一项,摘要、双向检索、全局分析三项在图里是能力示意(带具体案例的界面示例)而非量化结果,这三项的真实可靠度目前无法评估。解耦两条表征的代价是推理时要同时维护两套编码器,额外的参数量与显存开销没有交代。语音编辑只对比了 Ming-UniAudio-Edit 一个基线,样本偏少。

5. AffineTok:语义仿射一致把gFID压到1.10

AffineTok: Semantic Affine Consistency for Diffusion-Friendly Visual Tokenizer | 复旦大学、阿里巴巴 Token Hub(Wan 团队) | arXiv:2608.23864

关键词:视觉tokenizer,语义对齐,扩散友好,SAC一致性,gFID,复旦阿里

  • 前序问题:视觉 tokenizer 越来越流行往潜空间注入语义监督,好让下游扩散学得更轻松。但「语义究竟该怎么组织才有利于去噪」这个问题几乎没被认真研究过。现有做法是训一个 projector 直接从含噪 latent 预测语义——作者指出这实际预测的是「干净图语义的平均」,而扩散过程真正做的是先预测后验均值的干净 latent、再从它解码语义,也就是「平均后干净 latent 的语义」。这两者并不等价,把前者当目标去对齐,等于在优化一个错位的量。
  • 本文贡献:论文先把问题形式化,定义语义恢复目标:去噪过程应当从含噪 latent 恢复出干净图的语义内容,好的 tokenizer 应当让这件事更容易。关键结果是一个正交分解——语义恢复误差可以正交拆成「从含噪 latent 直接做最优语义预测的误差」与「上述两种预测之间的误差」。第二项正是被忽略的一致性要求,作者命名为 Semantic Affine Consistency(SAC),并给出 tokenizer 侧的代理指标 M_SAC 用于在不训扩散模型的前提下诊断。方法层面 AffineTok 用两个纯训练期组件促进 SAC:Global Semantic Coordination Token(GSCT)是一个前置的可学习 token,与 patch embedding 一起送进 encoder,用来协调干净 latent 的语义组织、让「语义平均」这个操作仍然有意义,解码前该 token 即被丢弃;Posterior-Mean Semantic Alignment(PMSA)学一个后验均值预测器 G_post,从含噪输入预测后验均值 latent,再用语义投影器监督从中恢复出的语义。语义监督由冻结的 DINO 提供,两个组件推理时都不存在,因此零部署开销。
AffineTok 整体框架:GSCT 协调语义组织,PMSA 对齐后验均值语义
Overall framework of AffineTok. The input image is processed in parallel by a frozen VFM and a trainable tokenizer. Its encoder jointly maps patch embeddings and a prepended learnable GSCT to a global output and clean patch latents (z_0). After (z_0) is noised into (z_t), the resulting global and noisy patch representations receive semantic supervision; the global output is then discarded, while (z_t) is decoded for reconstruction. Along the PMSA path, (G_post) maps (z_t) to a posterior-mean estimate, and (S_post) maps the estimate to semantics. Only clean patch latents are retained downstream.
  • 实验效果:M_SAC 在所评估的多个 tokenizer 与扩散模型规模上都紧跟生成质量,与 SiT-XL 的 gFID 达到 0.960 的 Pearson 相关,这构成了「用 SAC 指导 tokenizer 训练」的依据。ImageNet 256 上,相比基线在 20 epoch 时 gFID 降低 26%;继续训练后取得新的 SOTA——不用 classifier-free guidance 时 gFID 1.21,用 guidance 时 1.10。针对性语义探针(越低越好)显示:语义轴不一致率上,RecTok 在 θ>30° 为 58.3%,加 GSCT 降到 24.4%(降 58%);θ>35° 从 29.5% 降到 7.8%(降 73%);θ>40° 从 12.2% 降到 2.8%(降 77%)。严重失败率(Top-10 语义检索 miss)上,RecTok 在 t=0.7/0.8/0.9 三档为 5.6%/6.4%/15.1%,GSCT+PMSA 后降至 2.3%/3.1%/6.7%(分别降 59%/52%/56%)。
语义探针(越低越好):语义轴失败率最多降 77%,严重失败率腰斩
Targeted semantic probes for GSCT and PMSA (lower is better). Left: Cross-split semantic-axis inconsistency rates for RecTok and +GSCT across three angular thresholds. Right: Top-10 semantic retrieval miss rates for RecTok and +GSCT+PMSA under three severe noise levels.
  • 批判点评:0.960 的 Pearson 相关是在有限数量的 tokenizer 与扩散规模上算出来的,样本点少时相关系数极易虚高,论文需要给出参与拟合的点数与置信区间,否则「M_SAC 可以当选型指标用」这个推论支撑不足。正交分解本身是恒等式变形,它严格说明 SAC 是语义恢复误差的一个必要成分,但不等于「提升 SAC 必然提升生成质量」——两者仍可能同源于第三个变量,论文的因果链是靠相关性搭起来的。gFID 1.10/1.21 是「继续训练」后的结果,基线是否在同等训练预算下评测需要核对,否则 SOTA 里混进了算力优势。语义探针的失败率依赖作者自定的角度阈值 θ,θ 从 30° 挪到 40° 时降幅从 58% 变成 77%,挑阈值的空间不小,读者应关注全曲线而非某一点。GSCT 与 PMSA 只在 ImageNet 256 的类条件生成上验证,能否迁移到文生图与视频 tokenizer 完全未知,而后者才是这条技术线的主战场。

6. KATok:按内容丢token压缩率推到252

Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation | Kakao(韩国) | arXiv:2608.24293

关键词:视频tokenizer,自适应压缩,Gumbel-Softmax,时空冗余,潜在扩散,Kakao

  • 前序问题:潜在扩散之所以能做高保真图像与视频合成,靠的是用 VAE 把数据压到紧凑潜空间来省算力。但常规 VAE 对视频并不合适——它采用固定压缩率,无法适配时空内容复杂度的巨大差异。一段几乎静止的镜头和一段剧烈运动的镜头会被压成同样多的 token:前者纯粹浪费,后者细节不够。固定码率这件事在图像上尚可忍受,到了视频这个冗余度极高、且冗余分布极不均匀的模态上就成了明显的浪费。
  • 本文贡献:KATok 是一个基于 transformer 的 VAE,内含与 latent token 联合学习的自适应 token selector。视频先切成时空 patch 编码成连续 latent token;selector 用 Gumbel-Softmax 松弛为每个 token 预测 keep-or-drop 概率,也就是评估该 token 的内容丰富度,产出一份软 token-drop mask;这份 mask 与 decoder 的注意力共享,保证编解码两侧的 token 选择保持一致;decoder 则通过可学习的 granular query token 去注意保留下来的 latent,重建原始输入。直接把自适应 tokenization 接到扩散模型上会出问题——丢 token 会打乱原有的时空结构,导致生成时内容与位置错配。为此论文提出两种位置预测策略:cascaded generation 与 joint generation(内容与位置联合生成),用来保证空间一致性。
KATok 整体架构:Gumbel-Softmax 学出 keep-or-drop,编解码共享同一份 mask
Overall architecture of KATok. A video is divided into spatio-temporal patches and encoded into continuous latent tokens. The adaptive token selector predicts per-token keep probabilities via Gumbel–Softmax relaxation, producing a soft token-drop mask shared with the decoder attention for consistent token selection. The decoder reconstructs the input via learnable query tokens by attending to the masked latent tokens, forming an end-to-end differentiable pipeline for adaptive token selection.
  • 实验效果:在 SOTA 级压缩率下同时保持强重建与生成质量。压缩率随输入尺寸单调增长,这是自适应方案相对固定方案的核心优势:256²×16 帧约 133,384²×16 约 159,480²×16 约 183,512²×16 约 191,一路到 512²×32 帧达到 252;对照之下 ElasticTok 在测到的两个尺寸上都固定在约 102,OmniTokenizer 则是一条 96 的水平线。也就是说输入越大、冗余越多,KATok 的收益就越明显。进一步分析表明这个改善主要来自削减时空冗余、移除低信息量 token,定量与定性结果都支持这一点。消融图显示:朴素模型直接生成稀疏 latent 时会出现内容-位置错位(图中红框标出),而 joint content-position 与 cascaded 生成策略能缓解这个问题并提升整体生成质量。
压缩率随视频尺寸增长:512²×32 帧达 252,固定率方案停在 102 与 96
Token scaling with video size. As spatial and temporal resolution increase, our method achieves progressively higher compression ratios, demonstrating efficient scalability across input sizes. In contrast, OmniTokenizer maintains a fixed compression ratio, and ElasticTok remains nearly flat. (Conventions and compression ratio definition follow Table.)
  • 批判点评:「data-dependent 压缩」的另一面是 token 数变成不定长,这会直接冲击批处理效率、显存预算与推理调度。论文只在「空间错位」这一处正面应对(靠两个生成策略补救),完全没有量化不定长带来的吞吐损失——而这恰恰是工业落地时第一个要问的问题。压缩率 252 对 96 的对比要成立,前提是双方重建质量在同一水位,可论文对质量只用了「strong」这样的定性词,缺少同 PSNR/rFID 下的压缩率对照表。图里另一个可疑点是 ElasticTok——它本身就是弹性 token 方案,却几乎持平在 102,与其设计意图不符,很可能是基线配置未针对这些分辨率调优,这类对比对基线不太公平。keep-or-drop 是二元决策的松弛,对于「部分重要」的 token 没有中间档,直觉上不如按重要度分配比特数来得优雅。评测集是 UCF、Kinetics、Sky 一类经典短视频数据集,长视频与高动态场景没有覆盖,而那才是自适应压缩本该发挥最大价值的地方。

7. Luce:单图出可重光照PBR高斯资产

Luce: Relightable Gaussians for 3D Asset Generation | Apple | arXiv:2608.23943

关键词:图生3D,PBR材质,可重光照,高斯splatting,rectified flow,Apple

  • 前序问题:高保真的图生 3D 需要一个同时刻画几何与外观的 3D 表示。而要支持重打光、并且能接进标准渲染管线,这个表示必须包含 PBR 模态——albedo、metallic-roughness 与表面法线。现实是主流生成式 3D 表示往往只产出「把光照烘死在外观里」的结果:单看渲染图挺漂亮,一旦塞进游戏引擎或影视管线换个环境光就露馅,因为模型从未把材质与光照分离。
  • 本文贡献:Luce 把几何与 PBR 材质统一在一个体素化的多模态高斯云里,为每个模态配专属的高斯基元。流程分两段:表示转换阶段,给定一个 3D PBR 资产先渲染多视角图,再在稀疏体素网格上按模态各拟合一套高斯 splat(albedo、metallic-roughness、normals),得到 PBR Gaussians;一个结构化潜空间 VAE(SLatVAE)把这个表示编码成紧凑可扩散的 latent,并能解码回 PBR Gaussians。生成阶段,一个 rectified-flow transformer 从单张图生成该 latent,条件来自预训练图像编码器的多层特征(DINOv2 的 L6/L12/L18/L24),多层同时取用是为了兼顾语义上下文与细空间细节;先过 Sparse Structure Flow 定结构、再过 SLat Flow 出 latent、最后由 SLat Decoder 解成 PBR 高斯。产物可直接用 GS 渲染器配 IBL 环境贴图着色,也可选走 Mesh Decoder 导出带切向空间法线图的纹理网格。
Luce 总览:PBR 高斯表示、SLat VAE、单图生成与可选出网格
Overview of Luce. (Top) Representation and SLatVAE. Given a 3D PBR asset, here a Toys4K sample, we render multiview images and fit per-modality Gaussian splats (albedo, metallic-roughness, normals) on a sparse voxel grid. A structured latent VAE (SLatVAE) encodes this representation into a compact, diffusible latent and decodes it back to PBR Gaussians. (Bottom) Generation pipeline. Given a single input image, a sparse-structure flow first predicts the sparse voxel layout. Conditioned on multi-layer DINOv2 features, SLatFlow then generates a PBR Gaussian latent at each active voxel. The structured latent decodes into relightable PBR Gaussians and also serves as input to the mesh decoder, which yields textured meshes with tangent-space normal maps and a complete PBR material set.
  • 实验效果:Toys4K 上取得单图生 3D 的 SOTA,FID 相比最强基线改善 28%。论文另建了一个 AI 生成图像构成的 benchmark,在其上 CLIP 图文对齐分从最佳基线的 0.8299 提升到 0.8519。解码出的 PBR 模态可以在新环境贴图下通过标准 PBR 合成直接着色渲染,不需要抽网格、也不需要 UV 展开——这是相对「先出网格再烘材质」流程的实质简化。重光照验证里,论文把自家 deferred PBR 渲染器在高斯拟合上的输出与用 Blender EEVEE 渲染纹理网格的参考并排对照:同一把战锤在户外日光、草地、暮色、studio 点光、室内、拱廊六种环境贴图下,金属面的高光位置、锤头与手柄的整体色温都随环境同步变化,两条渲染路径的结果高度接近。生成资产还能保住文字、logo、铭文这类细节。
六种环境贴图下的 PBR 重光照:自家高斯渲染器与 Blender EEVEE 参考并排对照
PBR shaded rendering. The decoded PBR modalities (albedo, metallic-roughness, normals) enable shaded rendering under novel environment maps via standard PBR compositing (Eq.), without mesh extraction or UV unwrapping. We compare our deferred PBR renderer on the GS fit against the textured mesh rendered with Blender EEVEE as a reference; the environment maps are listed in Appendix.
  • 批判点评:重光照那组图容易被误读,需要说清楚:它比的是「自家 GS 渲染器 vs Blender EEVEE 渲染同一份纹理网格」,验证的是两条渲染路径自洽、材质分解没跑偏,而不是「重光照质量超越其他生成方法」——论文里没有与基线在重光照维度上的对比。FID 改善 28% 的评测集 Toys4K 是玩具类物体,几何规整、材质单纯,能否外推到复杂场景资产或有透射/次表面散射的材质,证据不足。CLIP 分 0.8519 对 0.8299 只差 0.022,落在 CLIP-score 的噪声量级内,属于弱证据;何况这个 benchmark 由作者自建,构成、规模与筛选标准都需要审视。为每个 PBR 模态各配一套高斯基元意味着基元数量成倍增长,训练与推理开销、体素网格分辨率上限论文摘要没有交代,而这决定了方法的实际可用规模。网格导出被标为 optional,说明主路径产物仍是高斯,要进现有 DCC 管线还差一步转换。作者全部来自 Apple,摘要未提代码或模型是否发布,短期内外部复现的可能性偏低。

8. TransPhy:看两张示例学会物理变换规则

TransPhy: Visual In-Context Learning for Physically Grounded Image Editing | 北京大学、商汤科技研究院、浙江大学 | arXiv:2608.24119

关键词:视觉上下文学习,物理接地编辑,MoE-LoRA,规则归纳,BAGEL,北大商汤

  • 前序问题:视觉示例是指定图像变换的天然接口——很多变换用文字穷举描述极其困难,比如「让这块金属锈到这个程度」或者「让布料在这个受力下这样塌陷」。但现有视觉上下文学习(VICL)方法主要处理外观级的关系迁移,对物理接地的变换支持很有限,而后者的结果取决于材质属性、几何、物体交互与环境条件。给定一对 source-target 示例和一张查询图,物理接地的 VICL 要求模型做三件事:推断出被示范的是什么变换、把这个变换的效果适配到查询图特有的场景上下文、同时保住与规则无关的内容不被改动。
  • 本文贡献:先建数据与评测:PhysVICL-74 含 74 条物理接地变换规则、5,240 对 source-target 图像,组合成近 7.5 万个训练与评测上下文;benchmark 划分把「新实例迁移」(同规则换物体)与「未见规则泛化」分开评,避免用同一个总分掩盖两种截然不同的难度。方法上 TransPhy 把任务分解成物理规则归纳与过渡对齐渲染两步:先预测被示范的规则,并生成一段针对查询图的显式目标状态描述(把隐式的视觉示范转成可检查的中间语言表示);再通过 token 级的混合专家适配合成目标图,专家路由由局部化的过渡线索引导。实现在统一模型 BAGEL 上:理解通路走 Text Encoder 与 ViT Encoder,生成通路走 VAE Encoder,各自经 projector 汇入 MM Attention;Token Level Align 模块用示例对的差分(1-Sim)算出过渡热图,经 Top ρ%、token merging、region refine 得到精炼的过渡证据,以 L_STC 监督对齐 router;MoE-LoRA 的多个专家承担规则渲染,配 router 负载均衡与 token 负载均衡两个约束。
TransPhy 在 BAGEL 上的实现:理解生成双通路 + token 级 MoE-LoRA 渲染
Overview of TransPhy on BAGEL. The understanding and generation pathways encode the exemplar--query context; ViT-derived transition evidence aligns token-level routing, while MoE-LoRA experts render the inferred physical rule.
  • 实验效果:在物理规则遵循度、查询一致性、未见规则泛化三项指标上均优于既有的视觉上下文编辑方法。机制侧的证据来自专家路由可视化:逐层的专家使用热图呈现明显分化(不同 MoE block 偏好不同专家,而非均匀使用),说明路由确实学到了结构而不是退化成平均;把全部 token 硬路由到单个专家时(分别强制走 Expert 0 至 Expert 3),同一张查询图会得到肉眼可辨的不同编辑结果,红框标注处差异最明显——这支持了「不同专家承担了不同的变换成分」这一设计假设,而不是彼此冗余的副本。
专家路由可视化:逐层使用分化明显,强制单专家会得到不同编辑结果
Expert routing visualization. Left: layer-wise expert-routing heat map. Right: results obtained by hard-routing all tokens through experts~0--3.
  • 批判点评:74 条规则、5,240 对图像撑起「近 75K 个上下文」,说明上下文是由有限图像对组合放大出来的,这个数字的实际信息量远小于字面,读者不该把它当成 7.5 万个独立样本看。更关键的缺口是:物理接地变换的真值怎么来的——渲染引擎合成、真实拍摄,还是另一个生成模型产出?摘要完全没交代,而这直接决定这个 benchmark 是否真的「物理正确」,如果真值本身来自生成模型,整套评测就退化成模仿另一个模型的偏好。效果全部以定性优势描述(improves adherence / consistency / generalization),没有一个绝对数字,也没有与具体基线的逐项对比表,这在有自建 benchmark 的情况下尤其说不过去。专家路由图分辨率偏低,红框标注的差异需要放大才能辨认,作为核心机制证据偏弱。方法只在 BAGEL 一个统一模型上实现,对底座能力的依赖程度未知。「未见规则泛化」的划分粒度(留出整条规则,还是同族规则的变体)会极大影响难度,摘要没有说明。

9. Game2World:先擦掉HUD再拿游戏视频训世界模型

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training | Game2World 团队(通讯作者 Dongping Chen,论文未标注机构归属) | arXiv:2608.24680

关键词:世界模型数据,游戏录屏,HUD移除,数据引擎,视频编辑,AAAI2027

  • 前序问题:电子游戏是视频世界模型训练数据的规模化来源——环境多样、交互复杂、野外录屏在互联网上近乎无限。但原始录屏有个结构性缺陷:它把游戏世界和屏幕空间界面纠缠在一起。血条、小地图、任务提示、按键提示、伤害数字这些 HUD 元素会引入游戏特定的偏置和与世界无关的动态,世界模型会把「UI 的变化」当成「世界的变化」学进去,最终产出的既不是干净的画面也不是可信的动力学。
  • 本文贡献:提出 GameUI-Taxonomy 与 G2WEngine,把「游戏 UI 定位与移除」形式化成一套全栈框架。HUD 资产抽取一路是:质量过滤(303 款游戏共 65.72 小时)→ 关键帧采样(采出 1,010 个不同帧)→ 标签起草 → 人工精修(平均每帧 3.69 个 HUD 部件)→ UI 抽取(把裁剪块转成透明资产)。HUD 覆盖层合成一路是:多样性过滤(去掉近似帧)→ 基于语义的构图布局与资产选择 → 时序动画(区分静态与弹出式资产的轨迹)→ alpha 合成与 bbox 追踪,确保合成出来的 UI 在时间上是连贯的。据此构建 Game2World:96K 合成配对视频(带精确重建目标)+ 来自 303 款游戏的 1,079 段野外片段用于真实评测;资产库含 21 个分类下 5,132 个已验证 UI 元素。最后提出 GameCleaner——一个免 mask 的游戏 UI 移除模型,把多模态语义理解与视频编辑能力结合起来,不依赖预先给定的 mask 就能识别并移除多样 HUD,同时保住底层场景内容与时序动态。
G2WEngine 总览:从野外录屏抽 HUD 资产、合成覆盖层、再喂世界模型
Overview of G2WEngine, a scalable data engine that transforms in-the-wild gameplay videos into world-model-ready data through HUD asset extraction, temporally coherent UI synthesis, and downstream support for HUD understanding, removal, and clean gameplay generation.
  • 实验效果:受控 pilot 实验中,用去 UI 录屏训练的世界模型整体 VideoReward 比用带 UI 数据训练的高 6.83%——这是整篇工作的因果论断落点。UI 移除评测上,GameCleaner 在合成视频上平均 AAR 达 95.36,超过最强的时序 mask 基线 57.3%;野外片段上取得最佳 AAR 80.05,背景保持度 99.8。消融给出两条实用曲线:数据规模方面,野外评测下带参考图的表现从 0.2 规模的约 62 分升到全量的约 79.5 分,且曲线尚未收敛,说明继续加数据仍有空间;参考图 drop ratio 方面,野外表现在 20% 附近最好(约 79.8),过高(50%、80%)反而掉到 56、55 附近,而合成集上的表现则对 drop ratio 几乎不敏感(一直在 93~96)——这个合成/野外的分歧本身就是提示。
消融:参考图 drop ratio 在 20% 附近最优,数据规模尚未收敛
Ablation study of data scaling and reference drop ratio during training. We find out that larger and more diverse dataset show generalizable result on in-the-wild evaluation and have not converge yet.
  • 批判点评:6.83% 的 VideoReward 提升来自「受控 pilot」,而模型规模、训练配置、评测 prompt 数量摘要一概没交代。这是全文最关键的因果论断,证据却最薄:去掉 HUD 有益在直觉上显然成立,但提升幅度是否稳定、在多大模型上还成立,目前没有答案。「超过最强时序 mask 基线 57.3%」是相对提升,考虑到基线在合成集上的绝对 AAR 只有 60 出头,相对数字把绝对差距放大了不少。野外 AAR 80.05 与合成 95.36 之间那 15 分的落差是重要信号:它说明合成 UI 与真实 UI 之间仍有明显分布差,而合成数据恰恰是训练主力,这个 gap 才是方法的真实上限所在。1,079 段野外片段作为评测集偏小,303 款游戏的品类分布也未公开,UI 风格的长尾覆盖存疑。1,010 帧的人工精修量对应 5,132 个元素尚算合理,但 21 个分类的边界是否清晰、多标注者一致性如何,都没有报告。最后,arXiv comments 里作者直接留邮箱寻求科研合作与资金支持,正文中也缺失机构归属——这是一支早期自筹阶段的团队,工程可复现性需要谨慎预期。

10. LAION-BVD:1000万小时开源视频数据集

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training | 图宾根大学与图宾根 AI 中心、LAION、于利希超算中心(JSC, FZJ)、Wynd Labs、马普智能系统研究所与 ELLIS Institute Tübingen、慕尼黑工业大学 MCML | arXiv:2608.24845

关键词:开源视频数据集,多模态预训练,CommonCrawl,音频文本,ViCLIP,LAION

  • 前序问题:多模态预训练的视频侧长期缺开放的大规模数据。现有开源视频数据集规模有限(InternVid-10M 量级),真正的大数据集掌握在少数机构手里且不公开,社区因此无法在视频与音频模态上独立验证 scaling 结论——图文模态上 LAION-5B、DataComp-1B 已经把这条路打通了,视频侧却一直缺一个对应的公共基础设施。
  • 本文贡献:LAION-BVD 从 CommonCrawl 中筛出 13 亿条平台特定视频 URL(BVD-URLs),用分布式基础设施实际下载了 8,000 万个视频、总时长 1,000 万小时(BVD-RAW),面向视频、音频、图像三种模态的预训练设计。数据管线用内容感知的场景检测切出片段,并为片段合成生成视频 caption 与音频 caption。派生子集包括:从 240 万视频按 10 秒到 30 分钟过滤并切片得到的 BVD-V-55M(5,500 万片段),再采样出 BVD-V-10M 与 BVD-V-50M;按 2 到 30 秒过滤得到的 BVD-A-1.7M 与 BVD-A-10M 音频片段;以及采样并筛选场景切换帧得到的 BVD-I-300M(3 亿张图像)。最后一条是个有意思的角度——把视频帧当作图文数据的替代来源,因为场景切换帧的视觉分布与常规网页图库明显不同。全量数据集已向研究社区发布。
LAION-BVD 数据管线:13 亿 URL 到 1000 万小时,再派生六个子集
LAION-BVD data curation pipeline. We source data from CommonCrawl and filter for platform-specific video URLs, resulting in 1.3B high-quality video candidates. Out of these, we successfully downloaded 10M video hours using a distributed infrastructure from which we create the BVD-* subsets.
  • 实验效果:在这些数据上训练的模型在标准 video-text 与 audio-text benchmark 上具备竞争力,且随训练量或模型规模增长持续改善。ViCLIP 上,BVD-V-10M 与 BVD-V-50M 的平均检索约为 56.3 与 56.9、平均分类约为 68.2 与 68.4,两项都高于 DataComp-1B(约 45.0 与 62.6)与 InternVid-10M(约 52.8 与 67.6)。CLAP 音频文本上,BVD-A-10M 的曲线整体位于 Laion-Audio 之上,且随模型规模增长的斜率更陡,从约 42.9 升到约 46.8,而 Laion-Audio 同区间为 42.1 到 44.8。用场景切换帧训练的模型取得了强图文检索表现——这印证了「视频帧可作为图文数据替代源」的判断;但同一组实验也诚实报告了反面:LAION-BVD 的 ImageNet 零样本分类仍弱于网页 alt-text 基线。
下游效果:ViCLIP 检索分类双超 DataComp-1B 与 InternVid-10M,CLAP 随规模上升更快
LAION-BVD is an open web video dataset at unprecedented scale. It facilitates strong downstream performance for multimodal pretraining. Left: dataset scale in comparison with existing video datasets. Right: average downstream performance of ViCLIP (video-text, tab:exp_results_wise_ft) and scaling-trends of CLAP (audio-text, tab:exp_results_clap_pure) on standard benchmarks. These results demonstrate that LAION-BVD serves as valuable training data across both video and audio modalities.
  • 批判点评:caption 是「synthetically generate」的,也就是模型产出的伪标签。这决定了数据集的语义上限,也会把 captioner 的偏置固化进所有下游模型,而摘要没说用的是哪个 captioner、也没做 caption 质量的人工抽检——对一个定位为公共基础设施的数据集来说,这是最该交代清楚的一项。1,000 万小时是「下载到的原始时长」,真正进入训练的是切片后的子集(如 BVD-V-50M),两个量级不能混着读,标题里的数字带有一定的宣传性质。ImageNet 零样本弱于 alt-text 基线是个诚实且重要的负面结果:它说明视频帧的分布优势偏检索、不利分类,但作者点出后没给成因分析,读者拿不到「什么时候该用这份数据」的判断依据。开源发布的到底是 URL 列表还是视频本体,极大影响长期可用性——CommonCrawl 系数据集普遍存在链接腐烂,几年后的实际复现率会显著下降。版权授权状态与内容安全过滤强度未在摘要交代,这类超大规模网络采集数据集的合规风险不容忽视。评测骨干只有 ViCLIP 与 CLAP 这类相对轻量的判别式模型,这份数据能否直接用于生成式视频预训练(也就是社区最想要的用法)完全没有验证。

趋势观察

  1. 扩散后训练同一天冒出两条「去似然化」路线,方向出奇一致 — 今天最值得放在一起读的是 DiffusionOPSD(字节 Seed)和 RVM(NVIDIA + Georgia Tech)。两篇互不引用、机构毫无交集,却在同一个判断上撞车:把大语言模型那套策略梯度机制搬到扩散模型上,是一条走歪了的路。原因很朴素——自回归模型有可解析的样本似然,扩散模型没有。为了凑出一个「似然」,现有方法要么从随机去噪转移拼轨迹似然,要么用 ELBO 近似端点似然,代价是额外计算与算法复杂度,而换来的信号依然只挂在端点上。两篇的解法各走一边:DiffusionOPSD 往「中间监督」走,用 reward 梯度在冻结 behavior policy 提供的 anchor 周围直接构造出有界的正负目标,让每一步的 clean-output 预测都有明确的去处;RVM 往「原生表示」走,干脆不要轨迹、不要似然,直接在速度场上做 reward 加权回归,并顺手把 RAM 与 DiffusionNFT 收成特例。省下来的算力是实打实的:DiffusionOPSD 相比 DiffusionNFT 减 40%~63% GPU-hours,RVM 在 Wan2.1-1.3B 上 525 GPU-h 就跑完,DanceGRPO/TaRoS 要 6,171。更值得留意的是 DiffusionOPSD 那个负面发现——目标构造增益更大,不代表一次拟合后的实现增益更大,HPSv2.1 的目标序在 62.3% 的 prompt 上会反转。这提示扩散 RL 的下一个瓶颈可能不在「怎么定目标」,而在「一步优化能吃进去多少」。
  2. 少步蒸馏已经不单独交付了,它和推理工程栈捆成了一个整体 — TurboT2VA 的数字拆解值得逐段看:LTX-2 19B 音视频联合模型,1024×1792、121 帧、单卡 NVIDIA H20 上,40 步教师 318.74 秒。先上 guarded W8A8 加算子融合,拿到 1.37×,降到 233.34 秒;再换成 4 步蒸馏学生,19.18×,降到 12.16 秒;最后叠一层模态感知稀疏注意力(SageSLA,ρ=0.3),再 2.08×,落到 5.83 秒。整体 54.67×。这条链条说明了一件事:单看蒸馏是 19.18×,单看工程栈是 1.37×2.08≈2.85×,但它们乘起来才是那个吓人的数字,任何一环单独宣传都会失真。另一个细节是稀疏化的边界——作者明确保留了跨模态与文本条件的 dense 路径,只对模态内注意力做稀疏。这不是保守,而是承认音画同步这件事经不起近似。反过来看 RVM 那篇也印证了同一件事:它测了从 16 步网格子采样到 5 步、4 步的鲁棒性,说明「少步」已经从加速技巧变成了模型必须自带的属性,而不是发布后再补的一层优化。
  3. 视觉 tokenizer 的竞争焦点,从「压得多」挪到了「压得让下游好学」 — AffineTok(复旦 + 阿里 Token Hub)和 KATok(Kakao)走的是同一个方向的两条腿。AffineTok 问的是语义该怎么组织:现有做法训一个 projector 从含噪 latent 直接预测语义,作者指出这预测的是「干净图语义的平均」,而扩散真正需要对齐的是「平均后干净 latent 的语义」——这两个东西不是一回事。他们把语义恢复误差做正交分解,识别出被忽略的一致性要求(Semantic Affine Consistency),并给出 tokenizer 侧代理指标 M_SAC,报告它与 SiT-XL 的 gFID 有 0.960 的 Pearson 相关。KATok 问的是比特该怎么分配:常规 VAE 用固定压缩率,静止镜头和剧烈运动被压成同样多的 token,前者浪费后者不够;它用 Gumbel-Softmax 给每个 token 学一个 keep-or-drop 概率,压缩率从 256²×16 帧的 133 一路涨到 512²×32 帧的 252,而 ElasticTok 固定在 102、OmniTokenizer 固定 96。一个管「语义排布」,一个管「码率分配」,共同点是都不再把 tokenizer 当成一个可以离线调好然后冻住的前置模块,而是当成对下游生成质量负直接责任的一环。AffineTok 的 GSCT 与 PMSA 都只在训练期存在、推理时丢弃,这个设计取向也很能说明问题——愿意为下游多付训练成本,但不肯多付一分部署开销。
  4. 世界模型的瓶颈正在从「模型」挪到「数据能不能直接用」 — Game2World 和 LAION-BVD 是今天的数据侧双响。前者盯的是一个很具体的脏活:游戏录屏是世界模型训练数据的规模化来源,但血条、小地图、任务提示这些 HUD 元素把游戏世界和屏幕空间界面纠缠在一起,模型会把 UI 的动态当成世界的动态学进去。G2WEngine 把这件事形式化成全栈流程——从 303 款游戏、65.72 小时录屏里抽出 5,132 个已验证 UI 元素(21 个分类),再把时序一致的 UI 覆盖层合成回干净录屏,造出 96K 配对视频用于训练、1,079 段野外片段用于评测,最后训一个免 mask 的 GameCleaner 擦干净。受控实验里,用去 UI 数据训练的世界模型整体 VideoReward 高 6.83%。后者走的是另一个极端:LAION-BVD 从 CommonCrawl 捞了 13 亿条视频 URL,下载 8,000 万个视频共 1,000 万小时,切片后派生出 BVD-V-55M、BVD-I-300M、BVD-A-10M 等一系列子集,ViCLIP 上 BVD-V-50M 的平均检索约 56.9、平均分类约 68.4,都高过 DataComp-1B 与 InternVid-10M。两篇合起来的信号是:视频生成这条线上,「有没有数据」的问题正在被「数据里有多少是能直接喂的」取代。也要留一句冷水——LAION-BVD 的 caption 是模型合成的伪标签,它的天花板就是那个 captioner 的天花板;而它诚实地报告了 ImageNet 零样本分类仍弱于网页 alt-text 基线,说明视频帧的分布优势偏检索、不利分类。

人工智能炼丹君 整理 | 2026-08-27


更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」

每日更新 · 论文精选 · 深度解读 · 技术脉络

微信搜索 人工智能炼丹君 或扫描下方二维码关注

扫码关注「人工智能炼丹君」

0

评论 (0)

取消
粤ICP备2021042327号