首页
应用
关于
Search
1
Pytorch DDP
2,482 阅读
2
Pytorch 常见问题
1,515 阅读
3
视频时序切分
1,344 阅读
4
中文场景下的CLIP图文预训练
1,044 阅读
5
Semi-Supervised + Noisy Label
1,030 阅读
AIGC
AIGC Daily Papers
AIGC Fundamentals
其他
职场经验复盘
多模态理解
购房/投资
阅读
广告
Segmentation
LeetCode
Pytorch
Python
Shell
C++
常用链接
Search
标签搜索
AIGC
人工智能
论文速读
ai
视频生成
DiT
对齐
蒸馏
扩散模型
attention
transformer
图像生成
视频编辑
稀疏注意力
diffusion
基础知识
多模态
文生图
NVIDIA
llm
Jefxiong
累计撰写
207
篇文章
累计收到
8
条评论
首页
应用
栏目
AIGC
AIGC Daily Papers
AIGC Fundamentals
其他
职场经验复盘
多模态理解
购房/投资
阅读
广告
Segmentation
LeetCode
Pytorch
Python
Shell
C++
常用链接
页面
关于
搜索到
82
篇与
ai
的结果
2026-08-27
AIGC 每日速读|2026-08-27|浙大清华19B音视频4步2.5秒出片TurboT2VA
今日 AIGC 论文速览 今日共 10 篇 · 推理加速与少步蒸馏 1 篇 · 扩散后训练与奖励对齐 2 篇 · 音频统一理解与生成 1 篇 · 视觉 tokenizer 与表征组织 2 篇 · 图生 3D 与 PBR 资产 1 篇 · 物理接地图像编辑 1 篇 · 世界模型数据引擎 1 篇 · 大规模开源数据集 1 篇 重点论文标题列表 TurboT2VA(浙江大学、清华大学、天津大学、青岛大学、新加坡国立大学):19B音视频4步蒸馏2.5秒出片 DiffusionOPSD(字节跳动 Seed、新加坡国立大学、加州大学圣地亚哥分校、牛津大学、香港科技大学、马里兰大学、加州大学伯克利分校、杜克大学):把奖励梯度变成中间去噪目标 RVM(佐治亚理工学院、NVIDIA):奖励加权速度匹配替代策略梯度 FireRedAudio(小红书):理解与生成各走一条连续表征 AffineTok(复旦大学、阿里巴巴 Token Hub(Wan 团队)):语义仿射一致把gFID压到1.10 今日论文速览 1. TurboT2VA:19B音视频4步蒸馏2.5秒出片 TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation | 浙江大学、清华大学、天津大学、青岛大学、新加坡国立大学 | arXiv:2608.24674 关键词:少步蒸馏,一致性蒸馏,音视频联合生成,LTX-2,稀疏注意力,W8A8量化,浙大清华 前序问题:文本到「视频+音频」的联合生成能一次产出画面与声音同步的内容,但这类模型的推理成本高得离谱:采样轨迹长(40 步)、参数量大(19B)、而且视频流与音频流的计算特性完全不同,异构多模态计算让常规加速手段难以直接照搬。把大规模 T2VA 模型蒸馏成少步学生具体卡在三处:一是模态不均衡优化——视频与音频的损失尺度、收敛速度差异显著,共用一套归一化会让某一路主导梯度;二是连续时间一致性训练在这个规模上很难稳住,学生容易在训练中后期崩掉;三是质量与多样性的权衡——分布匹配类目标(DMD)虽然能把画质拉上去,却容易把生成多样性压塌,退化成少数几个模式。 本文贡献:TurboT2VA 的主体是一套双散度蒸馏框架加一条渐进课程。框架分三块:左侧对视频与音频分别做前向一致性蒸馏(各自沿教师 PF-ODE 学自己的一致性场,同时带跨模态一致性约束);中间是 T2VA 双流骨干,视频流与音频流各有 self-attention 与 text cross-attention,再通过 VA cross-attention 相互耦合;右侧做反向散度精修,用分布匹配把学生输出分布拉向教师分布。课程按 dCM 预热 → sCM 精修 → sCM+DMD 联合优化三段推进,先建立稳定且多样的生成轨迹,只有到最后才引入分布级精修——顺序反了就会先塌多样性。模态不均衡用 per-modality normalization 解决。除蒸馏之外还配了一套架构感知的推理栈:guarded W8A8 量化与算子融合、padded-text compaction、模态感知稀疏注意力,但明确保留跨模态与文本条件路径为 dense,不对音画同步这条链路做近似。 Overview of the proposed Dual-Divergence Distillation framework for T2VA acceleration. The left panel illustrates forward consistency distillation for video and audio modalities, the middle shows the T2VA backbone with cross-modal interaction, and the right panel depicts reverse divergence (distribution matching) refinement. 实验效果:在 LTX-2 上做 4 步蒸馏,标准评测分辨率 512×768 下生成器延迟从 50.52 秒降到 2.51 秒,20.1 倍加速,同时维持视觉质量、音频保真度、多样性与音画同步。高分辨率部署(1024×1792、121 帧、单卡 NVIDIA H20、batch size 1)下的完整栈拆解得很清楚:40 步教师基线 318.74 秒;加 W8A8 与算子融合得 1.37 倍,降至 233.34 秒;换成 4 步学生再得 19.18 倍,降至 12.16 秒;最后叠加 SageSLA 稀疏注意力(默认 ρ=0.3)再得 2.08 倍,落到 5.83 秒,整体 54.67 倍(仅生成器)。训练曲线消融跑到 7,500 全局步:分阶段 dCM→sCM→sCM+DMD 在进入联合阶段后反超直接做 sCM+DMD,并在训练后期保持更强表现;从同一段 dCM+sCM 前缀出发,分阶段 sCM+DMD 的 Javis 分数也高于纯 DMD 精修或只继续 sCM。 High-resolution inference acceleration, achieving a 54.67$\times$ generator-only speedup on one NVIDIA H20. 批判点评:20.1 倍与 54.67 倍都是 generator-only 延迟,不含 VAE 解码、文本编码与音频后处理,端到端加速会明显低于这两个数字,读者不要直接当成「出片时间快 54 倍」。更需要留意的是 54.67 倍把蒸馏(19.18 倍)和推理工程栈(1.37×2.08≈2.85 倍)的功劳乘在了一起——工程栈那部分与蒸馏方法本身无关,换任何一个模型都能拿,混在一个标题数字里报有夸大之嫌。质量侧只给了「strong visual quality / audio fidelity / synchronization」这类定性表述,没有 FVD、CLAP、AV-Sync offset 的绝对值,也没有与 40 步教师的逐项差距,而少步蒸馏最该被审视的恰恰是「掉了多少」。W8A8 前面挂了 guarded 这个限定词,说明存在必须保护的敏感层,但哪些层回退高精度、回退比例多少没有交代,这会影响别人复现时的实际加速比。稀疏注意力保留了 dense 跨模态路径,意味着收益会随音视频 token 配比波动,不同视频时长下的敏感性没测。全部结论只在 LTX-2 一个骨干上得到;H20 是国内特供算力卡,其显存带宽与算力配比和 H100 差异不小,量化与稀疏化的收益能否平移过去论文没有讨论。 2. DiffusionOPSD:把奖励梯度变成中间去噪目标 On-Policy Self-Distillation in Diffusion Models | 字节跳动 Seed、新加坡国立大学、加州大学圣地亚哥分校、牛津大学、香港科技大学、马里兰大学、加州大学伯克利分校、杜克大学 | arXiv:2608.24646 关键词:扩散后训练,on-policy自蒸馏,奖励梯度,中间监督,人类偏好对齐,字节Seed 前序问题:强化学习能把扩散模型对齐到人类偏好与任务目标上,但奖励是打在端点(生成图)上的,它不告诉某一步的中间去噪预测该往哪个方向改。这就是扩散 RL 的结构性困难:自回归模型有可解析的样本似然,可以直接套策略梯度;扩散模型没有,于是现有方法只能绕——要么从随机去噪转移拼出轨迹似然,要么用证据下界近似端点似然。两条路都要付额外的计算与算法复杂度,而换来的监督信号仍然稀疏地挂在轨迹末端,中间那几十步实际上是在盲走。 本文贡献:DiffusionOPSD 把「图像级奖励引导」直接转成「clean-output 预测的显式目标」。每一轮外循环里,一个冻结的 behavior policy 先生成轨迹,同时提供采样查询状态与 anchor;奖励梯度在每个 anchor 周围构造出有界的正目标与负目标;可训练 policy 以 detached supervision 的方式拟合这些目标(作者称之为 finite fitting),拟合完成后用指数移动平均更新刷新 behavior policy。这个结构的价值不只在效果——它把「目标构造」和「有限实现」拆成两个可以分别度量的环节,从而让扩散 RL 第一次变得可诊断。论文特意做了同 query 的受控实验来分别观测这两环。 Reward-to-policy paradigms. We contrast trajectory credit, late-state reward backpropagation, and endpoint supervision with our explicit intermediate targets constructed before finite fitting. 实验效果:在 SD 3.5-M 与已做过步蒸馏的 Z-Image-Turbo 两个骨干、10 个 evaluator 组成的 20 个 reward-matched 设置中,19 个取得最佳 held-out 分数;相比最强竞争方法最高提升 44.0%。训练成本上,相比 DiffusionNFT 在 SD 3.5-M 上省 40% GPU-hours、在 Z-Image-Turbo 上省 63%(实验用单节点 8×NVIDIA A800-SXM4-80GB)。人类标注偏好中,标注者在 64%、71%、90%、61% 的 prompt 上更喜欢 DiffusionOPSD 而非 base 模型、FlowGRPO、DiffusionNFT、ReFL;胜出原因的构成显示提示词对齐与视觉质量各占大头。鲁棒性 sweep 表明 query noise 从低到中、目标半径 ρ 从 0.08 到 0.40 都稳定在默认水平附近。最耐人寻味的是那个负面发现:受控同 query 实验里,reward 梯度目标的构造增益是 +0.03511、DiffusionNFT 端点是 −0.03551,但一次拟合更新之后,HPSv2.1 的目标序在 62.3% 的 prompt 上发生反转——构造阶段赢得多,不代表落地得多。 Robustness and human preference. Low-to-mid query noise and target radii from $0.08$ to $0.40$ remain near the default, while query noise $0.90$ and branch coefficient $10$ fall to $0.2884$ and $0.2961$. Annotators prefer DiffusionOPSD over the base model, FlowGRPO, DiffusionNFT, and ReFL on $64\%$, $71\%$, $90\%$, and $61\%$ of prompts. 批判点评:这篇最有价值的结论其实是负面的:目标构造增益与单次拟合实现增益之间只有弱相关(62.3% 反转率)。它说明方法的两个部件耦合得比论文正面叙事更松,但论文没有据此给出「目标半径该怎么选」的可操作准则,把一个诊断工具停在了诊断阶段。19/20 的胜率听起来压倒性,可 10 个 evaluator 背后只有少数几类 reward,同一 reward 下多个 evaluator 高度相关,等效独立比较数远小于 20,这个分母是被放大过的。44.0% 是「相对最强对手的最大提升」而不是中位提升,属于挑最好看的那一格报。鲁棒性图自己也暴露了边界——query noise 取 0.90、branch 系数取 10 时 ClipScore 掉到 0.2884 与 0.2961,说明超参窗口并不宽,而实际调参时未必知道自己在窗口的哪个位置。作者共 14 人以上、横跨 8 家单位,正文却以「DiffusionOPSD Team」匿名署名(真实名单只在附录),这类大团队技术报告的工程细节历来难以被外部独立复现。 3. RVM:奖励加权速度匹配替代策略梯度 Scaling Reinforcement Learning for Diffusion Models via Velocity Matching | 佐治亚理工学院、NVIDIA | arXiv:2608.23664 关键词:扩散奖励微调,速度匹配,免轨迹更新,VBench,动态跟踪奖励,NVIDIA 前序问题:奖励微调正在成为把扩散模型对齐到人类偏好与任务目标的主要工具,但现有方法基本是把大语言模型那套策略梯度机制整体继承过来的。问题在于扩散模型不像自回归模型,它对生成样本没有可计算的似然。结果是当前方案只能从随机去噪转移构造轨迹似然,或者用证据下界近似端点似然,两者都引入额外计算与算法复杂度。作者要论证的是一个更激进的判断:这套基于似然的机制对扩散奖励微调根本不是必需的。另外还有个实践层面的坑——标准偏好奖励在视频生成上会偏爱画面干净但几乎静止的输出,等于奖励模型在鼓励模型偷懒。 本文贡献:提出 reward-based velocity matching(RVM),一个直接作用在速度场上的免轨迹更新。流程是:从高斯噪声出发做 16 步 ODE rollout(不用 CFG)得到分组样本,用公开奖励模型加上自研的 dynamic-tracking(DT)运动奖励打分;每个生成样本只加噪一次得到 x_t,其速度目标为 v = ε − x0;然后用奖励加权的速度匹配损失做回归,额外带一个可选的 anchor 项控制相对参考速度场的漂移。方向上它强化高奖励生成对应的速度方向、抑制低奖励方向,不需要沿轨迹反传,也不需要任何似然项。论文进一步指出这是一个通用框架,RAM 与 DiffusionNFT 都可作为特例被恢复。文中还给出了轨迹损失与速度匹配的机制对比:轨迹损失提升的是被采样单步转移的似然,因而朝下一个去噪状态移动,而那个中间状态是随机的、不保证比当前更接近干净端点,目标方向因此含噪。 Overview of RVM. Left: RVM fine-tunes Wan2.1-1.3B with a simple reward-weighted velocity-matching loss. Grouped rollouts are scored using public reward models together with our dynamic-tracking (DT) reward, and each generated sample $\bm{x}^i_0$ is noised once to $\bm{x}^i_t$ and regressed toward its velocity target $\bm{v}^i=\bm{\epsilon}^i-\bm{x}^i_0$, with an optional anchor velocity $\bm{v}_{\mathrm{anc}}$ controlling model drift, avoiding trajectory storage and likelihood estimation. Right: on Wan2.1-1.3B, RVM achieves the best VBench Overall score at a fraction of the training cost of trajectory-based methods. 实验效果:在 Wan2.1-T2V-1.3B 上,RVM 用 525 GPU-h(8×H100,含 rollout、奖励评估、梯度更新三段)完成微调,FlowGRPO 需 1,159 GPU-h(2.2 倍)、DanceGRPO/TaRoS 需 6,171 GPU-h(11.8 倍);成本最低的同时拿到最高的 VBench Overall 84.13,FlowGRPO 为 75.91。引入 DT 奖励后运动幅度大幅改善,而 VBench 整体表现同时上升,说明「动起来」和「好看」并非必须二选一。另一个实用发现是:速度更新一旦简化,具体用哪种损失变体的影响就小于奖励与 anchor 的设计——这把调参重心从损失工程挪到了奖励工程。少步推理测试中,把训练好的 16 步时间网格子采样到 5 步与 4 步、保持同一 timestep schedule,VBench Total 仍然保持稳健。 GPU-hour cost comparison on Wan2.1-T2V-1.3B. Training time is decomposed into rollout, reward evaluation, and gradient update. % Note that despite being the cheapest, RVM attains the highest VBench Overall ($84.13$ vs. $75.91$ for FlowGRPO). 批判点评:提交件里作者块留的还是 ICLR 会议模板的占位符(Cranberry-Lemon University 那一段),真实作者信息在另一份 tex 文件里,说明投稿版本管理相当仓促,这类细节多少反映了工作的成熟度。「统一了 RAM 与 DiffusionNFT」的说法要打折看——特例关系通常依赖特定的权重函数与 anchor 取值,论文没有给出这些约化成立的严格条件表,缺了它这个 claim 更像叙事包装。VBench Overall 84.13 对 75.91 的差距确实不小,但作者自己就指出 VBench 系偏好奖励会偏爱静态高清画面、并因此专门做了 DT 奖励,那么再把 VBench Overall 当作主指标来宣布胜利,逻辑上有循环论证的味道。GPU-h 对比中 RVM 的 rollout 只用 16 步且不开 CFG,而基线是否在同等 rollout 预算与采样配置下测量没有交代清楚,成本优势里有多少来自算法、多少来自采样设置无法分离。主实验集中在 1.3B 规模,14B 级别模型上速度场回归是否仍然稳定、anchor 项该怎么随规模调整,都还是空白。 4. FireRedAudio:理解与生成各走一条连续表征 FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation | 小红书 | arXiv:2608.24168 关键词:音频语言模型,统一理解生成,连续表征解耦,零样本TTS,语音编辑,小红书 前序问题:一个统一的音频模型既要识别和理解语言、副语言(情绪、说话人)与环境信息,又要支持语音合成与编辑。矛盾集中在表征这一层:理解任务偏好紧凑特征,因为长上下文建模吃不下高帧率细节;而语音生成需要可重建的特征,必须保留细粒度声学信息。用一套离散 token 同时服务两端,往往两头都不讨好——压得够紧就重建不回来,留得够细就撑不起一小时长音频的上下文。 本文贡献:FireRedAudio 共享一个 9B 参数的 LLM,但为理解与生成分设两条独立的连续输入表征。待识别或分析的音频走专用 Audio Encoder 加 Adapter;用于生成条件的语音输入走 RedAE 路径——RedAE 本身是个自编码器,把 50Hz 的音频帧压成 25Hz latent,训练时由一个冻结的教师 Audio Encoder 提供高层监督,并通过 iSTFT head 重建波形。LLM 直接输出文本,或者经 Flow Head 去条件一个 flow-matching DiT,产出连续声学 latent 再由 Decoder 还原成波形;DiT 的条件里同时包含历史干净 latent 与当前含噪 latent 以及 LLM 隐状态。经渐进多任务训练后,同一个模型支持 ASR、音频理解(可覆盖长达一小时的录音)、零样本 TTS、Instruct TTS,以及语义级与声学级两类语音编辑。作者称这是首个公开披露的、在单个可训练自回归 LLM 内为理解与生成分别提供连续输入表征的统一音频语言模型,代码已开源。 Overview of FireRedAudio. Decoupled continuous pathways encode inputs for understanding and generation. The shared LLM produces text or conditions a DiT to generate RedAE latents, which are decoded into waveforms. The inset illustrates the DiT conditioning for one audio step. 实验效果:综合评测下,音频理解与多语种 ASR 达到有竞争力或领先的水平;零样本 TTS 在内容准确率与说话人保持两项上都强;Instruct TTS 的指令跟随领先;语义与声学两类语音编辑相比 Ming-UniAudio-Edit 有大幅改善。长音频侧展示了四类能力:结构化组织(把录音解析成带 start/end、说话人、背景音、情绪的时间戳表格,量化的时间定位评测就聚焦这一项,达到秒级时间戳精度)、长文摘要(可按对象聚焦,如「只总结 Guest B」并给出 02:15/14:40/37:05 这类带时间锚点的要点)、时间↔内容双向检索(既能问「12:00 谁在说什么」也能问「定价模型在哪几个时间点被提到」)、以及跨录音证据的全局分析(如「为什么 Guest A 在 24:10 笑」需要串起 03:10 到 24:10 的多个证据节点)。这些结果支撑了一个结论:中等规模模型上,解耦的连续输入表征足以统一音频理解与连续潜空间语音生成。 Four representative long-form audio-understanding capabilities: structured organization, long-form summarization, bidirectional retrieval between time and content, and global analysis over evidence distributed across a recording. Our quantitative temporal-grounding evaluation focuses on structured organization. 批判点评:「首个公开披露」这个 claim 叠了三层限定词——publicly disclosed、within a single trainable autoregressive LLM、separate continuous input representations——本质是在一个足够窄的定义里宣称首创,读者要看清边界再决定这个「首个」值多少。9B LLM 的底座是什么、是否从某个开源模型继续训练,摘要完全没提,而这直接决定了工作量、复现难度与结果的归因。「competitive or leading」是典型的选择性表述,缺少与 Qwen-Audio、Step-Audio、Ming-UniAudio 等同类在主流 benchmark 上的逐项数字,读者无从判断领先幅度。一小时长音频理解的量化评测只覆盖「结构化组织」一项,摘要、双向检索、全局分析三项在图里是能力示意(带具体案例的界面示例)而非量化结果,这三项的真实可靠度目前无法评估。解耦两条表征的代价是推理时要同时维护两套编码器,额外的参数量与显存开销没有交代。语音编辑只对比了 Ming-UniAudio-Edit 一个基线,样本偏少。 5. AffineTok:语义仿射一致把gFID压到1.10 AffineTok: Semantic Affine Consistency for Diffusion-Friendly Visual Tokenizer | 复旦大学、阿里巴巴 Token Hub(Wan 团队) | arXiv:2608.23864 关键词:视觉tokenizer,语义对齐,扩散友好,SAC一致性,gFID,复旦阿里 前序问题:视觉 tokenizer 越来越流行往潜空间注入语义监督,好让下游扩散学得更轻松。但「语义究竟该怎么组织才有利于去噪」这个问题几乎没被认真研究过。现有做法是训一个 projector 直接从含噪 latent 预测语义——作者指出这实际预测的是「干净图语义的平均」,而扩散过程真正做的是先预测后验均值的干净 latent、再从它解码语义,也就是「平均后干净 latent 的语义」。这两者并不等价,把前者当目标去对齐,等于在优化一个错位的量。 本文贡献:论文先把问题形式化,定义语义恢复目标:去噪过程应当从含噪 latent 恢复出干净图的语义内容,好的 tokenizer 应当让这件事更容易。关键结果是一个正交分解——语义恢复误差可以正交拆成「从含噪 latent 直接做最优语义预测的误差」与「上述两种预测之间的误差」。第二项正是被忽略的一致性要求,作者命名为 Semantic Affine Consistency(SAC),并给出 tokenizer 侧的代理指标 M_SAC 用于在不训扩散模型的前提下诊断。方法层面 AffineTok 用两个纯训练期组件促进 SAC:Global Semantic Coordination Token(GSCT)是一个前置的可学习 token,与 patch embedding 一起送进 encoder,用来协调干净 latent 的语义组织、让「语义平均」这个操作仍然有意义,解码前该 token 即被丢弃;Posterior-Mean Semantic Alignment(PMSA)学一个后验均值预测器 G_post,从含噪输入预测后验均值 latent,再用语义投影器监督从中恢复出的语义。语义监督由冻结的 DINO 提供,两个组件推理时都不存在,因此零部署开销。 Overall framework of AffineTok. The input image is processed in parallel by a frozen VFM and a trainable tokenizer. Its encoder jointly maps patch embeddings and a prepended learnable GSCT to a global output and clean patch latents (z_0). After (z_0) is noised into (z_t), the resulting global and noisy patch representations receive semantic supervision; the global output is then discarded, while (z_t) is decoded for reconstruction. Along the PMSA path, (G_post) maps (z_t) to a posterior-mean estimate, and (S_post) maps the estimate to semantics. Only clean patch latents are retained downstream. 实验效果:M_SAC 在所评估的多个 tokenizer 与扩散模型规模上都紧跟生成质量,与 SiT-XL 的 gFID 达到 0.960 的 Pearson 相关,这构成了「用 SAC 指导 tokenizer 训练」的依据。ImageNet 256 上,相比基线在 20 epoch 时 gFID 降低 26%;继续训练后取得新的 SOTA——不用 classifier-free guidance 时 gFID 1.21,用 guidance 时 1.10。针对性语义探针(越低越好)显示:语义轴不一致率上,RecTok 在 θ>30° 为 58.3%,加 GSCT 降到 24.4%(降 58%);θ>35° 从 29.5% 降到 7.8%(降 73%);θ>40° 从 12.2% 降到 2.8%(降 77%)。严重失败率(Top-10 语义检索 miss)上,RecTok 在 t=0.7/0.8/0.9 三档为 5.6%/6.4%/15.1%,GSCT+PMSA 后降至 2.3%/3.1%/6.7%(分别降 59%/52%/56%)。 Targeted semantic probes for GSCT and PMSA (lower is better). Left: Cross-split semantic-axis inconsistency rates for RecTok and +GSCT across three angular thresholds. Right: Top-10 semantic retrieval miss rates for RecTok and +GSCT+PMSA under three severe noise levels. 批判点评:0.960 的 Pearson 相关是在有限数量的 tokenizer 与扩散规模上算出来的,样本点少时相关系数极易虚高,论文需要给出参与拟合的点数与置信区间,否则「M_SAC 可以当选型指标用」这个推论支撑不足。正交分解本身是恒等式变形,它严格说明 SAC 是语义恢复误差的一个必要成分,但不等于「提升 SAC 必然提升生成质量」——两者仍可能同源于第三个变量,论文的因果链是靠相关性搭起来的。gFID 1.10/1.21 是「继续训练」后的结果,基线是否在同等训练预算下评测需要核对,否则 SOTA 里混进了算力优势。语义探针的失败率依赖作者自定的角度阈值 θ,θ 从 30° 挪到 40° 时降幅从 58% 变成 77%,挑阈值的空间不小,读者应关注全曲线而非某一点。GSCT 与 PMSA 只在 ImageNet 256 的类条件生成上验证,能否迁移到文生图与视频 tokenizer 完全未知,而后者才是这条技术线的主战场。 6. KATok:按内容丢token压缩率推到252 Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation | Kakao(韩国) | arXiv:2608.24293 关键词:视频tokenizer,自适应压缩,Gumbel-Softmax,时空冗余,潜在扩散,Kakao 前序问题:潜在扩散之所以能做高保真图像与视频合成,靠的是用 VAE 把数据压到紧凑潜空间来省算力。但常规 VAE 对视频并不合适——它采用固定压缩率,无法适配时空内容复杂度的巨大差异。一段几乎静止的镜头和一段剧烈运动的镜头会被压成同样多的 token:前者纯粹浪费,后者细节不够。固定码率这件事在图像上尚可忍受,到了视频这个冗余度极高、且冗余分布极不均匀的模态上就成了明显的浪费。 本文贡献:KATok 是一个基于 transformer 的 VAE,内含与 latent token 联合学习的自适应 token selector。视频先切成时空 patch 编码成连续 latent token;selector 用 Gumbel-Softmax 松弛为每个 token 预测 keep-or-drop 概率,也就是评估该 token 的内容丰富度,产出一份软 token-drop mask;这份 mask 与 decoder 的注意力共享,保证编解码两侧的 token 选择保持一致;decoder 则通过可学习的 granular query token 去注意保留下来的 latent,重建原始输入。直接把自适应 tokenization 接到扩散模型上会出问题——丢 token 会打乱原有的时空结构,导致生成时内容与位置错配。为此论文提出两种位置预测策略:cascaded generation 与 joint generation(内容与位置联合生成),用来保证空间一致性。 Overall architecture of KATok. A video is divided into spatio-temporal patches and encoded into continuous latent tokens. The adaptive token selector predicts per-token keep probabilities via Gumbel–Softmax relaxation, producing a soft token-drop mask shared with the decoder attention for consistent token selection. The decoder reconstructs the input via learnable query tokens by attending to the masked latent tokens, forming an end-to-end differentiable pipeline for adaptive token selection. 实验效果:在 SOTA 级压缩率下同时保持强重建与生成质量。压缩率随输入尺寸单调增长,这是自适应方案相对固定方案的核心优势:256²×16 帧约 133,384²×16 约 159,480²×16 约 183,512²×16 约 191,一路到 512²×32 帧达到 252;对照之下 ElasticTok 在测到的两个尺寸上都固定在约 102,OmniTokenizer 则是一条 96 的水平线。也就是说输入越大、冗余越多,KATok 的收益就越明显。进一步分析表明这个改善主要来自削减时空冗余、移除低信息量 token,定量与定性结果都支持这一点。消融图显示:朴素模型直接生成稀疏 latent 时会出现内容-位置错位(图中红框标出),而 joint content-position 与 cascaded 生成策略能缓解这个问题并提升整体生成质量。 Token scaling with video size. As spatial and temporal resolution increase, our method achieves progressively higher compression ratios, demonstrating efficient scalability across input sizes. In contrast, OmniTokenizer maintains a fixed compression ratio, and ElasticTok remains nearly flat. (Conventions and compression ratio definition follow Table.) 批判点评:「data-dependent 压缩」的另一面是 token 数变成不定长,这会直接冲击批处理效率、显存预算与推理调度。论文只在「空间错位」这一处正面应对(靠两个生成策略补救),完全没有量化不定长带来的吞吐损失——而这恰恰是工业落地时第一个要问的问题。压缩率 252 对 96 的对比要成立,前提是双方重建质量在同一水位,可论文对质量只用了「strong」这样的定性词,缺少同 PSNR/rFID 下的压缩率对照表。图里另一个可疑点是 ElasticTok——它本身就是弹性 token 方案,却几乎持平在 102,与其设计意图不符,很可能是基线配置未针对这些分辨率调优,这类对比对基线不太公平。keep-or-drop 是二元决策的松弛,对于「部分重要」的 token 没有中间档,直觉上不如按重要度分配比特数来得优雅。评测集是 UCF、Kinetics、Sky 一类经典短视频数据集,长视频与高动态场景没有覆盖,而那才是自适应压缩本该发挥最大价值的地方。 7. Luce:单图出可重光照PBR高斯资产 Luce: Relightable Gaussians for 3D Asset Generation | Apple | arXiv:2608.23943 关键词:图生3D,PBR材质,可重光照,高斯splatting,rectified flow,Apple 前序问题:高保真的图生 3D 需要一个同时刻画几何与外观的 3D 表示。而要支持重打光、并且能接进标准渲染管线,这个表示必须包含 PBR 模态——albedo、metallic-roughness 与表面法线。现实是主流生成式 3D 表示往往只产出「把光照烘死在外观里」的结果:单看渲染图挺漂亮,一旦塞进游戏引擎或影视管线换个环境光就露馅,因为模型从未把材质与光照分离。 本文贡献:Luce 把几何与 PBR 材质统一在一个体素化的多模态高斯云里,为每个模态配专属的高斯基元。流程分两段:表示转换阶段,给定一个 3D PBR 资产先渲染多视角图,再在稀疏体素网格上按模态各拟合一套高斯 splat(albedo、metallic-roughness、normals),得到 PBR Gaussians;一个结构化潜空间 VAE(SLatVAE)把这个表示编码成紧凑可扩散的 latent,并能解码回 PBR Gaussians。生成阶段,一个 rectified-flow transformer 从单张图生成该 latent,条件来自预训练图像编码器的多层特征(DINOv2 的 L6/L12/L18/L24),多层同时取用是为了兼顾语义上下文与细空间细节;先过 Sparse Structure Flow 定结构、再过 SLat Flow 出 latent、最后由 SLat Decoder 解成 PBR 高斯。产物可直接用 GS 渲染器配 IBL 环境贴图着色,也可选走 Mesh Decoder 导出带切向空间法线图的纹理网格。 Overview of Luce. (Top) Representation and SLatVAE. Given a 3D PBR asset, here a Toys4K sample, we render multiview images and fit per-modality Gaussian splats (albedo, metallic-roughness, normals) on a sparse voxel grid. A structured latent VAE (SLatVAE) encodes this representation into a compact, diffusible latent and decodes it back to PBR Gaussians. (Bottom) Generation pipeline. Given a single input image, a sparse-structure flow first predicts the sparse voxel layout. Conditioned on multi-layer DINOv2 features, SLatFlow then generates a PBR Gaussian latent at each active voxel. The structured latent decodes into relightable PBR Gaussians and also serves as input to the mesh decoder, which yields textured meshes with tangent-space normal maps and a complete PBR material set. 实验效果:Toys4K 上取得单图生 3D 的 SOTA,FID 相比最强基线改善 28%。论文另建了一个 AI 生成图像构成的 benchmark,在其上 CLIP 图文对齐分从最佳基线的 0.8299 提升到 0.8519。解码出的 PBR 模态可以在新环境贴图下通过标准 PBR 合成直接着色渲染,不需要抽网格、也不需要 UV 展开——这是相对「先出网格再烘材质」流程的实质简化。重光照验证里,论文把自家 deferred PBR 渲染器在高斯拟合上的输出与用 Blender EEVEE 渲染纹理网格的参考并排对照:同一把战锤在户外日光、草地、暮色、studio 点光、室内、拱廊六种环境贴图下,金属面的高光位置、锤头与手柄的整体色温都随环境同步变化,两条渲染路径的结果高度接近。生成资产还能保住文字、logo、铭文这类细节。 PBR shaded rendering. The decoded PBR modalities (albedo, metallic-roughness, normals) enable shaded rendering under novel environment maps via standard PBR compositing (Eq.), without mesh extraction or UV unwrapping. We compare our deferred PBR renderer on the GS fit against the textured mesh rendered with Blender EEVEE as a reference; the environment maps are listed in Appendix. 批判点评:重光照那组图容易被误读,需要说清楚:它比的是「自家 GS 渲染器 vs Blender EEVEE 渲染同一份纹理网格」,验证的是两条渲染路径自洽、材质分解没跑偏,而不是「重光照质量超越其他生成方法」——论文里没有与基线在重光照维度上的对比。FID 改善 28% 的评测集 Toys4K 是玩具类物体,几何规整、材质单纯,能否外推到复杂场景资产或有透射/次表面散射的材质,证据不足。CLIP 分 0.8519 对 0.8299 只差 0.022,落在 CLIP-score 的噪声量级内,属于弱证据;何况这个 benchmark 由作者自建,构成、规模与筛选标准都需要审视。为每个 PBR 模态各配一套高斯基元意味着基元数量成倍增长,训练与推理开销、体素网格分辨率上限论文摘要没有交代,而这决定了方法的实际可用规模。网格导出被标为 optional,说明主路径产物仍是高斯,要进现有 DCC 管线还差一步转换。作者全部来自 Apple,摘要未提代码或模型是否发布,短期内外部复现的可能性偏低。 8. TransPhy:看两张示例学会物理变换规则 TransPhy: Visual In-Context Learning for Physically Grounded Image Editing | 北京大学、商汤科技研究院、浙江大学 | arXiv:2608.24119 关键词:视觉上下文学习,物理接地编辑,MoE-LoRA,规则归纳,BAGEL,北大商汤 前序问题:视觉示例是指定图像变换的天然接口——很多变换用文字穷举描述极其困难,比如「让这块金属锈到这个程度」或者「让布料在这个受力下这样塌陷」。但现有视觉上下文学习(VICL)方法主要处理外观级的关系迁移,对物理接地的变换支持很有限,而后者的结果取决于材质属性、几何、物体交互与环境条件。给定一对 source-target 示例和一张查询图,物理接地的 VICL 要求模型做三件事:推断出被示范的是什么变换、把这个变换的效果适配到查询图特有的场景上下文、同时保住与规则无关的内容不被改动。 本文贡献:先建数据与评测:PhysVICL-74 含 74 条物理接地变换规则、5,240 对 source-target 图像,组合成近 7.5 万个训练与评测上下文;benchmark 划分把「新实例迁移」(同规则换物体)与「未见规则泛化」分开评,避免用同一个总分掩盖两种截然不同的难度。方法上 TransPhy 把任务分解成物理规则归纳与过渡对齐渲染两步:先预测被示范的规则,并生成一段针对查询图的显式目标状态描述(把隐式的视觉示范转成可检查的中间语言表示);再通过 token 级的混合专家适配合成目标图,专家路由由局部化的过渡线索引导。实现在统一模型 BAGEL 上:理解通路走 Text Encoder 与 ViT Encoder,生成通路走 VAE Encoder,各自经 projector 汇入 MM Attention;Token Level Align 模块用示例对的差分(1-Sim)算出过渡热图,经 Top ρ%、token merging、region refine 得到精炼的过渡证据,以 L_STC 监督对齐 router;MoE-LoRA 的多个专家承担规则渲染,配 router 负载均衡与 token 负载均衡两个约束。 Overview of TransPhy on BAGEL. The understanding and generation pathways encode the exemplar--query context; ViT-derived transition evidence aligns token-level routing, while MoE-LoRA experts render the inferred physical rule. 实验效果:在物理规则遵循度、查询一致性、未见规则泛化三项指标上均优于既有的视觉上下文编辑方法。机制侧的证据来自专家路由可视化:逐层的专家使用热图呈现明显分化(不同 MoE block 偏好不同专家,而非均匀使用),说明路由确实学到了结构而不是退化成平均;把全部 token 硬路由到单个专家时(分别强制走 Expert 0 至 Expert 3),同一张查询图会得到肉眼可辨的不同编辑结果,红框标注处差异最明显——这支持了「不同专家承担了不同的变换成分」这一设计假设,而不是彼此冗余的副本。 Expert routing visualization. Left: layer-wise expert-routing heat map. Right: results obtained by hard-routing all tokens through experts~0--3. 批判点评:74 条规则、5,240 对图像撑起「近 75K 个上下文」,说明上下文是由有限图像对组合放大出来的,这个数字的实际信息量远小于字面,读者不该把它当成 7.5 万个独立样本看。更关键的缺口是:物理接地变换的真值怎么来的——渲染引擎合成、真实拍摄,还是另一个生成模型产出?摘要完全没交代,而这直接决定这个 benchmark 是否真的「物理正确」,如果真值本身来自生成模型,整套评测就退化成模仿另一个模型的偏好。效果全部以定性优势描述(improves adherence / consistency / generalization),没有一个绝对数字,也没有与具体基线的逐项对比表,这在有自建 benchmark 的情况下尤其说不过去。专家路由图分辨率偏低,红框标注的差异需要放大才能辨认,作为核心机制证据偏弱。方法只在 BAGEL 一个统一模型上实现,对底座能力的依赖程度未知。「未见规则泛化」的划分粒度(留出整条规则,还是同族规则的变体)会极大影响难度,摘要没有说明。 9. Game2World:先擦掉HUD再拿游戏视频训世界模型 Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training | Game2World 团队(通讯作者 Dongping Chen,论文未标注机构归属) | arXiv:2608.24680 关键词:世界模型数据,游戏录屏,HUD移除,数据引擎,视频编辑,AAAI2027 前序问题:电子游戏是视频世界模型训练数据的规模化来源——环境多样、交互复杂、野外录屏在互联网上近乎无限。但原始录屏有个结构性缺陷:它把游戏世界和屏幕空间界面纠缠在一起。血条、小地图、任务提示、按键提示、伤害数字这些 HUD 元素会引入游戏特定的偏置和与世界无关的动态,世界模型会把「UI 的变化」当成「世界的变化」学进去,最终产出的既不是干净的画面也不是可信的动力学。 本文贡献:提出 GameUI-Taxonomy 与 G2WEngine,把「游戏 UI 定位与移除」形式化成一套全栈框架。HUD 资产抽取一路是:质量过滤(303 款游戏共 65.72 小时)→ 关键帧采样(采出 1,010 个不同帧)→ 标签起草 → 人工精修(平均每帧 3.69 个 HUD 部件)→ UI 抽取(把裁剪块转成透明资产)。HUD 覆盖层合成一路是:多样性过滤(去掉近似帧)→ 基于语义的构图布局与资产选择 → 时序动画(区分静态与弹出式资产的轨迹)→ alpha 合成与 bbox 追踪,确保合成出来的 UI 在时间上是连贯的。据此构建 Game2World:96K 合成配对视频(带精确重建目标)+ 来自 303 款游戏的 1,079 段野外片段用于真实评测;资产库含 21 个分类下 5,132 个已验证 UI 元素。最后提出 GameCleaner——一个免 mask 的游戏 UI 移除模型,把多模态语义理解与视频编辑能力结合起来,不依赖预先给定的 mask 就能识别并移除多样 HUD,同时保住底层场景内容与时序动态。 Overview of G2WEngine, a scalable data engine that transforms in-the-wild gameplay videos into world-model-ready data through HUD asset extraction, temporally coherent UI synthesis, and downstream support for HUD understanding, removal, and clean gameplay generation. 实验效果:受控 pilot 实验中,用去 UI 录屏训练的世界模型整体 VideoReward 比用带 UI 数据训练的高 6.83%——这是整篇工作的因果论断落点。UI 移除评测上,GameCleaner 在合成视频上平均 AAR 达 95.36,超过最强的时序 mask 基线 57.3%;野外片段上取得最佳 AAR 80.05,背景保持度 99.8。消融给出两条实用曲线:数据规模方面,野外评测下带参考图的表现从 0.2 规模的约 62 分升到全量的约 79.5 分,且曲线尚未收敛,说明继续加数据仍有空间;参考图 drop ratio 方面,野外表现在 20% 附近最好(约 79.8),过高(50%、80%)反而掉到 56、55 附近,而合成集上的表现则对 drop ratio 几乎不敏感(一直在 93~96)——这个合成/野外的分歧本身就是提示。 Ablation study of data scaling and reference drop ratio during training. We find out that larger and more diverse dataset show generalizable result on in-the-wild evaluation and have not converge yet. 批判点评:6.83% 的 VideoReward 提升来自「受控 pilot」,而模型规模、训练配置、评测 prompt 数量摘要一概没交代。这是全文最关键的因果论断,证据却最薄:去掉 HUD 有益在直觉上显然成立,但提升幅度是否稳定、在多大模型上还成立,目前没有答案。「超过最强时序 mask 基线 57.3%」是相对提升,考虑到基线在合成集上的绝对 AAR 只有 60 出头,相对数字把绝对差距放大了不少。野外 AAR 80.05 与合成 95.36 之间那 15 分的落差是重要信号:它说明合成 UI 与真实 UI 之间仍有明显分布差,而合成数据恰恰是训练主力,这个 gap 才是方法的真实上限所在。1,079 段野外片段作为评测集偏小,303 款游戏的品类分布也未公开,UI 风格的长尾覆盖存疑。1,010 帧的人工精修量对应 5,132 个元素尚算合理,但 21 个分类的边界是否清晰、多标注者一致性如何,都没有报告。最后,arXiv comments 里作者直接留邮箱寻求科研合作与资金支持,正文中也缺失机构归属——这是一支早期自筹阶段的团队,工程可复现性需要谨慎预期。 10. LAION-BVD:1000万小时开源视频数据集 LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training | 图宾根大学与图宾根 AI 中心、LAION、于利希超算中心(JSC, FZJ)、Wynd Labs、马普智能系统研究所与 ELLIS Institute Tübingen、慕尼黑工业大学 MCML | arXiv:2608.24845 关键词:开源视频数据集,多模态预训练,CommonCrawl,音频文本,ViCLIP,LAION 前序问题:多模态预训练的视频侧长期缺开放的大规模数据。现有开源视频数据集规模有限(InternVid-10M 量级),真正的大数据集掌握在少数机构手里且不公开,社区因此无法在视频与音频模态上独立验证 scaling 结论——图文模态上 LAION-5B、DataComp-1B 已经把这条路打通了,视频侧却一直缺一个对应的公共基础设施。 本文贡献:LAION-BVD 从 CommonCrawl 中筛出 13 亿条平台特定视频 URL(BVD-URLs),用分布式基础设施实际下载了 8,000 万个视频、总时长 1,000 万小时(BVD-RAW),面向视频、音频、图像三种模态的预训练设计。数据管线用内容感知的场景检测切出片段,并为片段合成生成视频 caption 与音频 caption。派生子集包括:从 240 万视频按 10 秒到 30 分钟过滤并切片得到的 BVD-V-55M(5,500 万片段),再采样出 BVD-V-10M 与 BVD-V-50M;按 2 到 30 秒过滤得到的 BVD-A-1.7M 与 BVD-A-10M 音频片段;以及采样并筛选场景切换帧得到的 BVD-I-300M(3 亿张图像)。最后一条是个有意思的角度——把视频帧当作图文数据的替代来源,因为场景切换帧的视觉分布与常规网页图库明显不同。全量数据集已向研究社区发布。 LAION-BVD data curation pipeline. We source data from CommonCrawl and filter for platform-specific video URLs, resulting in 1.3B high-quality video candidates. Out of these, we successfully downloaded 10M video hours using a distributed infrastructure from which we create the BVD-* subsets. 实验效果:在这些数据上训练的模型在标准 video-text 与 audio-text benchmark 上具备竞争力,且随训练量或模型规模增长持续改善。ViCLIP 上,BVD-V-10M 与 BVD-V-50M 的平均检索约为 56.3 与 56.9、平均分类约为 68.2 与 68.4,两项都高于 DataComp-1B(约 45.0 与 62.6)与 InternVid-10M(约 52.8 与 67.6)。CLAP 音频文本上,BVD-A-10M 的曲线整体位于 Laion-Audio 之上,且随模型规模增长的斜率更陡,从约 42.9 升到约 46.8,而 Laion-Audio 同区间为 42.1 到 44.8。用场景切换帧训练的模型取得了强图文检索表现——这印证了「视频帧可作为图文数据替代源」的判断;但同一组实验也诚实报告了反面:LAION-BVD 的 ImageNet 零样本分类仍弱于网页 alt-text 基线。 LAION-BVD is an open web video dataset at unprecedented scale. It facilitates strong downstream performance for multimodal pretraining. Left: dataset scale in comparison with existing video datasets. Right: average downstream performance of ViCLIP (video-text, tab:exp_results_wise_ft) and scaling-trends of CLAP (audio-text, tab:exp_results_clap_pure) on standard benchmarks. These results demonstrate that LAION-BVD serves as valuable training data across both video and audio modalities. 批判点评:caption 是「synthetically generate」的,也就是模型产出的伪标签。这决定了数据集的语义上限,也会把 captioner 的偏置固化进所有下游模型,而摘要没说用的是哪个 captioner、也没做 caption 质量的人工抽检——对一个定位为公共基础设施的数据集来说,这是最该交代清楚的一项。1,000 万小时是「下载到的原始时长」,真正进入训练的是切片后的子集(如 BVD-V-50M),两个量级不能混着读,标题里的数字带有一定的宣传性质。ImageNet 零样本弱于 alt-text 基线是个诚实且重要的负面结果:它说明视频帧的分布优势偏检索、不利分类,但作者点出后没给成因分析,读者拿不到「什么时候该用这份数据」的判断依据。开源发布的到底是 URL 列表还是视频本体,极大影响长期可用性——CommonCrawl 系数据集普遍存在链接腐烂,几年后的实际复现率会显著下降。版权授权状态与内容安全过滤强度未在摘要交代,这类超大规模网络采集数据集的合规风险不容忽视。评测骨干只有 ViCLIP 与 CLAP 这类相对轻量的判别式模型,这份数据能否直接用于生成式视频预训练(也就是社区最想要的用法)完全没有验证。 趋势观察 扩散后训练同一天冒出两条「去似然化」路线,方向出奇一致 — 今天最值得放在一起读的是 DiffusionOPSD(字节 Seed)和 RVM(NVIDIA + Georgia Tech)。两篇互不引用、机构毫无交集,却在同一个判断上撞车:把大语言模型那套策略梯度机制搬到扩散模型上,是一条走歪了的路。原因很朴素——自回归模型有可解析的样本似然,扩散模型没有。为了凑出一个「似然」,现有方法要么从随机去噪转移拼轨迹似然,要么用 ELBO 近似端点似然,代价是额外计算与算法复杂度,而换来的信号依然只挂在端点上。两篇的解法各走一边:DiffusionOPSD 往「中间监督」走,用 reward 梯度在冻结 behavior policy 提供的 anchor 周围直接构造出有界的正负目标,让每一步的 clean-output 预测都有明确的去处;RVM 往「原生表示」走,干脆不要轨迹、不要似然,直接在速度场上做 reward 加权回归,并顺手把 RAM 与 DiffusionNFT 收成特例。省下来的算力是实打实的:DiffusionOPSD 相比 DiffusionNFT 减 40%~63% GPU-hours,RVM 在 Wan2.1-1.3B 上 525 GPU-h 就跑完,DanceGRPO/TaRoS 要 6,171。更值得留意的是 DiffusionOPSD 那个负面发现——目标构造增益更大,不代表一次拟合后的实现增益更大,HPSv2.1 的目标序在 62.3% 的 prompt 上会反转。这提示扩散 RL 的下一个瓶颈可能不在「怎么定目标」,而在「一步优化能吃进去多少」。 少步蒸馏已经不单独交付了,它和推理工程栈捆成了一个整体 — TurboT2VA 的数字拆解值得逐段看:LTX-2 19B 音视频联合模型,1024×1792、121 帧、单卡 NVIDIA H20 上,40 步教师 318.74 秒。先上 guarded W8A8 加算子融合,拿到 1.37×,降到 233.34 秒;再换成 4 步蒸馏学生,19.18×,降到 12.16 秒;最后叠一层模态感知稀疏注意力(SageSLA,ρ=0.3),再 2.08×,落到 5.83 秒。整体 54.67×。这条链条说明了一件事:单看蒸馏是 19.18×,单看工程栈是 1.37×2.08≈2.85×,但它们乘起来才是那个吓人的数字,任何一环单独宣传都会失真。另一个细节是稀疏化的边界——作者明确保留了跨模态与文本条件的 dense 路径,只对模态内注意力做稀疏。这不是保守,而是承认音画同步这件事经不起近似。反过来看 RVM 那篇也印证了同一件事:它测了从 16 步网格子采样到 5 步、4 步的鲁棒性,说明「少步」已经从加速技巧变成了模型必须自带的属性,而不是发布后再补的一层优化。 视觉 tokenizer 的竞争焦点,从「压得多」挪到了「压得让下游好学」 — AffineTok(复旦 + 阿里 Token Hub)和 KATok(Kakao)走的是同一个方向的两条腿。AffineTok 问的是语义该怎么组织:现有做法训一个 projector 从含噪 latent 直接预测语义,作者指出这预测的是「干净图语义的平均」,而扩散真正需要对齐的是「平均后干净 latent 的语义」——这两个东西不是一回事。他们把语义恢复误差做正交分解,识别出被忽略的一致性要求(Semantic Affine Consistency),并给出 tokenizer 侧代理指标 M_SAC,报告它与 SiT-XL 的 gFID 有 0.960 的 Pearson 相关。KATok 问的是比特该怎么分配:常规 VAE 用固定压缩率,静止镜头和剧烈运动被压成同样多的 token,前者浪费后者不够;它用 Gumbel-Softmax 给每个 token 学一个 keep-or-drop 概率,压缩率从 256²×16 帧的 133 一路涨到 512²×32 帧的 252,而 ElasticTok 固定在 102、OmniTokenizer 固定 96。一个管「语义排布」,一个管「码率分配」,共同点是都不再把 tokenizer 当成一个可以离线调好然后冻住的前置模块,而是当成对下游生成质量负直接责任的一环。AffineTok 的 GSCT 与 PMSA 都只在训练期存在、推理时丢弃,这个设计取向也很能说明问题——愿意为下游多付训练成本,但不肯多付一分部署开销。 世界模型的瓶颈正在从「模型」挪到「数据能不能直接用」 — Game2World 和 LAION-BVD 是今天的数据侧双响。前者盯的是一个很具体的脏活:游戏录屏是世界模型训练数据的规模化来源,但血条、小地图、任务提示这些 HUD 元素把游戏世界和屏幕空间界面纠缠在一起,模型会把 UI 的动态当成世界的动态学进去。G2WEngine 把这件事形式化成全栈流程——从 303 款游戏、65.72 小时录屏里抽出 5,132 个已验证 UI 元素(21 个分类),再把时序一致的 UI 覆盖层合成回干净录屏,造出 96K 配对视频用于训练、1,079 段野外片段用于评测,最后训一个免 mask 的 GameCleaner 擦干净。受控实验里,用去 UI 数据训练的世界模型整体 VideoReward 高 6.83%。后者走的是另一个极端:LAION-BVD 从 CommonCrawl 捞了 13 亿条视频 URL,下载 8,000 万个视频共 1,000 万小时,切片后派生出 BVD-V-55M、BVD-I-300M、BVD-A-10M 等一系列子集,ViCLIP 上 BVD-V-50M 的平均检索约 56.9、平均分类约 68.4,都高过 DataComp-1B 与 InternVid-10M。两篇合起来的信号是:视频生成这条线上,「有没有数据」的问题正在被「数据里有多少是能直接喂的」取代。也要留一句冷水——LAION-BVD 的 caption 是模型合成的伪标签,它的天花板就是那个 captioner 的天花板;而它诚实地报告了 ImageNet 零样本分类仍弱于网页 alt-text 基线,说明视频帧的分布优势偏检索、不利分类。 人工智能炼丹君 整理 | 2026-08-27 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月27日
10 阅读
0 评论
0 点赞
2026-08-26
AIGC 每日速读|2026-08-26|京东开源世界模型边走边生720p视听EchoWM
今日 AIGC 论文速览 今日共 10 篇 · 交互式世界模型 1 篇 · 视频生成与编辑统一 2 篇 · 3D 渲染修复与新视角合成 2 篇 · 生成理解一体化 1 篇 · 图像编辑与强化学习 1 篇 · 数字人压缩 1 篇 · 生成评测与审计 2 篇 重点论文标题列表 EchoWM(京东 Joy Future Academy、港科大、北大、清华、港大、中科大、复旦、北航、斯坦福大学):导航即生成的720p视听世界模型 EditStream(Adobe Research、罗切斯特大学):六任务一模型的少步流式视频编辑 FixAnything(卡内基梅隆大学 (CMU)):一个视频先验修四种3D表示 Loopy(天津大学、香港理工大学、腾讯):锚定层位置编码把时间轴掰成圆 Object-Uni(中科院自动化所、国科大、清华大学、蚂蚁集团):物体位姿当显式变量贯通理解生成 今日论文速览 1. EchoWM:导航即生成的720p视听世界模型 EchoWM: Open and Enterable Omnimodal World Models | 京东 Joy Future Academy、港科大、北大、清华、港大、中科大、复旦、北航、斯坦福大学 | arXiv:2608.23189 关键词:世界模型,全模态生成,相机意图,6-DoF轨迹控制,音视频同步,自回归后训练,京东 前序问题:现有的世界模型基本都停在「视频生成器 + 一个控制信号」的形态上,有三处结构性缺口。第一是模态不全:绝大多数只出画面,声音要么完全没有,要么靠后期单独配一条音轨,长时程下环境声、音乐、语音与画面的同步无从保证。第二是控制接口碎片化:第一人称场景(相机就是观察者)和第三人称场景(相机与角色各动一套)通常需要各训一个视角专用控制器,两套接口在数据、训练和推理上都无法复用,用户切换视角等于换一个模型。第三是运动幅度不可比:不同来源的数据(游戏录屏、第一人称采集、影视素材)标注的相机运动尺度天差地别,直接混训会让模型学到一个平均化、无物理尺度的运动先验,用户按同样的键在不同场景里位移距离完全不一致。这些问题合起来的后果是:模型能生成好看的片段,但不能被「进入」和持续操作。 本文贡献:EchoWM 把交互统一组织在「相机意图」这一个抽象上——第一人称下相机意图就是观察者运动,第三人称下相机与角色的动力学耦合直接从数据里学出来,不再为每种视角单独设计控制器,两类交互共享同一个接口。离散按键命令和连续位姿都被映射到同一个带公制尺度的相对 6-DoF 轨迹表示上,再做数据集级校准,使异构数据源之间的运动幅度保持一致,这是让「按同样的键走同样远」成立的前提。生成侧是联合音视频骨干:视频流与音频流各有自注意力,轨迹只在交叉注意力之前注入视频流(音频流不做轨迹注入),再经 AV 交叉注意力耦合,从而在一个前向里同时产出 720p 视频与环境声/音乐/语音。轨迹注入用的是相对 UCPE 分支(QKV 投影 + ray-local UCPE + 零初始化输出投影),零初始化保证接入时不破坏预训练骨干。训练分四阶段渐进:AV 持续预训练 → 冻结骨干只训动作 → 联合微调 → 自回归后训练(teacher forcing + SGF + 因果续写),最后一阶段是长时程能力的来源;多轮推理时用尾窗条件化下一轮,实现可持续导航。代码与模型已在 jd-opensource/JoyAI-Echo 开源。 Overview of EchoWM. Media context, structured text, and user controls share a unified camera-intent interface. Discrete controls or metric poses are converted into globally calibrated relative 6-DoF trajectories and serialized as an event stream. A relative UCPE branch injects this trajectory into video self-attention before audio--visual cross-attention, while the audio stream receives no direct trajectory condition. Four progressive training stages yield synchronized audio--visual generation and support multi-turn inference through synchronized tail-window conditioning. 实验效果:在公开世界模型基准上,EchoWM 同时取得了强轨迹跟随与高视觉质量,第一人称与第三人称交互都支持,且长时程生成中环境声与语音保持同步。固定全局平移尺度带来的收益在与 LingBot-World-v2 的成对对比里最直观:两者接收完全相同的参考观测与导航条件,当相机朝前景角色或场景结构推近时,LingBot-World-v2 的主体表观尺度变化过大、位移响应难以预测——补光灯场景直接从人像冲到相机机身特写,游戏门框场景推近到结构解体,烛光工坊场景越过工作台变成齿轮特写,越野场景则冲过摩托只剩落日空景;EchoWM 在同样的轨迹上呈现的是渐进、可预期的尺度变化,主体始终留在画面里。这条定性证据与论文的公制尺度、速度响应消融互为补充:固定全局平移尺度让不同片段之间「请求的位移幅度」可比,推近行为因此变得可控。推理侧的赛车导航序列也显示,同一条弯道在连续推进中赛道几何、栅栏与草地纹理保持稳定。 Qualitative scale-control comparison. LingBot-World-v2 and EchoWM receive matched reference observations and navigation conditions. When the camera approaches a foreground character or scene structure, LingBot-World-v2 exhibits larger changes in apparent subject scale and less predictable displacement response, whereas EchoWM preserves a more gradual scale change across the trajectory. This qualitative comparison complements the metric-scale and speed-response ablations: a fixed global translation scale keeps requested displacement amplitudes comparable across clips and makes approach behavior more controllable. 批判点评:最需要打折扣的是「open」这个词的适用范围——论文声称开源,但摘要与图表里没有交代模型参数量、训练数据总时长,也没给出可复现的训练配方细节,公开的更可能是推理权重而非完整训练链路。轨迹跟随的量化结果只以「strong」概括,缺少与 Genie 类闭源系统的直接数字对比,而后者恰恰是读者最想知道的参照。音频侧的评估同样偏薄:说「保持同步」,但没有报告音画同步的客观指标(如 AV-Sync offset 分布),环境声/音乐/语音三类音频各自的质量也没有拆开评。第三人称下「相机-角色耦合从数据里学」是个漂亮的设计,但代价是可控性变弱——用户无法像显式相机装配那样精确指定构图,论文没有讨论这个权衡。此外 LingBot-World-v2 是唯一的定性基线,且这组对比只针对尺度/位移响应这一个维度,画面里基线失控得相当彻底(推近直接越过主体),让人怀疑两者是否在同等推理预算下运行,论文没有给出步数与分辨率的对齐说明;真正需要的长时程身份一致性、音画同步等维度都没有配对应的定性证据。最后,作者列表横跨 8 家单位、共同一作 5 人,这类大团队技术报告的工程细节往往难以被外部独立复现。 2. EditStream:六任务一模型的少步流式视频编辑 EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing | Adobe Research、罗切斯特大学 | arXiv:2608.21424 关键词:统一视频编辑,自回归少步生成,速度矩匹配VMM,自回归unrolling,KV-cache,交互式创作,Adobe 前序问题:交互式视频创作在工程上一直被两层割裂卡住。第一层是任务割裂:文生视频、图生视频、视频转视频、编辑传播、参考图引导编辑、相机位姿变更这六件事,各家通常各训一个模型或各挂一套适配器,创作工具里要串起来意味着维护六套权重与六套推理路径。第二层是速度割裂:高质量的扩散视频模型要几十步采样,根本进不了交互式工作流;而把它蒸馏成少步自回归模型时,已知的 Self-Forcing 类做法会带来一串顽疾——过饱和、运动退化(画面几乎静止)、时序不稳定,以及训练流程本身很复杂。运动退化尤其致命:交互式编辑的用户改的往往就是运动,如果蒸馏后的模型只会输出近似静止的画面,统一带来的便利就毫无意义了。 本文贡献:EditStream 的第一步是把六种任务折进单个 DiT:通过通道拼接把 mask token、条件视频 VAE token 与输出视频 VAE token 拼在一起,用一个 Conv3D 把新增通道并进原有通道(C_new = C_old + C_cond),不同任务只是这套拼接模式的不同配置——文生视频只留输出分支,编辑传播额外接条件视频,参考图引导编辑再拼一路参考帧,显式相机控制则加入学习到的降采样 mask。第二步是两阶段蒸馏,核心是 Velocity Moment Matching:与 Self-Forcing 在教师轨迹上做整段视频级 DMD 匹配不同,VMM 在「学生自己走到的中间状态」上采样一次局部转移,用教师速度与辅助网络速度的残差(v_T − v_A)作为监督信号,逐块(block-wise)沿因果 KV-cache 展开;首块单独做 VMM 更新,后续块通过 unrolling loss mask 只在展开步上更新。这样做的直觉是:学生的误差分布只有在学生自己的状态上才能被正确纠正,而在教师轨迹上匹配等于永远在纠正一个不会遇到的分布。 Overview of VMM-forcing unrolling. During training, we fully unroll streaming inference: the causal student generates each temporal block from noise with the target few-step schedule, commits the denoised block to the KV cache as history, and proceeds to the next block. At a sampled local transition for each selected block/rollout, we query the bidirectional teacher and auxiliary model at the student-induced states, and supervise the student by matching the teacher--auxiliary residual velocity moments under the same autoregressive context. The student-generated first-block condition is also fed into the teacher and auxiliary model. 实验效果:从文生视频对比图可以直接读出蒸馏质量的差距。Self-forcing 版本在四组场景里几乎全部退化成静止:三只金毛四帧内姿态几乎不变、狼群原地踏步、龙灯只有轻微摆动、沙漠中两人搬椅子的动作停在同一姿态。VMM-forcing 版本则有真实的位移与形变——金毛从雪堆里跑出并跨出画面、狼群沿小径实际前进、龙灯完成翻卷、沙漠场景里沙子被扬起并落下。首帧编辑 + HOI(手物交互)消融显示,不加 HOI 训练时锅盖编辑在后续帧丢失、遮阳帽戴不到头上;加了之后锅盖被手放到锅上、帽子正确落到头顶并随手部动作保持贴合。论文将这些归因于 VMM 与 unrolling 共同缓解了过饱和、运动退化与时序不稳定三类问题。 Qualitative Text-to-Video (T2V) results on frequent user prompts. We compare the Self-forcing conversion and the proposed VMM-forcing pipeline. VMM-forcing produces richer motion dynamics and scene evolution while maintaining texture realism and temporal coherence, whereas Self-forcing often yields over-sharpened, plastic-like appearances and reduced temporal diversity. 批判点评:这是一篇 report 而非常规论文,量化结果的呈现相当克制——摘要里没有给出任何具体的 FVD/VBench 数字,也没有报告蒸馏后的步数与实测帧率,而「fast, few-step」和「efficient streaming」正是它的核心卖点,缺少数字就很难判断它离真正的交互式实时还有多远。六项任务统一后,每项任务相对各自的专用 SOTA 是否有质量损失也未见系统对比,统一的代价没有被量化。VMM 引入了一个辅助网络 A,训练成本相对 Self-Forcing 增加多少、辅助网络如何初始化与更新,摘要层面没有交代。定性图上还有一个诚实的观察:VMM-forcing 的金毛在第三、四帧出现了明显的运动模糊与主体截断,说明追求运动幅度的同时清晰度是有让步的,论文没有讨论这个权衡。最后,Adobe 内部数据与训练栈的依赖较重(数据一节单列),外部复现难度不小。 3. FixAnything:一个视频先验修四种3D表示 FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors | 卡内基梅隆大学 (CMU) | arXiv:2608.23549 关键词:渲染伪影修复,视频生成先验,3DGS,NeRF,几何感知DPO,视频到视频翻译,ECCV 2026 前序问题:3DGS、NeRF、网格甚至点云在输入视角稀疏、或目标视角离输入较远时都会渲染出伪影,这是三维重建落地的通用痛点。已有工作确实在用扩散生成先验来修,但几乎都是「一种表示一套方案」:给 3DGS 修伪影的模型改用到 NeRF 上要重设计架构,点云的稀疏空洞和网格的几何错误又是另外两类退化模式。结果是工程上要维护多条专用修复管线,每条都要单独设计架构并大规模重训。更深一层的问题是,多数修复方法逐帧独立处理,修出来的结果虽然单帧好看,但跨帧不一致,无法反过来喂给下游重建——这就失去了「修复」最重要的用途。 本文贡献:FixAnything 的关键洞察很朴素:即使是噪声很大的渲染序列,也仍然保留了相机运动与粗略场景结构,因此清理伪影可以被直接表述成「视频到视频翻译」,从而复用预训练视频生成模型隐含的多视角先验,只需极少改动与轻量微调。落地是两阶段。Stage I 监督微调:输入退化视频经冻结的 VAE 编码器得到条件 latent,与噪声、以及一张标记「哪些像素是干净的」的二值 mask 一起送入冻结的 DiT,只训练 LoRA,再由冻结 VAE 解码器出目标视频。这张 binary mask 是可控性的来源——它让模型把输出锚定在高质量输入(例如训练视角)上,只精修其余部分,而不是把整段视频重画一遍。Stage II 几何感知偏好优化:用同一条输入视频跑多个随机种子的 rollout,把每次输出送进 structure-from-motion 恢复相机位姿,与 GT 位姿比较,位姿误差大的判为负样本、误差小的判为正样本,用 DPO 更新 LoRA。换言之,它把「几何一致性」这个原本难以微分的目标转成了可直接优化的偏好信号,而不是再加一堆手工正则。 实验效果:跨四种不同的 3D 表示,FixAnything 都用轻量微调稳定提升了渲染质量,证明单个通用视频先验可以替代多条专用精修管线。最直观的是点云与稀疏输入的修复结果:游乐场攀爬架序列中,输入的中间三帧几乎只剩黑底上的散点(点云稀疏到看不出结构),输出恢复出完整的金属管架、地面绿漆与远景树木,与 GT 高度接近;亭子序列里输入帧被大面积黑洞和撕裂纹理占据,输出补出了完整的木构屋檐、栏杆、石阶与背景树林,逆光帧的光晕也被合理重建。mask 感知条件的消融显示,不加 mask 时干净的训练视角也会被模型重画而丢失细节。框架的简洁性还带来一个附加好处:将来出现更强的视频模型可以直接换上,不需要重新设计架构。 FixAnything generalizes across input representations. The same model cleans up sparse COLMAP point clouds (top) and meshes (bottom), producing photorealistic output despite minimal visual input except for the clean first and last views. 批判点评:摘要通篇用「consistently improves」描述结果,没有给出任何 PSNR/LPIPS 的具体数字,也没说明四种表示各自提升了多少,这在一篇已被 ECCV 2026 接收的论文里显得异常保守,读者无法判断增益是显著还是边际。用 SfM 恢复的位姿精度当 DPO 奖励是个聪明设计,但 SfM 本身在纹理稀疏或强逆光场景就会失败,此时奖励信号的可靠性存疑,论文没有讨论这个失效模式。定性结果里输出与 GT 存在明显的「生成味」——亭子序列中输出的树木纹理和光晕分布与 GT 并不一致,说明模型在补全时引入了幻觉内容;对于测绘、数字孪生这类要求忠实度的场景,这种「好看但不忠实」的修复是风险而非收益,而位姿一致性奖励只约束几何、约束不到外观真实性。此外全部实验用的都是同一个预训练视频骨干,「通用性」的结论究竟来自方法还是来自这个特定骨干的能力,缺少交叉验证。 4. Loopy:锚定层位置编码把时间轴掰成圆 Loopy: Seamless Video Loop Generation via Anchored Looping Shift of Positional Embedding | 天津大学、香港理工大学、腾讯 | arXiv:2608.23090 关键词:循环视频生成,RoPE位置编码,分层时序控制,锚定层,免训练,RGBA视频,ACM TOG 前序问题:循环视频在网页动效、游戏素材和社交媒体里需求很实在,但现有做法质量普遍不行,根因在于大家都绕过了一个基础问题:视频生成模型究竟如何感知时间顺序,这种感知又如何决定首尾能否接得上。常见的两条路各有硬伤——直接在提示词里写「scene looping seamlessly」,模型基本不理解,生成出来的首尾差异巨大(鲨鱼从侧身游到正面怼镜头,根本接不上);用首尾帧到视频(FLF2V)把首帧复制给尾帧作为参考,虽然强制首尾一致了,但模型为了同时满足两端约束会把中间的运动压得几乎静止,得到的是「能循环但不动」的伪循环。两条路都没有触及 DiT 内部时序表示这一层。 本文贡献:论文首次揭示:DiT 内不同注意力层的位置编码对时序顺序的控制强度差异很大,其中最强的那一层可以视为「锚点」。他们把这个锚定层设为循环视频的参考点,为其余层提供强上下文先验。基于此提出锚定位置编码偏移策略——按每层实际的时序控制效应给出层特定的偏移长度,把 DiT 对时间的感知从「一条直线」变成「一个圆」。实现上极简:在每个 DiT block 的自注意力里,Q/K 除了原始 RoPE R_{t,h,w},再并行算一份偏移后的 RoPE,偏移量为 (t − δ_l) mod T',其中 δ_l 是第 l 层的时间偏移,两者按层组合后再进 attention 与交叉注意力+FFN。整个过程不改权重、不需重训,是纯推理期干预,因此可以直接挂在 Wan2.1/2.2、HunyuanVideo 1.5 等现成基座上,并同时支持 RGB 与 RGBA 视频,还能叠加身份控制与风格迁移这类 AIGC 能力。 Comparison of Wan2.2 14B and HunyuanVideo 1.5 outputs when shifting RoPE at the layers with the first- and second-largest $\alpha_l$, relative to the original generated videos. 实验效果:逐层分析图给出了机制的直接证据:Wan2.2 14B 的 α_l 曲线在第 0 层达到峰值约 0.31、第 1 层约 0.22,之后迅速衰减到 0.05~0.15 区间;HunyuanVideo 1.5 的峰值落在第 2 层(约 0.31)与第 6 层(约 0.21)。在 α_l 最高的层做偏移会破坏内容(墨滴场景出现整帧粉紫色偏色与结构错乱),在次高层偏移则能保持内容正确并实现循环,这正是「按层给不同偏移量」这一设计的来源。定性对比中,T2V 基线生成的鲨鱼首尾姿态完全不同、无法循环;FLF2V 虽首尾一致但四帧几乎静止;Loopy 既保持首尾可接,中间又有真实的尾部摆动与身体位移。论文报告循环视频的时序一致性与视觉保真度都有显著提升,用户研究在运动连贯性等维度上给出更高评分,模型已在项目主页发布。 Comparison with Wan2.2 in text-to-video (T2V) and first-last-frame-to-video (FLF2V) modes. FLF2V and our method use the same prompt. Although the prompt explicitly requests a looping scene, T2V fails to produce a seamless loop, while FLF2V degenerates to a nearly static video. Neither mode generates a looping video with vivid motion. 批判点评:最实际的限制是这套策略与基座强绑定:α_l 的峰值层因模型而异(Wan2.2 在第 0/1 层、HunyuanVideo 1.5 在第 2/6 层),换一个基座就要重新做逐层扫描来定位锚点和标定每层偏移量 δ_l,论文没有给出自动化的标定流程,这在工程上是一笔隐性成本。δ_l 的具体取法只描述为「按每层时序控制效应」,缺少可复用的公式或搜索预算说明。效果侧全部以「significantly improves」和用户研究箱线图呈现,没有报告循环质量的客观指标(例如首尾帧感知距离),而这恰恰是最容易量化的一项。另外从 α_l 曲线看,中后层存在若干局部尖峰(Wan2.2 在 20~30 层、HunyuanVideo 在 30~40 层附近),论文只利用了全局最强的一两层,这些次级峰是否也参与时序控制、忽略它们是否留下了改进空间,没有讨论。最后,能循环的内容类型边界不清——鲨鱼游动、墨滴扩散这类准周期运动天然适合循环,而有明确起止语义的动作(如开门、倒水)能否成立,未见说明。 5. Object-Uni:物体位姿当显式变量贯通理解生成 Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation | 中科院自动化所、国科大、清华大学、蚂蚁集团 | arXiv:2608.22757 关键词:统一多模态模型,物体位姿,视角化朝向抽象,可控生成,新视角合成,UniSpatial-80K,蚂蚁集团 前序问题:统一理解与生成的模型这两年进展很快,但有一项能力始终缺位:理解并操纵物体实例的空间状态。现有模型能用自然语言把物体描述得很好(「一把红色的椅子在桌子旁边」),却做不到两件事——精确表示连续的物体位姿,以及在指定目标视角下生成几何一致的图像。根子上的原因是位姿在现有工作里的地位错了:要么被当成一个待预测的标签(理解侧的输出),要么被当成一个外部控制信号(生成侧的输入),两侧各用一套表示、互不相通。而多模态大语言模型天然处理离散 token,连续的旋转矩阵/四元数很难直接塞进语言空间并保持可推理性,这是把位姿变成「理解与生成共享变量」的主要技术障碍。 本文贡献:Object-Uni 把物体级空间智能重新表述成一个统一问题,把位姿感知、空间推理、位姿条件生成、物体级新视角合成四件事连起来,并把物体位姿当作理解与生成共享的显式几何变量。为了让 MLLM 能真正用上位姿,他们提出视角化朝向抽象:把朝向映射为结构化的视角描述(便于语言模型推理),同时保留连续的几何监督(不丢精度)。架构上,理解分支里输入图像经视觉编码器、文本经 tokenizer、物体裁剪图额外经 DINO 编码器进入冻结的 MLLM,MoE 中激活一组可训练 expert,输出侧除常规 NTP loss 外加一路 orient head 承担 orientation loss;生成分支复用同一 MLLM(此处 expert 冻结),用可学习 query 经 connector 送入可训练的 Diffusion Transformer,与图像 latent、目标位姿 latent 一同去噪。此外构建了物体级空间基准 UniSpatial-80K,并用「物体 token 锚定的位姿锚」把每个实例与其位姿状态绑定,避免多物体场景下位姿串位。 Overview of Object-Uni. Our model unifies object-centric spatial understanding and orientation-controllable generation. The dotted modules denote object-centric novel view synthesis. 实验效果:实验显示物体级位姿理解与位姿可控生成都有提升,把统一模型从「描述物体」推进到「操纵空间状态」。定性对比中,单物体位姿控制上 Object-Uni 能在保持参考物体外观身份的同时把收割机、叉车、板车、越野摩托转到目标视角,而对照的 SceneDesigner 虽然也换了视角但常常改掉物体本身(收割机换成另一款红色机型、叉车变成挖掘机、板车上多出一个南瓜)。多物体场景下差距更明显:书本、相机、沙发、鞋子四组里 Object-Uni 保持了实例数量与相对布置(两本书叠放、两台相机并排、鞋子一双朝向一致),SceneDesigner 则出现物体简化、颜色改变与朝向不一致。 Evaluation of pose-controllable generation in single- and multi-object scenarios. The reference image in the first row serves as the source for the input text and 9D pose annotations. Object-Uni shows better text alignment and pose consistency under diverse pose conditions. 批判点评:「视角化朝向抽象」在把连续朝向离散成结构化视角描述时必然有精度损失,论文没有报告这个抽象带来的角度误差上界,而它直接决定了这套表示能支撑多细的位姿控制——如果分辨率只到「高角度视角/侧视」这一级,就谈不上真正的连续位姿操纵。效果全部以「improves」概括,摘要层面没有一个具体数字(角度误差、位姿准确率、生成一致性指标均缺),UniSpatial-80K 上与其他统一模型的横向对比也未见。基准由作者自建、模型也在其上训练与评测,存在自证循环的风险,缺少在第三方物体位姿数据集上的迁移验证。架构上依赖冻结 MLLM + MoE expert + DINO 编码器 + 可训练 DiT 四个部件,训练与推理开销显著高于纯 MLLM 方案,论文未给出代价核算。定性对比只选了 SceneDesigner 一个基线,说服力有限。最后,从生成结果看 Object-Uni 输出的图像在背景与光照上与参考图差异较大(收割机的麦田、摩托的赛道都被重画),说明「保持物体身份」是靠牺牲场景一致性换来的。 6. Next-Scale NVS:下一尺度自回归单次出多视角人脸 Photorealistic Novel View Synthesis of Human Faces using Next-Scale Transformers | 洛桑联邦理工 (EPFL)、Meta | arXiv:2608.23410 关键词:新视角合成,下一尺度自回归,多尺度VQVAE,跨视角一致性,GS-LRM,合成数据训练,Meta 前序问题:人物的照片级新视角合成在高分辨率、多目标相机的设定下仍然很难:既要保住身份,又要保住细微的外观细节(皮肤纹理、发丝、衣物褶皱),还要让多个视角之间几何自洽。主流做法是扩散模型,但它有两处结构性代价。一是必须依赖大规模 2D 预训练才能有可用的先验,这决定了它对数据量的胃口。二是多视角一般靠逐视角独立采样再想办法约束一致性,跨视角自洽是「事后补」而非「内生」,分辨率越高、目标相机越多,不一致就越明显。对于真人数据难以大规模合法采集的人脸场景,「必须靠海量任务数据才能收敛」本身就是一个卡点。 本文贡献:作者不走扩散,而是把下一尺度自回归(next-scale autoregressive)范式适配到以人为中心的视角合成上,使其支持更高分辨率、多视角输出与更强的跨视角一致性,且全部在单次前向里完成。管线是:N 张 512×512 输入图经多尺度 VQVAE 编码器得到逐尺度 token(i_1 为 N×1×32、i_2 为 N×4×32、i_3 为 N×9×32,依次加密),与 CLIP 特征、目标相机外参 (R_1,T_1)…(R_M,T_M) 组成的全局条件一同经 word embedding 进入 Causal Next-Scale Transformer,自回归产出 M 组目标视角的逐尺度 token r_1/r_2/r_3,再由多尺度 VQVAE 解码器一次性解出 M 张 512×512 视角;训练时目标视角走 teacher forcing。这个范式的关键红利是训练数据经济性:不需要 2D 预训练,且低分辨率、通用的预训练可以直接复用,只在最后几个训练阶段才用到全尺寸的任务专用图像,因此用一个更小但更真实的数据集就能收敛。他们在覆盖多样身份与服饰的合成人脸数据集上训练,并把输出接到已有的 GS-LRM 上做像素对齐的 3D 高斯提升,最终得到人脸的 3D 模型。 Our architecture: input images are encoded into multi-scale features by the VQ-VAE encoder and used as inputs for the transformer. They are also embedded into a global conditioning along with the camera-pose RT matrix, used both in the AdaLN layers and the SOS tokens. The transformer outputs one scale at a time for every output view simultaneously, up to the final scale. The output features are decoded by the VQ-VAE decoder to produce the final RGB images, which can be lifted to 3D gaussians by an off-the-shelf GS-LRM model. During training, previous scales are teacher-forced, while during inference the model is auto-regressive. The architecture is the same for all our models, with the only difference being the number of input and output views. 实验效果:模型输出锐利且真实的视角图,并可选择同时合成多个新视角以提升视角间的一致性。论文报告在人物主体上感知保真度与跨视角连贯性均有增益,说明下一尺度自回归可以作为可扩展、多输出的人物视角合成骨干。与 FaceLift 的六视角对照能看出差距落在身份保持上:FaceLift 把发色提亮成偏灰金、发型改成盖头式,侧脸轮廓被压扁、后脑呈现出与真值完全不同的整齐发块,肤色整体偏白;本文方法在六个视角上的脸型、下颌线、肤色与颈部阴影都贴近真值,仅在后脑一列把稀疏的头发画得略密。与 GS-LRM 串联后,从多视角人脸输入可得到准确且照片级的三维人脸模型,完成了「多视角生成 → 3D 高斯提升 → 渲染」的闭环。多尺度 VQVAE 的微调与不同 patch 划分方式的消融(256/512 分辨率、normal 与 diff patchify)表明适配到 512 分辨率时 VQVAE 微调是必要的。 批判点评:最大的问题是训练数据全部为合成人脸,论文自己也强调「a smaller but more realistic training dataset」,但合成到真实的域差距未见量化评估,模型在真实拍摄人脸上的表现是空白,而这才是实际用途所在。量化结果同样只以「we observe gains」表述,没有 PSNR/LPIPS/身份相似度的具体数字,也没和 FaceLift、Splatter-Image 这些明确出现在其定性对比目录里的基线给出表格化比较。分辨率停在 512×512,对影视级人脸资产而言偏低,而下一尺度自回归的 token 数随尺度平方增长,往 1024 走的代价论文没有交代。第一作者的贡献声明为「在 Meta Reality Labs 实习期间完成」,且 LaTeX 源里仍留有多处 TODO FINAL: Replace with your institution list 未清理的模板注释,说明这是一版尚未定稿的投稿,结论宜谨慎引用。此外整套流程依赖外部 GS-LRM 做 3D 提升,端到端的几何误差如何在两个模型之间分摊也没有分析。 7. Lever-Edit:不用编辑奖励也能做编辑在线RL Can We Perform Online RL for Image Editing without Editing Rewards? | 北京大学 | arXiv:2608.22780 关键词:图像编辑,在线强化学习,T2I奖励迁移,反事实目标描述,奖励对齐caption,北京大学 前序问题:用强化学习直接优化图像编辑的人类偏好,前提是有可用的编辑专用奖励模型,而这一块恰恰很薄——训练编辑奖励需要昂贵的三元组监督(原图、指令、编辑结果),还要按任务做复杂的标定。反观文生图(T2I)这一侧,奖励生态已经相当成熟且多样:语义对齐、美学、真实性、字形形状等各类视觉偏好都有现成模型。把这套生态迁移到编辑上,能大幅拓宽 RL 可优化的偏好维度。但迁移有一个本质错配:编辑指令描述的是「相对变化」(把狗变成大理石雕像),而 T2I 奖励要求的是「自包含的目标描述」(一只大理石雕像的狗,立在基座上)。而且通用视觉语言模型给出的 caption 虽然语义正确,却可能与被冻结的奖励模型不兼容——奖励模型对措辞、句式有自己的偏好,语义对但表述不对,打出来的分就是噪声。 本文贡献:作者先论证标准的图像编辑维度是可以映射到 T2I 奖励空间的:图像质量可以直接迁移;提示遵循可以通过「对期望视觉状态的描述」来对齐;参考一致性则可以通过把需保留的源内容编码进描述里做粗粒度语义转换。在此基础上提出 Lever-Edit 两阶段框架。Stage 1 是 T2I query 对齐:训练一个奖励对齐的 captioner,它接收系统提示与编辑指令(各有可学习的 embedding 权重),经 VLM 解码出「反事实目标描述」——即编辑成功后画面应该是什么样的自包含描述;训练时 VLM 冻结、只学 reward-aligned query embedding,用聚合的多个 T2I 奖励作为信号,让 captioner 学会说奖励模型「听得懂」的话。Stage 2 是奖励对齐微调:把 captioner 冻结,只用迁移来的 T2I 奖励优化编辑策略本身(此时编辑骨干解冻、query embedding 冻结)。两阶段的冻结/解冻是交替的,这个设计避免了 captioner 与策略互相追逐导致的奖励崩塌。 Overall two-stage T2I reward transfer pipeline in Lever-Edit. 实验效果:实验显示 Lever-Edit 在编辑对齐度与源内容保持上都能与基于编辑奖励微调的方法竞争,同时明显优于几种直观的迁移基线。定性对比按提示遵循、美学、一致性、自然度四组维度组织,八个编辑任务里可以看到:不做对齐(w/o Alignment)时「把狗变成大理石雕像」只是把狗漂白、「换成极简白背景」直接把人像退化成线稿;Lever Pure Edit 与 Lever Pure VLM 各有偏差(前者美学不足,后者出现主体改变,如冲浪板换成桨板时人物姿态被重画);Lever Offline SOTA 在自然度上仍有塑料感;完整的 Lever-Edit 在四组维度上综合最好——大理石雕像有正确的石材质感与基座、红色跑车放到建筑前方且透视正确、热气球加入天空且尺度合理、白色背景替换保留了人物细节。 Qualitative analysis of different methods. Lever-Edit successfully edits the images with strong prompt following and high aesthetics, while maintaining both semantic and source consistency with naturalness. Zoom in for better visualizations. 批判点评:「competitive against editing-reward-based fine-tuning」这个表述值得留意——它说明本方法并未超越用真正编辑奖励训练的上界,价值在于省掉三元组标注成本,而不是效果更好;如果编辑奖励模型未来变得容易获得,这条路径的必要性会下降。摘要没有给出任何数字(编辑对齐、源保持的具体指标与基线差距均缺),也没说明用了哪几个 T2I 奖励模型及其聚合权重,而这直接决定结果可复现性。方法引入的 captioner 是新的失效点:反事实目标描述如果写错(把「移除」理解成「替换」),策略就会被系统性地引向错误方向,论文未讨论 caption 错误率及其对训练的影响。「参考一致性靠粗粒度语义转换」是全流程最薄弱的一环——T2I 奖励天生不看源图,无法真正惩罚身份改变,从定性图里也能看到 Lever Pure VLM 出现主体被重画的情况;这类结构性缺陷不是靠 captioner 能补齐的。另外两阶段交替冻结的训练配方对超参可能较敏感,稳定性未见报告。 8. SACHA:2.23MB存下动态高斯头像 SACHA: Semantic-Aware Compression for 3D Gaussian Head Avatars | 香港城市大学、阿里巴巴达摩院 | arXiv:2608.23133 关键词:3D高斯头像,语义感知密度控制,外观-运动解耦压缩,率失真优化,头部先验参数,阿里达摩院 前序问题:可驱动的 3D 高斯头像渲染质量高、控制灵活,但高斯基元数量庞大,存储和传输成本都很重,这是它进入视频会议、VR 社交、移动端这些实际场景的主要障碍。现有的高斯头像方法有两处共同盲区。第一,忽视了头部不同语义区域的视觉显著性差异——眼睛、嘴唇这些高频且被注意力集中的区域和后脑、脖颈这类低频区域,如果按同样的密度分配高斯基元,就是把预算浪费在看不出差别的地方。第二,几乎没人做训练完成后的头像序列压缩:一段动态头像在时间维度上高度冗余(外观基本不变、只有表情和姿态在动),但主流做法仍然逐帧存储完整的高斯参数。 本文贡献:SACHA 把两件事合起来做。语义感知密度控制在训练阶段按头部区域自适应分配高斯基元,做区域自适应的稠密化与剪枝,把预算集中到显著区域;配套的语义感知标准高斯训练管线负责产出这个紧凑的标准(canonical)表示。外观-运动解耦压缩针对序列冗余:编码端对每一帧先用头部先验模型提取形状 β、表情 ψ_t、姿态 θ_t 三组头部先验参数,单独编成参数码流;高斯本体则拆成绑定索引 {b_i} 与标准高斯 {g_i},各经坐标排序后编成索引码流与高斯码流。解码端拿到三路码流后,由头部先验模型驱动「头部先验引导的形变」,把标准高斯变形到当前帧。关键在于:外观(标准高斯 + 绑定索引)只需传一次,运动只传头部先验参数——参数量比逐帧全量高斯小几个数量级,这就是时间冗余被吃掉的地方。 Overview of the proposed appearance-motion decomposed compression framework for 3D Gaussian head avatars. 实验效果:率失真性能优于现有的高斯头像表示与压缩方法,同时保持高质量的新视角与新表情渲染。单被试(Subject 264)的主观对比给出了很具体的数字:SACHA 只用 2.23 MB 就达到 PSNR 29.9984 dB,而 G-PCC 需要 10.50 MB 才拿到 29.9856 dB(约 4.7 倍体积换来几乎相同的质量);TGA 用 20.69 MB 只有 28.7186 dB,SACHA 在体积小约 9 倍的同时质量还更高。质量更高的两个基线代价极大——SVG-Head 84.12 MB / 31.2910 dB、TexAvatars 69.67 MB / 31.0862 dB,都比 SACHA 大 30 倍以上。HEVC 在 21.49 MB 下只有 21.49 dB 级别的可见退化(脸部结构明显扭曲)。新视角合成的 RD 曲线(PSNR/SSIM/LPIPS 三张图,横轴为对数尺度的 MB)显示 SACHA 的绿色曲线整体位于 1.5~3 MB 区间,而全部基线分布在 10~105 MB。 Subjective comparisons with G-PCC, HEVC, CompactSTG, GA, SVG-Head, TexAvatars, and TGA on subjects 074 and 264 from the NeRSemble dataset. 批判点评:从 RD 曲线看结论要更克制一些:SACHA 在自己的码率区间内 PSNR 大致在 28.8 dB 附近,明显低于 SVG-Head 的约 29.95 dB 与 TexAvatars 的约 29.85 dB,也就是说它换来极小体积的代价是质量上限被压低了——单被试上 29.9984 dB 的漂亮数字并不代表平均水平。LPIPS 一栏尤其值得注意:SVG-Head 约 0.045、TexAvatars 约 0.048,而 SACHA 约 0.11~0.12,感知质量差距比 PSNR 体现的更大,对于强调面部细节的应用未必可接受。方法整体强依赖头部先验模型(形状/表情/姿态参数化),先验拟合失败的情况(夸张表情、被遮挡、佩戴眼镜或头发遮挡面部)会直接让形变解码出错,论文没有报告这类失效。语义分区如何获得、分区错误的鲁棒性也未见交代。此外全部实验只在头部这一类目标上,方法名里的语义感知密度控制是否能推广到全身或一般物体,缺少验证。 9. DefaultShift:加速后颜色默认最多漂移0.303 DefaultShift: Auditing Semantic Default Shift in Accelerated Text-to-Image Models | 悉尼大学 | arXiv:2608.21784 关键词:少步加速模型,语义默认漂移,成对审计,VLM评估,离线校准,分布偏移,推理加速代价 前序问题:少步文生图模型正在大规模替换慢速生成器,但加速可能悄悄改变那些提示里没有指定的属性的分布——每一张输出看起来都合理、也都与提示对齐,可整体分布已经变了。作者把这类分布称为语义默认(semantic defaults),把替换导致的变化称为语义默认漂移。问题在于现有评测完全测不出它:质量指标只看单图好坏,偏好指标只看人更喜欢哪张,多样性指标只看整体是否单调,三者都不检验「替换模型是否保留了参考模型的语义默认」。后果是实践中的隐性风险——用少步模型批量生成训练数据时,颜色、背景、光照、视角的默认分布已经偏移,下游模型会继承这个偏差,而流水线里没有任何一环会报警。 本文贡献:DefaultShift 是一套成对审计流程。上半部分 Default Shift-Audit 分三段:成对采样阶段,对同一提示(如「a photo of a helicopter」)分别用参考模型 T(多步扩散)和加速替换模型 S 各生成一批图;语义默认阶段,用 VLM 评估器按封闭语义词表(颜色、背景、光照、视角等,每类若干离散取值)给每张图打标,得到两个直方图;漂移审计阶段,用 TV 距离等指标算概率质量的移动,并做教师自举校正(TV_adj = TV(T,S) − η_T)以剔除参考模型自身的采样噪声,再经 q=32 筛查、q=64 确认两级预算与 cell-level bootstrap,输出按配方排序的结果和方向性签名(偏暖还是偏灰)。下半部分 Default Shift-Select 是离线校准:给定参考直方图模板与 CLIP 质量下限,从 M=128 的候选池里做分布匹配(min TV),挑出 N=32 张既满足质量门槛、又让语义分布贴近参考模型的图。方法把「解释性排序」与「确证性的 cross-fit 推断」分开,避免用同一批数据既选又证。 Overview of DefaultShift. The audit generates matched samples from a declared reference and accelerated replacement, maps each image to a closed semantic vocabulary, and compares their conditional distributions. Cell-level discrepancies are aggregated for recipe ranking and directional analysis. DefaultShift-Select uses reference statistics and a quality-filtered replacement pool to construct a distribution-matched offline subset. 实验效果:在 14 组参考/替换配对上,调整后的颜色差异从 0.054 到 0.303,且方向随加速配方而异。统一 q=64 审计的排序里 NitroFusion-4 最严重(约 0.30),Turbo 约 0.25、DMD2 约 0.23、NitroFusion-1 约 0.23、FLUX-schnell 约 0.20,而 LCM 与 Lightning 最轻(约 0.05)。多属性画像显示颜色是最大的漂移源(0.20~0.30),背景 0.06~0.12、光照 0.05~0.09、视角仅 0.01~0.03。方向性指纹图给出定性结论:DMD2、Turbo、Lightning、LCM 都朝「暖色质量增加」方向移动(DMD2 的 Δ暖色质量约 +0.16 最显著),FLUX 则相反,朝灰色方向漂移(Δ暖色质量约 −0.07)。1000 张图的人工审计复现了同样的排序。DefaultShift-Select 在 Turbo、DMD2、FLUX 上把人工测得的漂移降低了 10.3% 到 35.1%,且没有实质的质量损失;在均衡评测下,经校准的数据相比未校准的替换数据恢复了 4.3 个准确率点和 7.5 个最差组点。 Acceleration recipes differ in magnitude, attribute, and direction. a The unified $q=64$ audit covers all 14 replacement pairs. Lines are 95% object-cluster intervals. b Color dominates the four-attribute profile, while viewpoint shifts are small. c Replacement-minus-reference changes in gray and warm mass reveal opposing recipe fingerprints. 批判点评:整套审计建立在 VLM 评估器加封闭语义词表之上,两处都会引入偏差:VLM 自身对颜色、光照的判断有系统性倾向,论文虽给出了人类与 VLM 的混淆矩阵,但那只覆盖「clear case」,模糊样本上的一致性未知;封闭词表则把连续属性强行离散化,词表粒度直接决定测出多大的 TV 距离,换一套词表数值不可比。「颜色差异 0.054 到 0.303」是 TV 距离而非人眼可感差异,缺少感知尺度上的锚定,读者很难判断 0.2 究竟意味着轻微偏暖还是明显变色。DefaultShift-Select 只是事后筛选,本质是丢弃不合分布的样本来贴近参考分布,代价是有效产出下降(128 选 32,即弃掉 75%),这个吞吐损失论文没有和「干脆用慢速模型」做成本对比。审计限定在提示未指定的属性上,但「未指定」的边界本身依赖提示写法,作者用的是「a photo of a {object}」这类极简模板,真实业务里的长提示会指定更多属性,结论的外推性有限。最后,下游 4.3/7.5 点的增益只在其自建的均衡评测设定下成立,任务范围较窄。 10. FIRM-Video:先核查再打分的8B视频奖励模型 FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling | 上海交通大学、腾讯优图实验室、同济大学 | arXiv:2608.21839 关键词:视频奖励模型,清单驱动,先核查再打分,指令遵循,世界一致性,感知质量,腾讯优图 前序问题:可靠的奖励模型是文生视频评测与对齐的基础,但评测准确性与推理效率之间的权衡,把压力全压回了训练监督的质量上。现有做法分两类,各有各的毛病。一类是固定评分细则的整体式评判:一个提示进来,模型按几条固定维度直接给总分,检查必然不完整——提示里明确要求的细节(红色狐狸、镜头右摇、雪地森林)不会被逐条核对。另一类是开放式推理:让模型自由生成一段分析再打分,问题是理由与分数经常不一致(unfaithful justification),而且多个维度的归因彼此纠缠(entangled attribution),分低了到底是因为没跟指令、还是因为画面糊,说不清。归因不清的奖励用来做 RLHF 或 Best-of-N,优化方向就是模糊的。 本文贡献:FIRM-Video 提出统一的清单驱动数据构造框架,核心是「先核查再打分」原则:构造维度专属清单 → 逐条对着时序视觉证据核验 → 只聚合被验证过的判断。三个维度各有各的清单构造方式。指令遵循(IF)把提示拆成带权重的原子需求(「红狐是否在场」「狐狸是否跃过木头」「场景是否下雪」「镜头是否右摇」),逐条验证满足与否,按权重加权求和得 1~5 分。世界一致性(WC)构造经提示校准的、针对具体目标的检查项,锚定在可见实体与动作上(「狐狸身份是否稳定」「解剖结构是否合理」「落地是否符合物理」),只对检测到违反的项计分。感知质量(PQ)用一套通用视觉缺陷分类(清晰度、模糊、色彩稳定性、闪烁、压缩伪影、局部畸变)做缺陷验证。三路验证过的判据与分数再被转成自然语言分析,用于端到端奖励建模的理由综合。数据上构造了 FIRM-Video-90K(29,348 个视频、3,012 个提示、3 个维度、88,044 条维度专属实例),并发布 FIRM-Video-Bench(250 个视频、750 条点式人工标注)。 Overview of the FIRM-Video data construction framework and reward model training. Given a prompt and its generated video, FIRM-Video applies a unified check-before-score pipeline to construct fine-grained supervision for instruction following, world coherence, and perceptual quality. The resulting dimension-specific analyses and scores form FIRM-Video-90K, which is then used to train the FIRM-Video-8B reward model. 实验效果:基于 Qwen3-VL 的 FIRM-Video-8B 在 FIRM-Video-Bench 上取得最优的总体 MAE,同时在三个视频生成器上的 Best-of-8 采样中稳定给出最高的 VBench Total、Quality 与 Semantic 分数。teaser 的案例很有说服力:一段工业车间里工人挥锤的视频存在三处问题(手柄颜色不对——提示要求纯黑却是浅棕、手柄形变、手柄畸形),人工标注给出 IF 3 / WC 2 / PQ 5;GPT-5 给 4/5/5、Qwen3-VL-8B 给 5/5/5,都严重高估了世界一致性;只有 FIRM-Video-8B 给出 3/2/5,与人工完全一致。模型输出的理由也指向了正确位置(「锤柄是浅棕而非指定的纯黑」「严重的解剖形变与锤柄融合」)。 Qualitative evaluation case of FIRM-Video-8B, illustrating its improved alignment with human judgments. 批判点评:清单本身是用 LLM 从提示里自动拆出来的,这就把可靠性问题往上游推了一层——如果原子需求拆错或漏拆(比如把「镜头右摇」漏掉),下游再严格的核验也补不回来,论文没有报告清单构造的召回率与准确率。权重同样如此:IF 分数是原子需求的加权和,权重怎么定、对结果多敏感,摘要层面没有交代。核验环节仍然由 MLLM 执行,「对着时序视觉证据核查」只是把一次大判断拆成多次小判断,单次判断的错误率并未消除,只是被平均了;对细粒度物理违例(手柄形变这类)MLLM 的检测能力本身就是瓶颈。FIRM-Video-Bench 由作者构建、模型也在同源数据上训练,报「最优 MAE」存在数据分布同源的优势,跨基准(如 VideoScore、VBench-Reward)的迁移结果缺失。Best-of-8 只测了三个生成器,且未说明是哪三个、覆盖是否有代表性。另外三个维度分别打分虽然解开了归因纠缠,但如何聚合成单一奖励用于 RL 训练,论文未给出方案,这一步没有解决的话,可靠归因的价值就还停留在评测阶段。 趋势观察 世界模型的竞争焦点从「画面好不好」转向「进得去、走得动、听得见」 — 今天最值得注意的信号是京东 Joy Future Academy 开源了 EchoWM,它把三件此前分开做的事塞进了一个模型:连续导航响应、720p 视频生成、以及环境音/音乐/语音的同步生成。过去一年世界模型的论文大多在比 FVD 和画面保真度,控制接口则各家各造——第一人称用一套相机控制器,第三人称再单独训一个角色控制器。EchoWM 的做法是把「相机意图」抽象成唯一接口:第一人称下它就是观察者运动,第三人称下相机与角色的耦合关系直接从数据里学,不额外设计视角专用控制器。离散按键和连续位姿统一映射到带公制尺度的相对 6-DoF 轨迹,再做数据集级校准,让不同来源的数据保持一致的运动幅度。这套设计的价值在于它承认了一个现实:世界模型最终要交到用户手上被「玩」,而不是被离线打分。同一天他们还放出了姊妹工作 JoyAI-Echo-1.5(arXiv:2608.23383),专攻跨镜头记忆的长视频叙事,两篇合起来是一次完整的系统级发布。值得留意的是「音频」这一路终于被当成一等公民而非后期配音——长时程下环境声与语音能否保持同步,正在成为区分「视频生成器」和「世界模型」的一条硬指标。 少步蒸馏正在从「加速技巧」长成「交互能力的前提条件」 — Adobe 的 EditStream 把这个转变说得很清楚:它先用灵活的任务条件把文生视频、图生视频、视频转视频、编辑传播、参考图引导编辑、相机位姿变更六件事统一到一个 DiT 里,然后才做少步自回归蒸馏——因为不做蒸馏,这个统一模型就没法用于交互式创作。他们提出的 Velocity Moment Matching 值得关注:不是在教师的采样轨迹上做匹配,而是在学生自己走到的中间状态上匹配条件速度矩,再叠加自回归 unrolling 让学生暴露在自己的预测误差里。从 T2V 的对比图能直接读出差异——Self-forcing 版本几乎是把首帧复制了四遍(狗和狼都原地不动、龙灯几乎静止),VMM-forcing 才有真实的位移和形变。这条线索和 Loopy 是呼应的:Loopy 发现 DiT 内不同注意力层的位置编码对时序顺序的控制力差异极大,最强的那层可以当锚点,按层给不同的偏移量就能把「直线」时间感知掰成「圆」,从而无需训练地生成无缝循环。两篇一起看,说明视频 DiT 的时序机制还有相当多可被显式操纵的结构,不必事事回到重训。 评测这一侧开始追问「加速和对齐到底悄悄改掉了什么」 — DefaultShift 提了一个此前几乎没人测的问题:少步模型替换慢速模型时,那些提示里没指定的属性(颜色、背景、光照、视角)的分布会不会被悄悄改掉?他们把这个现象命名为语义默认漂移,并给出成对审计流程。结果相当刺眼——14 组参考/替换配对里,调整后的颜色差异从 0.054 到 0.303,且方向因加速配方而异:DMD2、Turbo、Lightning 整体偏暖,FLUX-schnell 反而偏灰。1000 张图的人工审计复现了同样的排序。这提示一个容易被忽略的成本:蒸馏的代价不止是画质,还有分布层面的偏移,而现有的质量/偏好/多样性指标都测不出来。FIRM-Video 则从奖励模型一侧收紧标准,用「先核查再打分」替代整体式打分——先把提示拆成带权重的原子需求,逐条对着时序视觉证据核验,只聚合被验证过的判断。它的 teaser 很有说服力:同一段有明显手柄形变的视频,GPT-5 给 4/5/5、Qwen3-VL-8B 给 5/5/5,人工标注是 3/2/5,只有 FIRM-Video-8B 对上了。当生成能力持续走高,能否可靠地「说出哪里错了」正在成为比刷分更稀缺的能力。 人工智能炼丹君 整理 | 2026-08-26 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月26日
21 阅读
0 评论
0 点赞
2026-08-25
AIGC 每日速读|2026-08-25|Meta让15B DiT优化器时间砍半Muon-DiT
今日 AIGC 论文速览 今日共 10 篇 · 训练与推理效率 3 篇 · 视频编辑与视角转换 2 篇 · 生成理解一体化 1 篇 · 3D 与数字人生成 2 篇 · 可控图像生成 1 篇 · 生成评测 1 篇 重点论文标题列表 Muon-DiT(Meta、南加州大学 (USC)):优化器时间砍掉一半的15B DiT InfinityEdit(浙江大学、阿里巴巴集团):编辑指令跟着直播流无限延伸 TextAnchor(哈尔滨工业大学、可灵 KlingAI Research):十张参考图编辑提速5.47倍 Grounded-Exo2Ego(NVIDIA):第三视角视频翻成第一视角 Libra(中科院自动化所 MAIS、中国科学院大学、鹏城实验室):视觉与语言各走各的路再架桥 今日论文速览 1. Muon-DiT:优化器时间砍掉一半的15B DiT Scaling Muon for Diffusion Transformers | Meta、南加州大学 (USC) | arXiv:2608.20818 关键词:Muon优化器,DiT训练,Scaling Law,Newton-Schulz,通信优化,Meta 前序问题:Muon 是一个矩阵感知的优化器,它通过在奇异方向之间平衡更新来改善大模型训练,在语言模型上已有不少正面报告。但它在扩散 Transformer 上到底有没有用、有用的话优势会不会随规模衰减,一直没有系统答案——扩散模型的训练目标(去噪回归)与语言模型的下一 token 预测差异很大,参数矩阵的谱结构也不同,语言模型上的结论没有理由直接迁移。更棘手的是端到端效率:Muon 的核心是每一个优化步都要做 5 步 Newton-Schulz 迭代(NS5)来正交化更新方向,再加上需要把动量完整物化出来,这两项在大规模分布式训练下会引入可观的计算与通信开销。理论上 Muon 用更少的步数达到同样质量,但如果每一步都更贵,省下的步数优势就被抵消了,实际墙钟时间可能反而更长。 本文贡献:作者先把 Muon 在 1.3B 到 15B 参数的 DiT 上的 scaling 行为建立起来,确认其相对 AdamW 的优化与生成质量优势跨越各个规模都存在。然后针对上述开销问题提出 Periodic Row-wise Muon:完整的 NS5 谱更新每 K 步才做一次,其余步骤基于当前动量做一个计算与通信开销都很低的行约束(row-wise constrained)更新。这个设计的直觉是谱正交化的收益具有一定的时间持久性,不需要每步重做;行归一化则以极低成本维持更新方向的量级平衡。配套的分布式实现是关键的另一半——非刷新步直接在分片后的动量上操作,避免全量物化;谱刷新步则通过分桶 all-gather 与通信-计算重叠来加速。方法层面与实现层面是协同设计的,不是先有算法再套一个工程实现。 实验效果:跨全部规模,Muon 相对 AdamW 把观察到的最佳生成质量提升了 12.9%~19.1%。相比原版 Muon,Periodic Row-wise Muon 在 1.3B~4B 上最佳生成质量的差距保持在 0.5% 以内,在 9B 上反而提升了 4.5%。效率侧:优化器时间减少 46.9%~54.3%,端到端单步时间减少 15.7%~24.3%,逻辑通信量降低 66.7%,达到各自最佳生成质量所需的有效训练时间减少 33.7%~64.8%。9B 模型的 profiler 时序图直观展示了这个差异:原版 Muon 每一步的 CPU 阶段都被红色的 NS5 块占据,归一化总时间 12.47;Periodic Row-wise Muon 只在第一步做紫色的周期性刷新,后两步是很窄的绿色行归一化块,总时间降到 10.26。 Generation quality for AdamW and Periodic Row-wise Muon. 批判点评:评价指标只用了 FD-DINO 这一项。它作为生成质量代理是合理的,但单一指标很难覆盖扩散模型关心的全部维度——文本对齐、多样性、失效模式都没有报告,「生成质量提升 12.9%~19.1%」这个数字的解释空间因此受限。周期 K 的选择论文中没有在摘要层面给出选取准则,而这是一个直接影响质量-效率权衡的超参,实际使用时需要重新搜索。另外 9B 上 Periodic 版本反而比 vanilla Muon 好 4.5% 这个结果有点反直觉(近似方法优于精确方法),论文归因不明,更可能是训练噪声或正则化副作用,而不是周期化本身带来的收益——15B 上并没有复现出同样的优势。最后,全部实验在 Meta 内部的训练栈上完成,通信优化的收益与具体的集群拓扑强相关,换一套硬件环境未必能复现 66.7% 的通信量下降对应的实际时间收益。 2. InfinityEdit:编辑指令跟着直播流无限延伸 InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter | 浙江大学、阿里巴巴集团 | arXiv:2608.20910 关键词:无限视频编辑,流式生成,轻量适配器,因果注意力,阿里 前序问题:指令式视频编辑这两年靠大预训练模型已经做得不错,但绝大多数方法都建立在一个默认假设上:原地编辑。给定一段固定时长的源视频片段,把编辑后的视频与它逐帧对齐。这个模式在开放式的视频流面前直接失效——比如给一场正在进行的游戏直播换风格,或者给一个还在拍摄的镜头加一段运镜,编辑必须作用在陆续到来的未来帧上,而不是一个静态的输入片段。这个设定带来两个新困难:编辑必须是对流的忠实延续而不是逐帧重写,以及当编辑指令一条接一条累积时,生成质量不能持续退化。 本文贡献:作者先把这个任务形式化命名为无限视频编辑(infinite video editing)——给定前序片段和一条编辑请求,模型要生成延续这个流并施加该编辑的下一个片段,整个过程随无界的指令序列反复进行。为此他们设计了配套的数据收集管线,并在此基础上提出 InfinityEdit:一个给流式视频生成器加装无界编辑能力的轻量编辑适配器。适配器里有三个注意力模块,分工明确——历史交叉注意力用输入帧引导当前去噪帧,时序因果自注意力保证时间信息只从早期帧流向后期帧,编辑交叉注意力把编辑请求注入生成过程。推理时的调度是这个方法的巧妙之处:适配器只在编辑请求到达的那个 chunk 被激活(作者称之为 ignition chunk),后续 chunk 交还给原模型、用重置的锚定帧继续生成。这样既施加了编辑,又完整保留了原模型的无限生成能力,不会因为适配器一直在线而累积漂移。 Our adapter's architecture. It is composed of three attention modules. 实验效果:实验显示 InfinityEdit 在每条编辑下都能忠实延续视频流,并在无界编辑序列上保持稳定。定性对比最能说明问题:以一段山峰风景视频为源,连续施加「向上移动镜头」「拉远」「美式漫画风格」三条指令,Helios-Base 在第一条指令后就基本没有响应运镜;Anchor-Forcing 和 Infinity-RoPE 从第一轮开始画面就被云雾吞掉、山体结构丢失;SANA-Streaming 在第三轮的漫画风格化中把山体涂成了大片紫黄色块。InfinityEdit 三轮下来山峰主体的结构始终清晰可辨,运镜幅度与指令对应,漫画化时也保留了山形轮廓。长视频实验把每个编辑片段拉长到全序列超过 1000 帧,方法依然视觉稳定且持续实现每条指令。 Qualitative comparison with various methods on the streaming video editing task, where a sequence of editing instructions (here camera-movement and style edits) is applied continuously to a scenery source video. All methods share the same source video and editing instructions. Methods marked with $\dagger$ take no source video as input, while all other conditions are kept identical for fairness. 批判点评:18 页的篇幅对一个新任务定义加方法加数据管线来说偏紧,摘要里的实验结论全是定性表述(「忠实延续」「保持稳定」),没有给出量化的编辑成功率或与基线的数值差距,只能等正文核实。更值得追问的是评测本身——无限视频编辑这个任务是他们自己定义的,数据管线也是自建的,对比的基线(Helios-Base、Anchor-Forcing、Infinity-RoPE、Lucy-Edit、SANA-Streaming)都不是为这个设定设计的,在这种「主场作战」的比较里领先幅度容易被高估。推理时适配器只在 ignition chunk 激活、后续交回原模型这个调度虽然保护了无限生成能力,但也意味着编辑效果的持续性完全依赖锚定帧的传递,如果某条编辑的语义需要长时间维持(比如把整个场景换季),单 chunk 的激活是否够用是个未验证的问题。 3. TextAnchor:十张参考图编辑提速5.47倍 Anchoring Instruction Outside Mask: Exact Reference Caching for Efficient In-Context Diffusion Transformers | 哈尔滨工业大学、可灵 KlingAI Research | arXiv:2608.21229 关键词:参考图缓存,注意力掩码,on-policy蒸馏,多图编辑,可灵 前序问题:全模态生成里,上下文条件是核心机制——让扩散 Transformer 在同一条注意力序列里同时处理文本指令和视觉参考。问题是每张参考图会引入数千个 token,算力随参考图数量快速增长。现有的省法是结构化稀疏注意力,通过限制参考 token 与目标 token 之间的交互来砍计算。这个结构有个附带好处:参考图的 K 和 V 与去噪目标无关,因此可以算一次、跨所有去噪步复用。但代价同样明显——它把视觉参考与文本指令之间的通路也一并切断了,参考图「看不到」用户的指令,多参考图编辑里的指令跟随和参考保真度显著下滑。这是一个结构性的两难:要缓存就得解耦,一解耦指令就传不进去。 本文贡献:作者的破局点是同时重新设计 token 序列与注意力掩码,而不是在两难中做取舍。他们的 beyond-mask 设计引入静态文本锚点(时间步固定在 t=0 的文本 token),把指令连接到参考分支上,同时严格保持 K/V 精确复用的前提,且不增加任何参数。但这种直接的架构改造会掉生成质量,他们用两阶段的方式恢复:第一阶段是教师强制的速度蒸馏,在数据派生的插值点上查询教师;第二阶段是一段短的 on-policy 阶段,让教师在学生实际访问到的状态上做监督、修正沿轨迹的残余误差。作者称据其所知这是扩散模型中第一次用 on-policy 蒸馏来做架构恢复——这个组合思路(先改架构拿效率,再用蒸馏把质量补回来)本身比具体的加速数字更有普适价值。 Overview of instruction-aware exact caching. Top: Static text anchors condition the reference branch once during cache construction. Only the resulting reference K and V are retained and reused across denoising steps. Bottom: Comparison of attention structures, where rows denote queries and columns denote keys and values. 实验效果:在三个图像编辑基准上,方法与全注意力生成的质量持平。5 张参考图时把完整的 40 步去噪流程加速 3.92 倍,静态文本锚点带来的运行时开销可忽略;scaling 研究中 10 张参考图时加速比达到 5.47 倍。参考图数量与加速比的关系曲线很清晰:1 张时仅 1.82 倍,2 张 2.45 倍,5 张 3.86 倍,之后逐步爬升到 10 张时的 5.47 倍——全注意力的延迟从 1 张的约 40 秒涨到 10 张的约 970 秒,而本方法只从约 40 秒涨到约 175 秒,两条曲线的斜率差就是这套缓存机制的价值。定性对比中,隔离缓存(isolated condition)经常跟不上指令(图中红框标出的错误区域),而文本锚点版本的输出与 Qwen-Image-Edit-2511 的全注意力结果接近。 批判点评:加速比对参考图数量的强依赖需要被正确理解:单张参考图时只有 1.82 倍,这是绝大多数实际编辑场景的常态;5.47 倍要 10 张参考图才能拿到,而十图编辑是相当边缘的用例。也就是说这套方法的收益曲线与真实需求分布未必对齐。质量方面论文的说法是「matches full-attention generation quality」——匹配而非超越,考虑到还额外付出了两阶段蒸馏的训练成本,这个权衡是否划算取决于部署场景的推理量。on-policy 蒸馏作为架构恢复手段是个有意思的贡献,但论文没有报告这个恢复过程本身的成本(需要多少数据、多少 GPU 时),而这直接决定了该方法能否被复用到其他架构改造上。另外静态文本锚点把文本时间步固定在 t=0,这对训练时见过的时间步分布是一个分布外的用法,长期稳定性需要更多验证。 4. Grounded-Exo2Ego:第三视角视频翻成第一视角 Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation | NVIDIA | arXiv:2608.20534 关键词:第一视角生成,视角转换,语义锚定,3D重建,NVIDIA 前序问题:从一段第三人称(exocentric)视频生成对应的第一人称(egocentric)视频,对 AR/VR 与具身智能都很关键——第一视角数据的采集成本远高于架好机位拍摄。但这个任务比常规的新视角合成难得多:视角变化极端,标准的几何条件(把场景重建成 3D 再从目标位姿渲染)在这种大跨度下变得高度不可靠,而且会出现大量在源视频里根本没被观察到的区域,几何重建对这些地方无能为力——渲染出来就是一片空洞。 本文贡献:作者在架构和数据两个层面同时下手。架构上是一个双分支的视频扩散模型:几何锚定分支把第三视角的颜色和深度抬升成 3D 重建、在目标 ego 位姿下渲染,用这个渲染结果条件化生成;语义锚定分支则跳出了主流的纯几何路线——用 captioning 提取逐物体的短语,经 LLM 转成物体 token,配合可学习的 register,通过带掩码的交叉注意力注入,让模型基于物体级上下文来合成那些几何搞不定的困难区域。另一个被忽视但影响巨大的发现是相机-重建失配问题:重建出的 3D 与相机位姿之间存在系统性错位,会严重拖累 exo-to-ego 的学习,他们为此设计了一个相机重定位算法,修正后全部指标都有实质提升。数据层面则做了一个全自动的合成数据引擎,在程序化生成的环境里生成并渲染绑定骨骼的 3D 角色。 Method overview. Geometric anchoring (top): Exocentric color and depth are lifted to a 3D reconstruction and rendered at the ego pose. Semantic grounding (bottom): Per-object context is extracted as segmentation masks and object tokens. The segmentation masks are reprojected into the ego-view as used as attention masks during cross-attention. The per-object masks encourages noisy tokens to attend to object information relevant to the specific region, providing spatial structure that grounds semantics onto pixels. 实验效果:在有挑战性的 EgoExo4D 数据集上,方法在所有指标上都大幅超过近期的 SOTA。详细消融验证了数据侧与架构侧每一项贡献各自的增益。teaser 图给出的定性对比很有说服力:同一个厨房场景,Vista4D 生成的第一视角画面里手部与台面结构完全错乱,EgoX 虽然保住了手的形态但物体摆放与真值不符,纯几何渲染(Grounded Rendering)在未观察区域留下大片彩色噪点和空洞,而本方法的输出在手部姿态、盘子位置、台面布局上都与 ground-truth 高度接近。 批判点评:语义锚定分支依赖 captioning 模型和 LLM 来产生物体级条件,这条链路的鲁棒性没有被讨论——captioning 出错或漏掉关键物体时,本该被语义补全的困难区域会退化成什么,论文没有给出失败案例分析。合成数据引擎用程序化环境加绑定骨骼角色,与真实第一视角视频之间的域差距是这类方法的老问题(真实 ego 视频有严重的运动模糊、鱼眼畸变、极端光照),论文说合成数据有用,但没说清在多大程度上依赖它。评测只在 EgoExo4D 上进行,这个数据集以厨房、自行车维修等结构化场景为主,泛化到户外或大范围移动场景的能力未知。另外相机重定位算法被描述为「实质提升所有指标」,这暗示原始 baseline 的一部分差距其实来自数据处理缺陷而非方法本身,与 SOTA 的比较中这部分收益应当被单独看待。 5. Libra:视觉与语言各走各的路再架桥 Decoupled Vision-Language System for Multimodal Understanding and Generation | 中科院自动化所 MAIS、中国科学院大学、鹏城实验室 | arXiv:2608.20382 关键词:生成理解一体化,解耦架构,Switch Attention,跨模态桥,中科院 前序问题:生成理解一体化的多模态大模型现在基本都走一条路:把图像 token 和文本 token 拼进同一个 Transformer,共享全部参数。这么做简单,但隐含了一个未经检验的假设——视觉和语言的表征需求是相同的,可以用同一套注意力和 FFN 权重来建模。实践中大家反复观察到理解与生成两个目标互相拖累:加强生成能力往往损害理解性能,反之亦然。问题的根源可能在于自模态建模(视觉内部的空间关系、语言内部的语法结构)和跨模态交互(图文对齐)本来就是两类不同的计算,硬塞进同一套参数里会产生干扰。 本文贡献:Libra 的做法是把两者显式分开:一个视觉系统、一个语言系统,中间用跨模态桥(cross-modal bridge)连接。解耦主要落在两个模块上——switch attention 和 switch FFN,它们根据当前处理的是自模态建模还是跨模态交互,动态路由计算流。这样每个模态能学到自己独有的表征,同时保持有效的跨模态理解。作者给出了两个配置:Libra-1 用于纯理解的图生文设定,Libra-2 用于理解与文生图统一的设定。除了架构本身,论文还讨论了 tokenization、位置编码和监督信号上的多项改进——比如混合图像 tokenization 把 CLIP 的连续信号与 VQGAN 的离散 ID 通过 LFQ 结合,因为直接把 VQGAN 的图像编码器换成 CLIP 会扭曲视觉信息。 An overview of the Libra architecture. The core design is the switch attention and the switch FFN that decoupling self-modal modeling and cross-modal interaction. We build two variants, Libra-1 and Libra-2, to discuss several improvements in tokenization, positional encoding, and supervision. 实验效果:实验表明专门的 Libra 设计让多模态理解与生成互相促进(而非互相拖累),在理解与生成两类基准上都取得了强性能。文生图的定性对比中,面对「悉尼歌剧院旁边是埃菲尔铁塔,蓝色夜空下爆炸的黄色星星和旋转的蓝色光晕」这种多要素长 prompt,SDXL 漏掉了铁塔、Show-O 把歌剧院画成了抽象色块,Libra-2 则把歌剧院、铁塔、星芒、蓝色漩涡都放进了画面;「一张脸左半边是爱因斯坦、右半边是机器人剖面」这条更考验组合能力的指令上,Libra-2 的结果左右分界清晰、机械结构细节完整。tokenizer 的消融图也直观显示直接用 CLIP 替换 VQGAN 编码器会让重建图像严重失真,而 Libra-1 的混合方案大幅缓解了这一点。 Comparison on text-to-image generation. We highlight the key parts of the text prompts, where Libra-2 demonstrates strong prompt-following capacity. % shows several text-to-image generation results of Libra-2. More results are presented in Sec.. In Fig, we compare the text-to-image generation results of Libra-2 with two baselines, StableDiffusionXL and Show-O, where StableDiffusionXL is a widely-used strong text-to-image generation model, and Show-O is a unified MLLM that use the most closed training 批判点评:摘要里的性能表述全是「strong performance」这类定性词,没有给出任何绝对数字或与具体基线的对比,无法判断领先幅度——这在一篇主打架构设计的论文里是个不小的信息缺失。解耦架构的直接代价是参数量:一个视觉系统加一个语言系统再加跨模态桥,参数规模相比同等能力的共享架构必然更大,论文没有报告参数量对齐后的公平比较,「互相促进」的结论也就有可能部分来自额外容量而非解耦本身。定性对比选的基线 SDXL 和 Show-O 都不是当前最强的文生图或统一模型,说服力有限。另外 switch attention/FFN 的路由是根据「当前是自模态还是跨模态」这个二元判断来做的,这个划分在实际的混合序列里如何精确界定,摘要层面没有交代。 6. DiffVC-ONE:一步扩散做视频压缩后处理 DiffVC-ONE: Diffusion-based Generative Video Compression with One-Step Video Diffusion Transformer | 武汉大学遥感信息工程学院 | arXiv:2608.20515 关键词:生成式视频压缩,一步扩散,视频DiT,时序一致性,武汉大学 前序问题:生成式视频压缩能在极低码率下恢复丰富的视觉细节——这是传统编码器做不到的,因为传统方法在低码率下只能丢细节,而生成模型可以「补」出合理的细节。但这条路上同时满足高时序一致性和低推理成本一直很困难:基于图像的方法逐帧处理,帧间容易闪烁;基于视频的方法能保证一致性,但多步扩散的推理成本在视频这个数据量级上难以承受。 本文贡献:DiffVC-ONE 建立在一步视频扩散 Transformer 之上,三个组件依次解决三个问题。统一单向 latent 压缩器(U2LC)用一个共享模型高效且统一地压缩紧凑的 latent 切片,避免为不同参考结构设计不同的压缩器。视频 DiT 的一步扩散增强器把重建出的 latent 切片当作内容锚点,对整个图像组(GOP)做单步的时空感知增强——注意这里是对整个 GOP 一起做,时序一致性因此有结构性保证,而不是靠逐帧后处理再想办法对齐。混合条件生成器从重建内容和量化信息里抽取结构、强度、语义三类条件:结构条件保留应当忠实还原的区域,强度条件控制生成增强的程度(这一点很重要——不是所有区域都该被生成模型「发挥」),语义条件在一步增强中补充内容感知的感知细节。 The framework of the proposed DiffVC-ONE. 实验效果:在多个标准基准上达到 SOTA 的感知质量和时序一致性,同时保持低推理成本。视觉对比给出了同一场景下各方法的码率(BPP)与放大细节:videoSRC15 的教堂穹顶场景中,DiffVC-ONE 的 BPP 是 0.0126(作为 1.00 倍基准),而 DiffVC 需要 0.0321(2.55 倍)、DiffVC-OSD 需要 0.0355(2.82 倍)才能达到相当的观感;鹦鹉羽毛的例子里 DiffVC-ONE 用 0.0059 BPP,对比 PLVC 的 0.0158(2.68 倍)和 VTM-17.0-LD 的 0.0074(1.25 倍),红黄羽毛的边界过渡更清晰。也就是说在相同感知质量下,码率大约只需要竞品的三分之一到二分之一。 Visual comparison between the proposed DiffVC-ONE and other representative methods. 批判点评:这是一篇工程完成度很高但方向偏窄的论文——生成式视频压缩距离实际部署还有距离,主要障碍是解码端需要跑一个视频 DiT,这个成本在终端设备上并不现实,「低推理成本」是相对于多步扩散而言的,不是相对于传统编解码器。论文只有两位作者,实验体量看起来主要靠 RD 曲线堆砌(6 个数据集 × 6 个指标 = 36 张子图),但这种密集的曲线图很难让读者判断在哪个码率区间优势最明显。另外生成式压缩有一个根本性的争议这篇没有正面回应:解码出的细节是模型「编」出来的而非真实存在的,在监控、医疗、取证这类场景下这是不可接受的属性,而 LPIPS/DISTS/FID 这类感知指标恰恰会奖励这种行为。强度条件的设计看起来是对这个问题的部分回应,但论文没有把它作为一个安全机制来讨论和验证。 7. MultiCube:拿包围盒指挥每个零件长在哪 MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control | Roblox、卡内基梅隆大学 (CMU)、斯坦福大学 | arXiv:2608.20448 关键词:组合式3D生成,部件级控制,布局适配器,两阶段扩散,Roblox 前序问题:游戏和动画里用的 3D 资产通常需要是组合式的——拆分成有语义意义的部件,这样才能单独换材质、做动画、改结构。最近的 3D 生成方法已经能从图像或文本 prompt 生成高质量的组合式物体,但这类全局条件缺少专业创作流程真正需要的部件级可控性:你可以说「一门带黄铜炮管和木轮底座的加农炮」,但没法指定炮管具体多长、轮子放在哪个位置。 本文贡献:MultiCube 的输入设计很直白:一个全局文本 prompt、一份指定期望部件的文本 schema、以及一个用包围盒标出各部件空间位置的布局。输出是由多个独立网格组成的 3D 物体,一个部件一个网格,且同时满足语义和空间条件。方法用两阶段扩散:第一阶段生成与 schema 和布局对齐的整体网格(monolithic shape),第二阶段把这个网格同时分解成各个部件——注意是同时而非逐个,因为部件之间存在相互约束。核心组件是 Part Layout Adapter,它独立于其他部件来编码每个部件的条件(文本标签走 Qwen-VL,包围盒走 Fourier + Linear),这个独立性保证了改动一个部件的条件不会牵动其他部件。第二阶段的多部件 DiT 之间插入 Cross-Part Attention,让各部件在生成时互相感知、保证接缝处的几何一致。 MultiCube uses a two-stage diffusion-based architecture. In Stage 1, it synthesizes a monolithic object conditioned on the input text prompt and part layout (a). In Stage 2, it takes the object latents produced in Stage 1 and decomposes them into multiple shapes, one for each specified part, guided by the part labels and bounding boxes (b). Spatial conditions are encoded with a Part Layout Adapter in Stage 1 and a lightweight embedding in Stage 2. 实验效果:实验显示方法能生成高质量的组合式 3D 物体并实现精确的部件级控制,包括那些仅靠文本或图像 prompt 难以达到的独特布局。定性结果覆盖面很广:婴儿车(车架/把手/座椅/顶篷/轮子五部件)、滑板(板面/桥/轮)、手电筒、树蛙、工具箱、摩托艇(船体/舷外机/螺旋桨/方向舵/挡风/座椅六部件)、黄铜提灯,以及喷气背包、加特林、火箭、军用水壶、飞碟、腕式弹弓、长剑等。每个例子里生成的形状都能看出与输入包围盒布局的对应关系——比如飞碟的「旋转外环」确实是一圈环绕结构、「诱捕光束发射器」在底部。 Full pipeline generation results. MultiCube generates compositional 3D objects from input text prompts and part layouts. Here, the part bounding box layouts are automatically generated using GPT-5.1; hence, the generation process from prompt to output shape is fully automatic. 批判点评:对创作者来说,手工摆包围盒本身就是一项不轻的工作量——这套方法把「描述物体」的负担转移成了「搭建粗模」的负担,是否真的降低了创作门槛取决于具体工作流。摘要没有给出任何量化指标(几何质量、部件分割准确率、布局遵循度都没有数字),也没有与 CubePart、PatchAlign3D 等基线的定量比较,「高质量」的判断只能靠看图。展示的例子都是结构相对规整的人造物体(工具、载具、武器),部件边界清晰;有机形体(树蛙那个例子是唯一的例外,且它的部件划分——身体/头/舌头/腿——也相当粗粒度)和部件间存在复杂拓扑连接的物体表现如何,从现有材料看不出来。另外包围盒作为空间条件只能表达轴对齐的粗略位置,无法表达旋转、弯曲等更细的姿态要求。 8. Xemo-Talker:把情绪监督放到次主成分上 Xemo-Talker: Unlock Emotions Explicitly for Audio-Driven Talking Portrait Synthesis | 利物浦大学、西交利物浦大学、昆山杜克大学、CMU、蚂蚁集团、平安科技 | arXiv:2608.14700 关键词:说话人视频,情绪控制,主成分分析,唇形同步,蚂蚁集团 前序问题:音频驱动的说话人头像里,精确的情绪控制一直做不好,因为现有系统依赖隐式的情绪调节——情绪信号混在整体条件里,控制间接且不充分。而如果直接在整个运动空间上加显式的情绪相关损失,又会撞上一个内在的权衡:唇形同步需要运动空间的主要能量方向被音频严格约束,情绪控制则要求这些方向能被情绪标签改动,两个目标在同一组维度上打架。 本文贡献:论文的核心发现是一个关于运动空间结构的观察:虽然情绪线索散布在整个运动空间中,但把判别性监督集中在次主成分(less-principal components)上,反而能取得更好的情绪-唇形平衡——因为主成分主要编码高能量的发音动作和头部姿态变化,情绪信息在这些方向上的占比被淹没了。基于这个洞察,Xemo-Talker 先学一个中性的语音到运动映射,保证稳定的发音和唇形同步(这一支冻结),再引入一个由次主子空间监督引导的轻量情绪分支(可训练)。为了强化情绪控制,他们设计了 Tri-Loss:类间分离、类内紧凑、以及次主对比学习三项。推理时输入音频、参考图像和情绪标签即可。 Overview of Xemo-Talker. (a) The Geometry Motion Predictor learns emotion-agnostic audio-driven motion through diffusion reconstruction, producing the complete 70-D facial motion sequence. (b) With the predictor frozen, the Geometry Emotion Branch encodes the target emotion and injects multi-scale residual features through zero-initialized adapters to refine the motion prediction. (c) The subspace-aware Tri-Loss organizes global emotion representations using classification and prototype alignment, while applying contrastive discrimination to the less-principal PCA projection. The predicted motion is converted into deformed keypoints and rendered by the frozen LivePortrait renderer. 实验效果:在情绪分类准确率上达到 SOTA,同时保持有竞争力的唇形同步和高推理效率,性能接近在真实视频上测得的水平。定性对比里最有说服力的是 Fear 与 Surprised 这一对——这两种情绪在面部表情上高度相似(都是睁大眼睛、张嘴),是情绪控制里最容易混淆的一对。图中同一身份在两种标签下生成的结果确实呈现出可区分的差异:Fear 时眉毛内侧上扬、嘴角向下、整体表情收紧,Surprised 时眉毛整体上抬、嘴张得更圆、眼睛睁得更大。男女两个身份上这个区分都成立。 Visual comparison of Fear and Surprised expressions from MEAD. 批判点评:「情绪分类准确率 SOTA」这个指标本身值得警惕:它衡量的是一个分类器能否认出生成视频的情绪,而 Tri-Loss 里的类间分离和类内紧凑恰恰是在直接优化这个可分性——存在把情绪做成夸张刻板表情来取悦分类器的风险,而人类观感上的自然度未必同步提升。论文没有报告用户研究,这个疑虑无法排除。次主成分承载情绪信息这个发现是基于 70 维运动空间的 PCA 方差谱得出的,这个运动表示来自 LivePortrait,结论是否依赖这个特定的运动表征、换一套 3DMM 或隐式表示还成不成立,没有验证。情绪标签是离散的类别(happy/sad/fear/...),这与真实表达中情绪的连续性和混合性不符,强度控制也不在建模范围内。另外机构列表横跨六家单位,实际的实验规模从 9 页的篇幅看应该有限。 9. OccluRank:给每个框加个序号定遮挡 OccluRank: Controllable Occlusion-Aware Layout-to-Image Generation by Adding Just an Ordinal Rank | 合肥工业大学、中国科学技术大学、字节跳动、中科院软件所 | arXiv:2608.20932 关键词:布局生成,遮挡顺序,序数条件,可控生成,字节跳动 前序问题:布局到图像生成通过包围盒实现显式的空间控制,但包围盒只能指定实例的位置,无法表达它们之间的遮挡关系——两个框重叠时,谁在前谁在后是未定义的。现有方法要么额外依赖深度图等几何条件(增加了输入负担),要么用复杂的推理阶段优化流程,要么把各实例的表征独立构建后简单聚合、完全不建模遮挡带来的相互作用。 本文贡献:OccluRank 的设计极简:给每个包围盒只加一个序数 rank。这个用户指定的遮挡顺序通过轻量的基于 rank 的条件注入编码进模型,配套的 Order-aware Instance Interaction(OII)模块在聚合前对 rank 条件化的实例表征做联合更新——具体是在每个空间位置 p 上取该位置的有效性掩码,把落在这里的多个实例特征送进一个 Transformer 做位置级的跨实例交互,让指定的顺序引导重叠实例之间的信息交换。整个过程不需要额外的几何输入,也不需要推理时的专门优化。数据侧他们构建了 OccluLayout:一个合成训练数据集,遮挡顺序和 amodal 标注直接从已知的场景几何导出,而不是用辅助预测模型从部分遮挡的图像里估计——这是个关键差别,估计出来的标注在遮挡严重时本身就不可靠。评测侧提出 OccluLayout-Bench,用多个多模态大模型评测器分别评估实例存在性、空间布局、属性和遮挡顺序,再加 FID 衡量整体图像质量。训练目标除了全局去噪损失还加了前景并集掩码上的局部去噪损失。 Overview of OccluRank. OccluRank constructs spatially aligned instance features, incorporates ordinal rank embeddings, and performs location-wise cross-instance interaction before aggregating into an Instance Semantic Map (ISM). The masked ISM is residually injected into selected cross-attention layers of SDXL. 实验效果:实验显示 OccluRank 更可靠地保留目标实例、遵循指定布局、实现期望的遮挡关系,同时属性一致性和整体图像质量与基线相当。定性对比中的差异相当明显:「猿在前、羊在后、鸡在最后、狐狸最远」这组布局里,CreatiLayout 把猿和羊糊成了一个畸形生物、LaRender 直接漏掉了羊和鸡,OccluRank 则四个实例齐全且前后关系正确;「大象/长颈鹿/斑马/斑马」那组里 OcclusionFormer 漏掉了长颈鹿、IFAdapter 的斑马与长颈鹿位置错乱,OccluRank 的四个动物按指定顺序排布。反向消融图进一步验证了控制力:把实例顺序反过来后,没有 rank embedding 的变体输出几乎不变(说明它根本没接收到顺序信号),完整模型则正确翻转了前后关系。 Qualitative comparison under overlapping layouts. $^\dagger$ denotes the official checkpoint without OccluLayout training. 批判点评:用多模态大模型当评测器来判断「遮挡顺序是否正确」是个方便但风险不小的选择——MLLM 本身对遮挡关系的判断能力就未经充分验证,用它评一个专门优化遮挡的模型,存在评测器与被评对象共享失败模式的可能。OccluLayout 是合成数据集,遮挡顺序从已知几何导出确实比估计可靠,但合成场景的物体摆放分布与真实照片差距多大、训练在合成数据上的模型在真实布局上的泛化如何,需要看正文的实验设计。序数 rank 只能表达全序的前后关系,现实中常见的交错遮挡(A 遮 B 的左半、B 遮 A 的右半,比如交叉的手臂)无法用一个标量序号表达。骨干用的是 SDXL,在当前时点已经不算前沿,这套 rank 条件化机制能否迁移到 DiT 架构的现代模型上是个开放问题。 10. CamWorldQA:给运镜可控的世界视频打分 CamWorldQA: Perceptual Quality Assessment of Camera-Controlled World Video Generation | 上海交通大学、埃因霍温理工大学 | arXiv:2608.18710 关键词:视频质量评测,相机控制,世界模型,无参考VQA,上海交大 前序问题:生成式视频模型现在已经能做相机可控的世界视频生成——用户给定一条相机轨迹,模型据此合成视频。但评估这类视频的质量没有合适的工具:现有的视频质量评估方法都是为自然视频设计的,捕捉不到相机可控生成特有的感知特性,比如视角一致性、运动连贯性和内容保持度。换句话说,这个方向的进展缺少一把合适的尺子。 本文贡献:作者构建了 CamWorldQA,第一个针对相机可控世界视频生成的感知质量评测基准。规模是 720 个生成视频,来自 6 种代表性生成方法、20 个多样化的源视频、6 种相机轨迹(Truck Left/Right、Dolly In/Out、Pedestal Up/Down)的组合,每个视频都通过主观实验获得了人工标注的感知质量分。在此基础上他们提出 CWQA,一个无参考的质量评估网络,用三个互补分支分别提取特征:光流分支用 RAFT 抽运动轨迹特征(1×512),运动分支用 SlowFast 的双通路抽运动特征(1×2304),空间分支用 ResNet-50 加多层级池化抽空间特征(1×7168)。三路特征经 Projection MLP 后通过自适应门控加权融合,再送进质量回归头输出分数。 Overview of the proposed CWQA method. 实验效果:实验表明 CWQA 在 CamWorldQA 数据集上显著超越现有的质量评估方法。demo 图给出了两个具体例子:一段 Truck Right 运镜的人物视频,人工打分 61.18,SimpleVQA 给 51.45(明显低估),CWQA 给 63.75,与人工判断接近;另一段 Pedestal Down 的风景视频人工只给 25.65(画面在下摇过程中出现了明显的内容坍塌),SimpleVQA 给 40.33(严重高估),CWQA 给 23.56。这两个例子恰好展示了通用 VQA 方法的典型失效模式——它们对生成视频里那种「画面清晰但内容不合理」的退化不敏感。MOS 分布图还显示不同生成方法、不同轨迹、不同内容类别之间的质量差异都相当显著。 Qualitative comparison of quality predictions from different VQA methods and CWQA. 批判点评:720 个视频、20 个源视频的规模在 VQA 基准里偏小,尤其是源视频只有 20 个,内容多样性有限,训练出的模型容易过拟合到这些特定场景。「显著超越现有方法」的比较对象是 SimpleVQA 这类为自然视频设计的通用方法,在专门数据集上被专门模型超过是预期内的结果,真正有意义的对比应该是与其他为生成视频设计的评测方法(如 VBench 的相关维度)比,摘要里没有提到。CWQA 的架构是三个现成骨干(RAFT/SlowFast/ResNet-50)加门控融合,方法层面的新意有限,价值主要在数据集。另外基准覆盖的 6 种相机轨迹都是单一的基本运镜,真实创作中的复合轨迹(边推边摇、弧形环绕)不在评测范围内,而这恰恰是相机控制最容易失效的地方。 趋势观察 优化器这一层终于被认真当成扩散模型的加速位点 — 过去两年扩散模型的提速几乎全部发生在推理侧——蒸馏减步数、缓存复用特征、量化降精度,训练侧则默认「AdamW 就够了」。今天 Meta 的这篇 Muon-DiT 把注意力挪回了训练:他们在 1.3B 到 15B 的 DiT 上系统跑通了 Muon 的 scaling 行为,确认它相对 AdamW 的生成质量优势(12.9%~19.1%)不随规模消失。更有价值的是他们诚实地承认了 Muon 在大规模下的代价——每步都做的 5 步 Newton-Schulz 迭代加上全量动量物化,会把 Muon 省下的步数优势重新吃掉。Periodic Row-wise Muon 的解法很朴素:昂贵的谱更新每 K 步做一次,其余步用便宜的行归一化更新顶上,再配合分片动量上直接算、bucketed all-gather 与通信计算重叠。结果是优化器时间砍掉 46.9%~54.3%,逻辑通信量降 66.7%。这提示一个被忽视的事实:当模型规模足够大时,优化器本身的算力与通信开销已经不是可以忽略的常数项了。 「缓存」正在从推理技巧升级为架构设计的一部分 — 可灵这篇 TextAnchor 的问题设定很典型:多参考图编辑里每张参考图带来数千 token,算力随参考图数量线性甚至更快地涨。现有做法用结构化稀疏注意力来砍——把参考图的 K/V 与去噪目标解耦,于是可以算一次复用到所有步。代价是参考图看不到文本指令了,指令跟随和参考保真度双双下滑。这篇的破法不在算子层面而在序列层面:加一段时间步固定在 t=0 的静态文本锚点,让参考分支在构建缓存时就能读到指令,同时保持 K/V 与去噪目标无关这个可缓存的前提。这个「改架构换缓存」的思路带来的副作用是生成质量掉了,他们又用教师强制的速度蒸馏加一段 on-policy 阶段把它补回来——据作者说这是扩散模型里第一次用 on-policy 蒸馏做架构恢复。5 张参考图下 40 步全流程加速 3.92 倍,10 张时到 5.47 倍。加速比随参考图数量增长而增长,这才是这类方法真正的价值所在。 视频生成的条件正在从「一段完整视频」变成「一个持续到来的流」 — 阿里的 InfinityEdit 指出了现有指令式视频编辑一个被默认接受的假设:原地编辑(in-place editing)。给定一段固定时长的源视频,逐帧对齐地改写它。这在直播换风格、给正在拍摄的镜头加运镜这类场景下直接失效——编辑必须延伸到还没到来的未来帧上。他们把这个设定命名为无限视频编辑,并配了一个只在编辑指令到达的那个 chunk 才激活的轻量适配器:历史交叉注意力锚住前序内容、时序因果自注意力保证信息只从早往晚流、编辑交叉注意力注入指令;后续 chunk 交回原模型并重置锚定帧,从而在施加编辑的同时不损害原模型的无限生成能力。超过 1000 帧的长序列上仍能稳定实现每一条指令。有意思的是今天还有一篇 NVIDIA 的 Grounded-Exo2Ego,走的是完全不同的技术路线(双分支视频扩散 + 3D 重建锚定 + 物体级语义补全),但两者面对的其实是同一类困难:当条件信号在大范围上不可靠或根本不存在时,生成模型该拿什么去锚定。 人工智能炼丹君 整理 | 2026-08-25 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月25日
17 阅读
0 评论
0 点赞
2026-08-24
AIGC 每日速读|2026-08-24|快手可灵证明奖励劫持源于流形漂移ThermoDPO
今日 AIGC 论文速览 今日共 10 篇 · 奖励对齐与偏好优化 1 篇 · 推理加速 1 篇 · 音频驱动与语音生成 3 篇 · 数字人与 4D 生成 1 篇 · 新视角合成 1 篇 · 视频身份保持 1 篇 · 设计与版式生成 1 篇 · 生成评测 1 篇 重点论文标题列表 ThermoDPO(西湖大学、浙江大学、快手可灵团队):奖励劫持的根因是流形漂移 AViTS(上海交通大学、阿里云终端智能计算部、山东大学、吉林大学、西安交通大学(ECCV 2026)):选对token省下9倍算力 SingDance(快手可灵团队、香港科技大学、清华大学):训练没见过的唱跳被组合出来 K5 声音克隆(Kandinsky Lab(俄罗斯莫斯科)):加一层线性层换来声音克隆 VoiceDesigner(约翰霍普金斯大学、Adobe Research):用文字描述设计并改写音色 今日论文速览 1. ThermoDPO:奖励劫持的根因是流形漂移 Manifold Drift in Flow Preference Optimization: A Root Cause of Reward Hacking | 西湖大学、浙江大学、快手可灵团队 | arXiv:2608.20011 关键词:流形漂移,偏好优化,流匹配,奖励劫持,DPO,快手可灵 前序问题:偏好优化(DPO 那一套)已经是对齐生成模型的标准做法,但把它搬到流匹配这种连续时间动力学上并不是换个损失函数那么简单。流匹配的训练目标是学一个把噪声搬运到数据分布的速度场,而奖励驱动的更新会直接修改这条搬运轨迹——问题是,没有任何机制约束修改后的轨迹终点仍然落在预训练数据流形上。实践中这表现为大家熟悉的「奖励劫持」:打分器给的分越来越高,生成的图却越来越不像正常图片。此前的讨论多停留在现象描述和经验缓解(加 KL 惩罚、早停、混拒绝采样),没人说清这究竟是调参问题还是结构问题。 本文贡献:作者把这个失效模式命名为流形漂移(manifold drift),并给出了它的判据。理论侧证明了两件事:最优的流匹配确实能恢复终点数据分布;而一次偏好更新只要其诱导的终点位移带有非零法向分量,采样支撑集就会离开预训练流形——也就是说漂移是偏好更新的结构性后果,不是训练不充分。对策是 ThermoDPO:一个带温度控制的目标函数,把成对偏好优化锚定在被偏好的样本上。这个设计有个漂亮的性质——在不同温度区间下,它分别退化为拒绝采样微调(RFT)和 FlowDPO,也就是说它把这两种此前被当作不同方法的做法统一在一条温度轴上,同时控制一个基于重建的逐点代理量来间接约束流形距离。低温时偏好信号会被削弱,作者又补了一个加权变体 ThermoDPO-weighted 来补偿。 Core intuition of ThermoDPO. Flow Matching (gray) transports noise to the pretrained data manifold. FlowDPO (green) may reach preferred regions through an off-manifold displacement, whereas ThermoDPO (red) adds a winner-side anchor intended to keep the redirected mass closer to the pretrained manifold. The formal statements and their assumptions are summarized in tab:notation_theory_map; the behavior is evaluated in the toy study (Fig.) and real-image study (Fig.). 实验效果:玩具基准上 ThermoDPO-weighted 的 StrictScore 达到 0.899,对比 FlowDPO 的 0.629 和 FlowDPO+RFT 的 0.857。真实模型上,在 SD3.5-M、CFG=4.5 的设定下,OCR 指标提升 47.5%,四项指标平均提升 16.0%。人工成对评测的结果更能说明问题:在文字准确性上 ThermoDPO 对 FlowDPO 的胜率是 40.0% 对 16.7%,视觉质量上对 FlowDPO 是 36.7% 对 6.7%——注意三个对比中「平局」的比例都在 46%~93% 之间,说明改进是稳定的方向性提升而非把生成结果整体改头换面。 Pairwise human evaluation of ThermoDPO-weighted against different baselines on text accuracy and visual quality over 30 prompts. Each stacked bar reports the percentage of prompts for which ThermoDPO-weighted is preferred, tied, or dispreferred relative to the corresponding baseline. ThermoDPO-weighted shows consistently stronger performance on visual quality while remaining competitive on text accuracy. 批判点评:这篇的贡献重心明确在理论刻画,实证部分则偏薄。主结果跑在玩具基准上,真实模型只验证了 SD3.5-M 单个骨干、且核心提升集中在 OCR 这一个指标上(47.5% 相对提升听起来大,但文字渲染是 SD3.5 的已知短板,基线本身偏低)。四项指标平均 16.0% 的提升没有拆开给出每一项,读者无法判断是均匀改善还是被 OCR 一项拉高。人工评测的样本量看柱状图应为 30 对,规模偏小。另外把 RFT 和 FlowDPO 统一到温度轴上是个优雅的结论,但也意味着 ThermoDPO 在实践中多了一个需要调的超参,而论文对温度如何选择只给了区间性的定性讨论。视频生成——快手可灵最关心的场景——完全没有实验。 2. AViTS:选对token省下9倍算力 AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation | 上海交通大学、阿里云终端智能计算部、山东大学、吉林大学、西安交通大学(ECCV 2026) | arXiv:2608.17995 关键词:token选择,动态分辨率,DiT加速,时空重要性,ECCV 2026,阿里云 前序问题:扩散 Transformer 的成本来自迭代采样。一个已知的省法是动态分辨率:早期时间步在低分辨率下去噪,后期再升到高分辨率,因为早期主要确定构图、不需要细节。但现有做法在分辨率切换点会把所有 latent token 一起升采样,这里有两重浪费——很多 token 对应的是背景或平坦区域,根本不需要高分辨率计算;而统一升采样还可能损害细节一致性。已有的部分升采样策略要么只看局部 latent 的结构线索,要么只用单步统计量,两者都难以同时刻画「token 与文本的语义相关性」和「token 表示在扩散步之间的动态变化」。 本文贡献:AViTS 把「该给哪个 token 升分辨率」建模成一个时空重要性问题,两个信号分开算再融合。空间重要性来自 latent 与文本的注意力:把自注意力的 Query 与文本 Key 的注意力图沿头维度平均,得到每个 token 的空间分数,语义上与 prompt 更相关的 token 分数更高。时间重要性来自 token 级特征在扩散时间步之间的方差——变化剧烈说明这个位置还没收敛、仍在被主动塑形。两者融合后做重要性感知的选择性升采样:关键 token 优先精化分辨率,次要 token 延后处理,从而砍掉冗余的高分辨率计算。整个方法不需要重训模型。 Overview of AViTS and spatiotemporal importance estimation. (a) Three-stage dynamic-resolution sampling: Stage~1 low-res denoising with signal collection over the last $N_T$ steps, Stage~2 selective upsampling of top-$K$ tokens, and Stage~3 full-res refinement. (b) Temporal importance from token-wise step variance across the collected snapshots. (c) Spatial importance from aggregated latent--text cross-attention (averaged over heads/blocks and collection steps); fused scores guide prioritization. 实验效果:FLUX 上最高 6.34 倍加速;Qwen-Image-Edit 和 FLUX.1-Kontext-dev 上接近 9 倍 FLOPs 削减;叠加蒸馏模型后达到 14.76 倍。作者强调该方法与蒸馏、量化、特征缓存三条主流加速路线正交,可以叠乘。图像编辑任务上的定性对比给出的是 5.24 倍加速档位(这一档下与 Ralu 的 4.55 倍、ToCa 的 3.59 倍、TaylorSeer 的 5.00 倍同台):三组编辑指令中 AViTS 的结果与原始 1.00 倍输出最接近,而同倍率的 TaylorSeer 出现了明显的材质与结构偏移(陶瓷羊的例子里羊的形态直接变了)。 Qualitative comparison on GEdit-Bench with Qwen-Image-Edit. AViTS achieves superior semantic preservation and visual quality at a higher acceleration ratio (5.24$\times$) compared to state-of-the-art baselines. 批判点评:加速比的报法需要读者留心:摘要里的「近 9 倍」和「14.76 倍」是 FLOPs 削减,而定性图里用来跟同类方法比画质的是 5.24 倍这一档——FLOPs 削减与实际墙钟加速之间通常有不小的落差,尤其是这套方法引入了额外的注意力统计与 token 选择开销,论文摘要没有给出对应的实测延迟。另外空间重要性依赖 latent-text 注意力,这对文本条件较弱或无文本条件(如纯图像编辑的结构保持部分、无分类器引导关闭时)的场景是否还成立,需要更多验证。方法本身只作用于「动态分辨率采样」这个前提之上,如果模型本来不走 coarse-to-fine,收益无从谈起。 3. SingDance:训练没见过的唱跳被组合出来 SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning | 快手可灵团队、香港科技大学、清华大学 | arXiv:2608.16220 关键词:唱跳视频,组合零样本,角色条件,音频注入,快手可灵 前序问题:给定一张参考图、一段文本和一条音轨生成个性化舞蹈视频,需要模型把音乐映射到身体动作。但「边唱边跳」多了一个要求:画面里的人不仅要跟上节拍,嘴还得对上歌词。现有方法在这里正好分成两个互不搭界的阵营——音乐驱动的方法只管编舞,不管口型;语音驱动的方法则默认画面里的人就是发声者,从没考虑过「跳舞的人同时在唱这首歌」这种组合。而直接收集「唱跳」配对数据成本极高。 本文贡献:SingDance 的核心设计是把「是否发声」抽象成一个语义角色:画面主体要么是 source(声音由他发出),要么是 listener(声音来自画外的另一个人)。这样一来,「对口型」就不再绑定在语音这个模态上,而变成一个可以被显式切换的条件。架构上用硬路由(hard-compact routing)从语音、音乐、角色三路条件里挑出与当前任务相关的部分,再通过逐帧的联合音频注入送进 DiT 块——关键是 source 和 listener 共享同一条语音通路,这保证了两种角色下的表征是可比的。训练用非对称监督:屏幕内说话的视频与精心筛选的画外对话回应视频负责建立角色控制,纯器乐和歌曲伴舞视频负责建立音乐驱动的身体动作。真正巧妙的是目标配置 Song/Source(发声者在唱歌)在训练中从未出现过——推理时把 source 角色指派给一首歌,就把分别学到的「发声」和「随歌跳舞」两种能力组合出来了,实现组合零样本。 Training architecture of SingDance. The first video frame is separately encoded as a clean reference latent, while subsequent frames are temporally compressed and noised in latent space. Wav2Vec~2.0 and MuQ features, together with the vocal-role condition, are selected by hard-compact routing and supplied to frame-wise joint audio injection. The repeated block is schematic: joint audio injection is applied immediately after each of 10 selected blocks in the 30-block DiT backbone. The denoised latents are decoded into output frames. Snowflakes and flames denote frozen and trainable modules, respectively. 实验效果:实验显示强的动作-节拍对齐与视觉保真度,口型同步与最强的语音驱动基线高度竞争,但生成时参数量显著更少。角色切换的效果在定性图里最直观:同一段视频在 Lip-on 和 Lip-off 两种设定下,人物的身体动作与背景几乎完全一致(帧号相同),差别只在嘴部——Lip-on 时嘴张开在发声,Lip-off 时嘴闭合,说明发声控制被干净地从身体运动中解耦出来,切换一个条件不会牵动其他部分。 Qualitative paired vocal-role switching on two SingDance examples. Each Lip-on/Lip-off pair shares all role-independent inputs and inference settings; only the vocal role changes. 批判点评:论文只有 9 页 5 图,实验体量偏小,且摘要中的结论多为定性表述(「强的对齐」「高度竞争」),缺少可对照的绝对数字——口型同步到底是 Sync-C 多少、跟哪个基线差多少,需要读正文才能确认。组合零样本是个漂亮的设定,但它成立的前提是「发声」与「音乐驱动运动」这两种能力在表征上足够独立;一旦歌曲的节奏与歌词的发音在时间上强耦合(比如快嘴 rap),这种解耦假设是否还站得住是个开放问题,而这恰恰是唱跳场景里最难的一类。另外角色只有 source/listener 两档,多人同框、轮唱、和声这类真实短视频里常见的情形不在建模范围内。 4. K5 声音克隆:加一层线性层换来声音克隆 Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer | Kandinsky Lab(俄罗斯莫斯科) | arXiv:2608.15690 关键词:声音克隆,文生音视频,零初始化,T2AV,Kandinsky 前序问题:文生音视频(T2AV)模型能从一段文字同时生成画面和配乐配音,但没有任何机制控制「说话的是谁」——你要一个特定音色,只能碰运气。给这类模型加声音克隆的常规思路是接一个说话人编码器、改架构、重训,代价不小,而且改动大了容易伤到已有的音视频生成能力。 本文贡献:作者给出的是一个近乎最小的改法:在音频主干上加一个零初始化的线性层,短周期微调,推理时给一段短参考录音即可。零初始化是关键——增强后的模型在训练开始时就是原模型的一个功能副本,不会破坏已有能力,这个思路和 ControlNet 的零卷积同源。参考信息通过两路互补信号注入:一是把参考音频的扩散 latent 拼接(prepend)到音频流前面,提供细粒度的时序音色信息;二是用一个全局说话人嵌入去调制目标音频的 token,提供说话人层面的整体约束。方法在自家两个模型上验证:K5(5B)和 K5-lite(0.6B),底座是开源 Kandinsky 5.0 的 CrossDiT 架构——音频与视频两条流各自做自注意力,再在每个融合块内通过跨模态注意力交互,文本条件由两条流共享。 实验效果:在 30 个说话人、674 条说话人-文本配对的基准上,对比五个强声音克隆 TTS 基线(含 XTTS-v2、IndexTTS2、NAVA 等),增强后的 5B 模型在三个独立验证网络(ECAPA-TDNN、WavLM-SV、Resemblyzer)上都取得最高的说话人编码器余弦相似度 SECS,且相对每一个基线都具备统计显著性。架构上还有个意外收获:因为音频路径可以独立评估,推理时能只跑音频、跳过整个音视频扩散循环,带来约 30 倍加速,而声音克隆行为不受影响。 批判点评:评测口径偏窄是最明显的问题:主指标只有说话人相似度 SECS 一项,而声音克隆的质量至少还要看可懂度(WER)和自然度(MOS)——只优化相似度很容易换来音质或发音的退化,论文摘要里没有给出这两项与基线的对照。基准规模也不大(30 个说话人),且没有说明是否覆盖跨语言、口音、非常规音色这些真正考验泛化的情形。30 倍加速的说法需要正确理解:它是「只跑音频路径 vs 跑完整音视频循环」的对比,本质上是省掉了视频生成,而不是音频生成本身变快了——对于真正需要音视频一起出的场景,这个加速并不存在。另外整套方法绑定在自家 Kandinsky 5.0 底座上,对其他 T2AV 架构的可迁移性未验证。 5. VoiceDesigner:用文字描述设计并改写音色 VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation | 约翰霍普金斯大学、Adobe Research | arXiv:2608.13613 关键词:文生音色,语音编辑,统一扩散,数据增强,Adobe 前序问题:文生音色(TTV)让人可以用一段文字描述直接合成对应的嗓音,这在配音、游戏角色、有声书里价值很高。但现有系统卡在两处:一是音色多样性不足,尤其是虚构角色(怪物、机器人、卡通形象)这类现实中不存在的嗓音,模型基本合成不出来——因为训练数据里就没有;二是缺乏鲁棒且灵活的编辑能力,比如按参考音克隆、或者只改情绪和语气而保持音色。 本文贡献:两条线同时下手。数据侧做了一个混合流水线:用数字信号处理手段(变调、共振峰变换、时域拉伸这类)配合语音生成模型,人工构造出覆盖真实人声与虚构角色的多样音色数据集——本质上是用增强绕开「虚构嗓音没有真实录音」这个死结。模型侧提出 VoiceDesigner,一个统一处理生成与编辑的扩散 Transformer。架构上四路输入各配一个 Local-DiT 前端:参考音频与目标音频走 VAE 编码器,指令走语言模型,转写文本走 tokenizer,四路 token 拼接后过共享的 DiT 块栈。DiT 块内部用 RMS-Norm 加 Scale/Gate 的调制结构(自注意力和前馈各一组),条件通过调制系数注入。另配一个时长预测器先定长度,再由 DiT 从噪声 latent 出发去噪、VAE 解码出波形。这样生成(无参考音)与编辑(有参考音)就是同一套权重下的不同输入配置。 An overview of framework design of VoiceDesigner. 实验效果:主客观评测显示,VoiceDesigner 在与音色描述和编辑指令的对齐度(prompt alignment)上优于当前最好的 TTV 模型,同时在感知质量与音色可用性上保持竞争力。架构消融给出的证据比较扎实:作者按条件注入位置分 Early / Early-Mid / Late-Mid / Late 四档对比三代架构,最终版 VD-DiT-v3 在声音克隆相似度 SIM-o 上于所有四档都稳定最高(约 0.58),而基线 CapSpeech-NAR 在 Early 档的 WER 高达 0.76、Early-Mid 档 0.20,v3 则把 WER 压在 0.04 附近——说明架构改进的收益主要来自把条件注入做得更鲁棒,而非单纯堆容量。 Ablation study on the model architecture. 批判点评:「优于 SOTA 的 prompt 对齐、竞争力的感知质量」这个表述值得警惕:竞争力通常意味着没有更好。也就是说这套方法换来的是描述控制力,代价可能是音质并未提升。虚构音色靠 DSP 增强构造是个务实的工程解,但增强出来的样本与真实录音在统计上必然有差异——模型学到的「怪物嗓音」有多大程度是在拟合变调伪影而非真正的音色概念,论文没有正面回答,而这直接决定了它在真实创作中够不够用。消融图里 SIM-o 最高约 0.58 这个绝对水平在声音克隆任务里并不算高(专门做克隆的系统通常更高),说明统一模型在克隆这一子任务上确实付了代价。另外情绪、语气这类编辑属性的评测只提到 Style-Acc 一个指标,粒度较粗。 6. AvatarDynamizer:静态数字人补上衣服褶皱 AvatarDynamizer: From Static to Dynamic Human Avatars via Generative Dynamic Textures | 马普信息学研究所、VIA Research Center、EPFL | arXiv:2608.19900 关键词:4D数字人,动态纹理,3D高斯,视频扩散先验,马普所 前序问题:全身数字人要跨过恐怖谷,表面动态是关键——衣服的褶皱、布料的甩动,这些细节缺失时人眼立刻觉得假。但现有两条路各有硬伤:通用方法能从单张图、单目视频或文本提示重建静态 3D 数字人,可它们的动画是骨骼驱动的,衣服跟着骨头刚性变形,没有真实的表面动态;专用方法(为单个人训一套)渲染质量和动态都好,代价是每个人都要一套昂贵的多视角采集。近期的通用动态方法则难以把表面动态嵌进表示里,结果要么多视角不一致,要么动态表现力不足。 本文贡献:核心想法是把「数字人的表面动态」转成「纹理生成问题」,从而可以直接借用预训练视频扩散模型的先验。具体做法:设计一个纹理空间的表面动态嵌入,用编码器-解码器把姿态相关的动态编码进动态纹理图(dynamic texture map)——纹理图是二维的,天然与视频扩散模型的输入格式兼容;解码时再把纹理解成 3D 高斯,由高斯渲染器出图,多视角一致性因此得到保证。整条流水线的输入端很宽:多视角图、单目图、单目视频、文本提示、随机采样、3D 扫描都能作为静态数字人来源,经身份拟合得到身份纹理,再与用户指定动作产生的运动纹理一起送进动态纹理生成器,最后由通用高斯解码器渲染出自由视角结果。由于现有数据集在规模、序列长度或动作多样性上都不够,作者还自采了一个大规模多视角长序列数据集。 Overview. Given a static human avatar reconstructed from multimodal inputs, e.g. multi-view images, we first perform identity fitting to obtain its coarse shape and identity texture. Our Dynamic Texture Generator predicts dynamic texture maps conditioned on identity and novel pose. Then, our Generalized Gaussian Decoder recovers Gaussian splats for faithful and view-consistent renderings. 实验效果:实验表明该方法能给静态数字人赋予可信的表面动态,在视觉保真度上优于同类通用方法,尤其在动态训练数据有限时优势更明显。定性对比图给出的证据比较清楚:以 LHM 和 MV 两种静态数字人来源为起点,逐行对比 Static Avatar、+GAS、+VAP 与 +Ours——前三者在胸前印花和裤腿区域(图中红框)都出现了纹理糊掉或褶皱缺失,本方法(绿框)则保留了印花细节并给出了随姿态变化的布料褶皱,与 GT 行的表现最接近。 Qualitative Comparison on DynaHuman. Given a static avatar reconstructed from a monocular image using LHM or from multi-view images (MV), we compare our method with state-of-the-art generalizable surface dynamics methods. Our AvatarDynamizer produces faithful wrinkles while preserving both 3D geometry and identity consistency. 批判点评:把动态压进纹理空间是个聪明的降维,但它同时划定了能力边界:纹理是贴在几何表面上的,因此这套方法能表达「表面看起来在动」,却难以表达真正需要几何位移的动态——宽松裙摆的大幅甩动、外套的开合、长发的飘动,这些超出纹理可表达范围的情形论文没有讨论。「优于同类通用方法」的对照对象是通用方法,而质量天花板仍是专用方法(per-subject 训练),两者的差距有多大摘要没有交代。另外方法依赖自采的大规模多视角数据集才训得起来,这与「通用、低成本」的初衷之间存在张力——数据成本从推理侧转移到了训练侧,对复现者不算友好。 7. GenRec:该重建的别幻觉该幻觉的别糊 GenRec: Knowing Where to Reconstruct and Where to Generate | 苏黎世联邦理工、Google、Microsoft、KAIST | arXiv:2608.17832 关键词:新视角合成,流匹配,观测掩码,重建与生成分区,ETH 前序问题:从稀疏输入图做生成式新视角合成,本质上是两个性质完全不同的任务混在一起:在某个源视图里可见的像素有唯一正确的值(只受视角相关的着色调制),而落在遮挡区或超出拍摄范围的像素则允许一整个分布的合理补全。现有方法用一个统一的损失同时处理这两种情形,结果是几何保真与创造性幻觉的界限被抹平——即便通过 warp 的点云或投影深度把场景几何注入进去,可见区域该被精确重建的地方也会被生成先验带糊。 本文贡献:GenRec 的做法是把这个分区直接写进架构、监督和梯度流三处。首先由源相机加一个单目深度估计器导出观测掩码(observation mask),明确标出哪些像素是「被看到过的」。主干是一个多视角流匹配模型,同时对 RGB 和场景坐标图(scene-coordinate map)在所有目标视图上联合去噪——两个模态各有编码器,通过跨视角注意力与跨模态注意力交互,解码侧接 LoRA。然后是一个像素空间的精化阶段(重建分支),用稀疏 3D 交叉注意力与自注意力,专门在已观测像素上恢复被 latent 压缩丢掉的高频细节,且不扰动未观测区域的生成先验。关键在于同一个掩码还用来门控监督信号——回归损失被限制在观测区域内,不会污染生成先验;反过来生成损失也不会去干扰该被精确重建的部分。 Overview of GenRec. Given posed input views and target poses, monocular depth and forward warping produce per-target observation masks and warped renders. These condition a (I) multi-view flow matching backbone, which jointly denoises RGB and scene-coordinate latents through cross-view and cross-modal attention. A (II) reconstruction branch then refines only the observed pixels via sparse 3D attention guided by the predicted scene coordinates, while the observation mask gates gradients so the generative prior is preserved in unobserved regions. 实验效果:在 RealEstate10K、DL3DV-10K、Mip-NeRF 360 三个数据集上,单视图外推与双视图插值两种设定下,GenRec 在观测区域取得最好的重建保真度,同时在未观测区域的感知质量上超过纯生成式基线——也就是说没有用一头的退化去换另一头。定性对比中与 Gen3C 的差别很明显:Gen3C 的结果在家具边缘、地面纹理上出现明显的糊化与结构漂移(教室场景的桌椅、客厅场景的家具轮廓都有溶解感),GenRec 则保持了清晰的边界与合理的几何。论文还特意把重建指标分观测/未观测区域分别汇报,而非只给全图平均——这个报法比现有工作更诚实。 Comparative qualitative results. Single-view extrapolation against our strongest baseline, Gen3C. Each row shows the input view, ground-truth target, GenRec, and Gen3C. 批判点评:整套方案的正确性建立在观测掩码的准确性上,而掩码来自单目深度估计器——深度估计在无纹理区、反射面、细结构上的失效是众所周知的,一旦掩码把「其实没看清」的像素标成已观测,回归损失就会强行去拟合一个错误的目标,这类失效模式论文没有展开分析。方法把两条支路、两个模态、两套损失叠在一起,复杂度不低(流匹配主干 + 稀疏 3D 注意力精化 + LoRA),推理开销与训练成本相对单一模型的对照没有交代。评测集中在室内场景为主的三个数据集上,大尺度室外、动态物体等情形未涉及。 8. KeyID:免训练把身份注入到关键帧 KeyID: Decoupled Drafting and Keyframe Editing for Identity-Preserving Video Generation | 广东工业大学(ACM MM 2026) | arXiv:2608.16154 关键词:身份保持,视频生成,免训练,关键帧编辑,ACM MM 2026 前序问题:身份保持视频生成(IPVG)要求合成的视频既忠于参考主体的长相,又贴合文本提示。现有方法两头受限:一类靠微调,调参成本高;一类只在输入层做增强,能力有限。共同的困难是在复杂、长序列动作中维持刚性的身份一致——人一动起来,脸就开始漂。更本质的矛盾是「提示遵循」与「身份保真」之间存在容量冲突:模型的表达能力被两个目标同时争夺,密集的逐帧身份监督会压制动作的自由度。 本文贡献:KeyID 是一个免训练框架,思路是把视频动态的合成与身份的注入彻底解耦成两步。第一步 Reference-Aware Video Generation:先用大语言模型把全局提示扩写成带细节的增强提示,经 T2I 出首帧、ImgEdit 编辑、再由 I2V 展开成视频草稿(并有 Prompt Relay 机制传递时序提示)——注意这个草稿是身份无关(identity-agnostic)的,只对齐多个参考的粗略属性,因此动作可以放开生成。第二步 Identity-Preserved Keyframe Editing:对草稿做分组帧采样挑出关键帧,只在这些稀疏关键帧上做身份修正,再通过运动插值把修正传播到中间帧。从密集的帧级监督换成稀疏的关键帧级精化,容量冲突就被绕开了。模块化设计还带来一个好处:扩展到多主体参考和复杂连续动作不需要额外训练。 Overview of KeyID. (a) Reference-Aware Video Generation. A global prompt, optional temporal prompts, and a face reference are fused by GPT-5 into an enhanced prompt, from which a first frame is generated and optionally edited with non-human objects. The edited frame and the global prompt, along with optional temporal prompts, drive I2V to produce a video draft. (b) Identity Preserved Keyframe Editing. Keyframe windows are uniformly sampled in groups along the video draft, optimal keyframes are selected in keyframe identity refinement, and motion interpolation produces the final temporally coherent video with preserved identity and prompt adherence. 实验效果:自动与人工评测均优于此前工作,并在 ACM Multimedia 2026 IPVG 大挑战赛 Track 2(Sequential Action)中拿到亚军。定性对比里与 Concat-ID、Stand-In 的差距集中在长序列动作上:跑步、足球、医院三组场景中,两个基线在人物快速移动时脸部出现明显变形与身份漂移(足球场景里 Stand-In 的人物在远景中几乎不可辨识),KeyID 则在整段动作里保持了一致的面部特征,同时动作幅度与场景细节(跑道、球场、走廊)都没有被压制。 Qualitative comparison. Four evenly sampled frames are shown for each video. KeyID better preserves identity consistency and prompt adherence across complex actions. 批判点评:免训练是真实优势,但这套流水线的代价是把复杂度转移到了推理链上——LLM 扩写、T2I、ImgEdit、I2V、关键帧编辑、运动插值,六个环节串联,每一环的失败都会传导下去,且整体延迟必然远高于单模型端到端方案,论文没有给出推理成本的量化。稀疏关键帧修正加运动插值的组合在动作平滑时应该工作良好,但在快速非线性运动、遮挡后重现这类情形下,插值能否维持身份一致性是个疑问——而这恰恰是 Track 2「连续动作」最难的部分。竞赛拿的是亚军而非冠军,说明方法仍有明显差距。评测依托竞赛官方基准,跨基准的泛化性未验证。 9. Mise-en-Scène:版式不用预测而是自己长出来 Mise-en-Scène: Implicit Layout Emergence in Diffusion Transformers for Human-AI Design Co-Creation | Canva Research(ECCV Human-AI Co-Creation Workshop 最佳论文) | arXiv:2608.19000 关键词:版式生成,平面设计,隐式布局,LoRA,Canva 前序问题:从用户给定的素材自动做平面设计,要同时满足两件互相拉扯的事:整体构图协调,以及每个素材被精确保留(logo 不能变形、文字不能糊)。现有做法是先用语言模型预测显式的边界框坐标,再把素材贴进去。这种「先规划再合成」的分离带来两个后果:布局与视觉呈现脱钩,生成的构图往往僵硬、缩放失当;而且产物是一张扁平的图,设计师没法继续改。 本文贡献:作者换了个问法:布局能不能在一个预训练的图像编辑扩散 Transformer 内部隐式地涌现出来?两阶段实现。第一阶段用一个经过 knockout 筛选的小 LoRA 适配预训练 DiT,让它直接起草一份完整设计——元素的排布与渲染出的画布是联合涌现的,而不是先定坐标再填充。输入侧文本简述过文本编码器,背景图与各个元素分别过冻结的 VAE,所有 token 拼接后进 DiT 块栈。草稿里的文字和 logo 会有可见的失真,但位置关系是对的。第二阶段是确定性的 match-and-place:借一个 VLM grounder 逐个定位草稿中的元素位置,再把原始高分辨率素材搬到对应位置——这一步保证了素材的像素级保真,且产物是可编辑的分层设计而非扁平图,设计师能接着改。作者特别强调,对预训练 Transformer 做最小适配就够了,不需要多元素生成任务里常见的那套专门的条件注入机制。 Mise-en-Sc`ene. The method runs in two stages. In Stage~1 (simplified layout generation), a text brief, a background canvas, and the visual elements are mapped by frozen encoders into a joint token sequence and processed by a flow-matching Diffusion Transformer adapted only through a knockout-selected LoRA, which produces a layout-aware draft design. Because the draft comes from stochastic sampling, it still contains rendering artifacts such as distorted text and warped logos. In Stage~2 (deterministic match-and-place), a VLM grounder locates each original element in the draft independently, and the original high-resolution layers are alpha-composited at the grounded boxes to yield the final design, which keeps the emergent layout while restoring exact, pixel-faithful, editable assets. 实验效果:在大规模 PrismLayersPlus 基准上,Mise-en-Scène 生成的设计在感知质量上最接近真值,且大幅领先 LLM 版式规划器与专用版式 Transformer 两类方法;match-and-place 阶段把剩余的保真度差距也补到了接近真值合成图的水平。消融数据佐证了第二阶段的必要性:直接对扩散草稿而非 match-and-place 合成结果打分,会让 Qwen3-VL 上的美学保真度差距 |ΔGT| 从 0.046 恶化到 0.248。定性对比中与 FlexDM、LaDeCo 的差别很直观——两个基线普遍把元素缩得过小或叠在一起(FlexDM 尤其明显,文字常糊成一团),本方法的排布则接近 GT 的构图逻辑。 Qualitative comparison on the PrismLayersPlus test set. Each row shows, from left to right, the input design elements provided without spatial context, followed by the composites from FlexDM, LaDeCo, our Mise-en-Sc`ene, and the ground truth. Every method is rendered from its own predicted layout; our column is the match-and-place output. Our designs follow the ground-truth arrangement most closely; see text for a per-row discussion. 批判点评:第二阶段能保证素材保真,但它同时暴露了第一阶段的局限:草稿里文字和 logo 是失真的(框架图里明确标注了 text distortion、brand/logo distortion、detail inconsistency 三类问题),也就是说 DiT 学到的其实是「大致该放哪」而非真正理解了排版规则,match-and-place 是必要的补丁而非可选增强——一旦草稿里某个元素的位置判断错了,第二阶段只会把原始素材精确地搬到一个错误的位置上。评测的主指标是与真值的感知接近度,这个口径隐含假设了 PrismLayersPlus 的真值就是好设计,但平面设计本身允许多解,「接近真值」和「设计得好」并不等价,而论文没有人工设计师的偏好评测。另外基准单一,元素数量、语种、画布比例的覆盖范围未交代。 10. BeyondMasks:删掉物体也要删掉它的影子 BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal | Bilkent 大学、Koç 大学、Hacettepe 大学(ECCV 2026) | arXiv:2608.20107 关键词:视频物体移除,因果一致性,评测基准,VLM评测,ECCV 2026 前序问题:生成式视频模型让物体移除的视觉真实度大幅提升,但评测协议还停在「掩码区域像素保真度」上,本质上把移除当成了局部修补。现实场景里移除一个物体是一次因果干预:抹掉物体本身之外,它引起的物理效应——影子、反光、光照变化、半透明遮挡、以及运动留下的痕迹——也必须一并消除。而这些效应恰恰落在掩码之外,现有指标完全看不到。现有基准要么没有对齐的干净参考,要么局限于简化的合成设定,无法系统评估因果一致性。 本文贡献:BeyondMasks 是一个配对基准:提供时序对齐的合成与真实视频对,每对都带干净背景参考。构造方式是反向的——先有干净背景,再插入物体与其应有的效应,从而天然拿到对齐的「移除前/移除后」真值:合成侧用 Veo 3 生成背景视频再插入物体与效应(90 条),真实侧用三脚架实拍背景再通过受控编辑引入目标物体(90 条)。数据覆盖光度、几何、体积、动态四类交互,标注上刻意只给「物体本体」的二值掩码而不标注次生效应,逼模型自己去推理该消除什么。作者还整理了次生效应的分类体系并给出各类样本数(影子 127、反光 61、半透明 46、水汽 20、光源 38、随意痕迹 37)。配套提出 CORE,一个基于视觉语言模型的结构化评测协议,同时度量物体消失程度与次生效应一致性,与人类判断的吻合度高于现有指标。 Overview of the BeyondMasks construction pipeline. Top: Paired intervention-based generation, where an object-present video is derived from a clean background video, ensuring temporal alignment. Bottom: Representative categories of object-induced causal after-effects, including illumination, reflection, volumetric, and dynamic interaction effects. 实验效果:对当前最好的方法做基准测试后暴露出系统性失效:掩码区域保真度很高,但次生效应普遍没被移除——视觉上的合理性与因果上的正确性之间存在明确的鸿沟。定性结果把这个鸿沟量化得很清楚:三组场景(结冰湖面的倒影、木板上的杯子阴影、路面上的瓶子与其投影)里,ProPainter 与 Minimax 的 LPIPS 分数与最好的方法几乎持平(0.065~0.098 区间,差异极小),但 CORE 的两项打分差距明显——ProPainter 的 CORE-AES 只有 1~2 分,Rose 能到 4~5 分;肉眼看图也能确认前两者留下了明显的残影与阴影残迹。也就是说 LPIPS 这类指标对次生效应几乎不敏感,换个指标才能把差距照出来。 Pixel metrics fail to capture causal correctness. Although LPIPS scores are similar across methods, their ability to remove object-induced effects (e.g. shadows or reflections) differs substantially. CORE separates these failure modes by evaluating object removal (CORE-OS) and elimination of causal after-effects (CORE-AES). $\downarrow$ better for LPIPS; $\uparrow$ better for CORE scores. 批判点评:180 条视频(合成 90 + 真实 90)的规模对一个基准来说偏小,各效应类别的样本数更少(水汽只有 20 条),据此得出的类别级结论统计强度有限。合成侧用 Veo 3 生成背景再插入物体,这引入了一层生成模型自身的偏置——被评测的方法与构造数据的模型属于同一技术谱系,是否存在系统性的相互适配值得警惕。CORE 依赖 VLM 打分,而 VLM 对影子、反光这类细微物理线索的敏感度本身就是个未知量,论文虽报告了与人类判断的吻合度更高,但「更高」的基线是本就不敏感的 LPIPS,这个对照并不严格;用 VLM 评测生成结果也天然继承了 VLM 的失效模式。作为纯评测工作,它指出了问题却没有给出改进移除方法的方向。 趋势观察 奖励对齐的失效终于被写成了数学 — 过去一年大家都在抱怨「奖励劫持」:模型学会了讨好打分器,图却越来越怪。今天快手可灵与西湖大学合作的 ThermoDPO 第一次把这件事在流匹配框架里形式化了——他们定义了「流形漂移」(manifold drift)这个概念,并证明只要偏好更新引起的终点位移带有非零法向分量,采样结果就必然离开预训练数据流形。换句话说,奖励劫持不是调参没调好,而是把 DPO 直接搬到连续时间动力学上时的结构性后果。这个视角的价值在于它把一个玄学问题变成了可度量的量:论文用「重建距离」作为流形距离的代理,于是「有没有漂移」可以被直接监控,而不是等到生成结果看起来不对才回头查。今天另一篇 BeyondMasks 走的是同一条路的另一半——它说视频物体移除的评测一直在算掩码区域的像素误差,可现实中删掉一个物体还要删掉它的影子、反光和水汽,这些恰恰落在掩码之外。两篇论文一个从理论、一个从评测,指向同一件事:生成模型的对齐问题正在从「效果好不好」进入「我们究竟在优化什么」的阶段。 加速的粒度从「步」下探到「token」 — 扩散模型加速的主流路线过去是减步数(蒸馏)、缓存特征(TeaCache 一类)、或者降精度(量化)。上交与阿里云的 AViTS 在今天给出了一个正交的第四条:动态分辨率采样时,不要把所有 latent token 一起升采样。它用「latent 与文本的注意力」度量空间重要性、用「token 特征跨时间步的变化量」度量时间重要性,融合后只对关键 token 优先做分辨率精化,其余延后。在 Qwen-Image-Edit 和 FLUX.1-Kontext-dev 上拿到接近 9 倍 FLOPs 削减,叠加蒸馏模型后到 14.76 倍。值得注意的是作者明确强调这条路与蒸馏、量化、特征缓存正交——这意味着推理加速正在从「选一条路线」变成「几条路线叠乘」,而叠乘的前提是每条路线作用在不同的冗余维度上。AViTS 挖的是空间分辨率这一维,此前基本没人系统做过。 音频侧的改造正在变得越来越「轻」 — 今天有三篇论文都在音频生成上,但共同点不是模型更大,而是改动更小。Kandinsky Lab 的做法最极端:给一个文生音视频模型加声音克隆能力,只需在音频主干上加一个零初始化的线性层,短周期微调即可,且因为零初始化,增强后的模型起点就是原模型的功能副本,不破坏已有能力。副产品是推理时可以只跑音频路径而跳过视频路径,拿到约 30 倍加速。快手可灵的 SingDance 也是类似哲学——它没有为「唱跳」这个新任务收集数据(Song/Source 这个目标配置在训练时从未出现过),而是把发声主体建模成一个语义角色(source 或 listener),让训练时分别学到的「发声」与「随歌跳舞」两种能力在推理时组合起来。这种「靠结构设计换数据」的思路在数据获取越来越贵的今天格外有价值。 人工智能炼丹君 整理 | 2026-08-24 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月24日
40 阅读
0 评论
0 点赞
2026-08-23
AIGC 周末专题|2026-08-23|3DGS工程化转折:传得动跑得起管得住
AIGC 周末专题深度解读:3DGS 的工程化转折:从「重建得出来」到「传得动、跑得起、管得住」 人工智能炼丹君 整理 | 2026年8月23日(周日) 覆盖时间:2026-08-16 ~ 2026-08-22 本期概述 本期 AIGC 周末专题聚焦3DGS 的工程化转折:从「重建得出来」到「传得动、跑得起、管得住」方向,精选 7 篇代表性论文进行深度解读。 方向分布: 动态场景流式传输与存储压缩 2 篇 (S2GS, QuARC-GS) 边缘设备与 VR 实时渲染的系统级加速 1 篇 (MetaSapiens-v2) 把 3DGS 转成生成模型可用的结构化隐空间 1 篇 (GS-Voxel) 语言可查询的实例级场景理解 1 篇 (GroupForward) 物理采集缺陷的成像模型修正 1 篇 (RS-Avatar) 版权保护与原生水印 1 篇 (NGS-Marker) 含 ICLR 2026 × 1、阿里高德 × 1、Max Planck / EPFL × 1、上海AI Lab × 1、港理工 × 1 技术路线与时间线 质量竞赛期(2023.07 — 2024.06) 描述:3DGS 问世后,主线是在标准基准上刷 PSNR 与训练/渲染速度。部署问题被写在 Limitation 段落里。 关键节点: 2023.07:3D Gaussian Splatting:显式高斯 + 光栅化,实时新视角合成 2023.10:4DGS / Deformable-GS:把 3DGS 扩展到动态场景 2024.02:Scaffold-GS:锚点式层次组织,为后续压缩打下结构基础 2024.06:3DGStream:在线动态流式重建的早期尝试 压缩与部署萌芽(2024.07 — 2026.03) 描述:研究者开始正视存储与算力开销,压缩、剪枝、量化成为独立课题;同时语义 3DGS 与前馈 3DGS 让场景可被语言查询。 关键节点: 2024.09:LangSplat / 语义 3DGS:给高斯挂语义特征支持语言查询 2024.12:QUEEN:动态高斯流式重建的强基线,本期两篇的对比对象 2025.05:前馈 3DGS(pixelSplat / MVSplat 系):稀疏视角直接预测高斯 2026.01:TRELLIS 类结构化隐空间三维生成兴起,为 GS-Voxel 铺路 工程化转折(2026.08) 描述:本期集中出现的七篇标志着关注点全面转向部署:边缘设备、VR 头显、生成隐空间、语言查询、成像缺陷、版权保护。稀疏化与结构化成为共同手法。 关键节点: 2026.08.21:S²GS:结构化稀疏门控,Jetson 上 60+ FPS 2026.08.20:QuARC-GS:量化锚点残差,每帧存储压到 1/11 2026.08.19:MetaSapiens v2:注视点渲染 + 加速器,平均 30.9× 2026.08.19:GS-Voxel:免拟合结构化隐空间,城市级 3DGS 生成 2026.08.18:GroupForward / RS-Avatar / NGS-Marker:查询、成像、版权三个新维度 1. S²GS:结构化稀疏高斯流,让自由视点视频在 Jetson 边缘设备上跑到 60+ FPS:港理工把每帧优化时间砍掉 59%、存储砍掉 85%,还搭了一套物理远程呈现测试台 论文: S²GS:结构化稀疏高斯流,让自由视点视频在 Jetson 边缘设备上跑到 60+ FPS arXiv: 2608.19639 机构: 香港理工大学 关键词: 自由视点视频, 动态3DGS, 流式传输, 可微稀疏门控, 边缘设备 1.1 研究动机 核心问题: FVV 流式重建的每帧优化时间与存储占用都超出边缘 IoT 设备能力,根因是把每帧当独立场景重建、为静止区域反复存完整高斯参数 自由视点视频(FVV)的流式重建是远程呈现、数字孪生可视化这类沉浸式 IoT 服务的底层能力:观众能自由改变视角,而画面是实时从多相机流重建出来的。问题在于现有方法的两项开销都卡在边缘设备的能力之外——每帧的优化时间太长(来不及跟上采集帧率),存储占用太大(传不动)。这两项开销同源:把每一帧都当作一个独立的场景来重建,为大量实际静止的区域反复存储完整的高斯参数。要让 FVV 真的跑在 Jetson 这类资源受限的边缘 IoT 设备上,就必须找到一种只更新「真正在动」的那部分的机制,而且这个机制自身的判断开销不能高。 前序工作及局限: 3DGStream / QUEEN:已引入逐帧增量更新,但更新决策靠人工阈值,稀疏化不进优化目标 Scaffold-GS 锚点表示:提供了层次组织基础,但未用于时序稀疏决策 与前序工作的本质区别: 空间用流式八叉树捕捉相关性,时间用 HFP + Gumbel-Sigmoid/ML-STE 把动态线索离散化为可微的稀疏更新掩码,前向硬稀疏、反向梯度可穿 1.2 方法原理 Overview of the proposed S²GS framework. (a) The streaming octree representation is initialized using root Gaussian primitives from the first frame and subsequently represents FVVs with multi-resolution grids, enabling hierarchical allocation of Gaussian residuals and efficient point queries for FVV streaming. (b) A structured gating mechanism is introduced to induce sparse Gaussian residual updates through hierarchical feature propagation, differentiable sampling with Gumbel-Sigmoid, and multi-level (ML) discretization using a straight-through estimator (STE). (c) A sparse regularization loss is incorporated to enable efficient end-to-end optimization of structured gates and sparse residual updates. S²GS 要回答的问题是「哪些高斯值得更新」,而它的答案分两层。第一层是空间结构:单个高斯的运动是孤立信号,噪声大且无法泛化,而流式八叉树把邻近高斯组织成层次结构后,「这一整块区域在动」这个判断远比「这一个点在动」稳健。层次特征传播就是沿这个结构把动态线索从叶节点汇聚到根节点。第二层是可微决策:过去的做法是拿动态置信度过一个人工阈值,问题是阈值不参与优化,选错了只能手调。S²GS 把置信度先过一个可学习的软门控得到连续值,再用 Gumbel-Sigmoid 加多级直通估计器把它变成 0/1 硬掩码——前向是硬稀疏(真的省算力和存储),反向梯度能穿过(决策边界被光度损失和稀疏正则共同塑形)。多级离散方案则是在纯二元门控之上补一层细粒度:不只是「更不更新」,还能表达「更新多少」,避免细微动态被一刀切掉。最终每帧只需解码被选中锚点的残差增量,与基底相加即得当前帧场景。 1.3 核心创新 提出 Structured Sparse Gaussian Streaming(S²GS),核心思路是利用结构感知的时序稀疏性来选择性地更新高斯残差。它把稀疏化拆成空间与时间两个维度分别处理:空间上用流式八叉树(streaming octree)把高斯残差按层次组织起来,捕捉空间相关性以指导更新;时间上设计一套结构化门控机制(structured gating),由层次特征传播(HFP)加 Gumbel-Sigmoid 采样组成,把层次化的动态线索转换成稀疏的残差更新决策,并且整个决策过程在可微优化框架下完成。此外用多级离散方案(multi-level discrete scheme)对残差更新做更细粒度的控制,避免稀疏化损失精细的动态细节。 1.4 实验结果 Trend comparison of PSNR, storage cost, training time, and rendering throughput for S²GS-full and QUEEN-l on the Vrheadset scene from the Meet Room dataset. The triangle ($\blacktriangle$) denotes the metric value at the first frame. 在消费级 GPU、工业级边缘 IoT 设备与一套物理远程呈现测试台三类环境上做了实验。RTX 4090 上相比 QUEEN,每帧优化时间减少 59%,存储成本减少 85%;论文给出的逐帧曲线显示 S²GS-full 在 300 帧上 PSNR 稳定在 32.0 dB 左右,高于 QUEEN-l 的 31.2 dB,同时存储从 7.48 MB 降到 4.59 MB、训练时间从 88.67 秒降到 25.05 秒(首帧),渲染帧率也整体高于 QUEEN。在 Jetson AGX Orin 上,S²GS 在所有被评测方法中取得最高渲染吞吐(60+ FPS)与最低能耗。实验还包含光照变化与设备拔插等扰动场景。项目主页、代码与补充材料均已公开。 1.5 关键洞察 测试序列长度与真实会话时长差距大 — 论文的逐帧曲线做到 300 帧量级,而远程呈现的真实会话是几十分钟量级。残差结构的稳定性关键取决于基底帧能撑多久——误差是否沿残差链累积、需不需要周期性重设基底,在数百帧的窗口里看不出来 与 QuARC-GS 等同期压缩工作无法直接比较 — S²GS 报的是相比 QUEEN 的相对提升(存储 -85%),同期 QuARC-GS 报的是每帧存储压到 SOTA 的 1/11,两者基线、数据集与画质工作点都不同。动态 3DGS 流式传输已有足够多工作,却缺一条公认的率-失真曲线,读者无法判断孰优 门控机制自身的开销未单独拆解 — HFP 沿八叉树做层次传播、Gumbel-Sigmoid 采样、多级离散化都是额外计算。论文报告了总体优化时间的下降,但没有把「门控判断本身花了多少」从「因稀疏而省下多少」中拆开,无法判断这套机制在更小的模型或更弱的设备上是否仍然划算 技术演进定位: 首个在边缘 IoT 设备与物理远程呈现测试台上完成端到端验证的动态 3DGS 流式方案 可能的后续方向: 基底帧重设策略自适应化,支撑分钟级以上长会话 与神经视频编码的率-失真框架对齐,给出可比的 BD-rate 门控决策与传输侧带宽自适应联合优化 2. QuARC-GS:量化锚点残差编码,把动态场景每帧存储压到 SOTA 的 1/11:用一个规范帧加高度压缩的逐帧残差,量化感知的锚点变形抑制无意义运动更新 论文: QuARC-GS:量化锚点残差编码,把动态场景每帧存储压到 SOTA 的 1/11 arXiv: 2608.18285 机构: 美国杜克大学(Duke University)等 关键词: 动态场景压缩, 量化感知训练, 锚点残差编码, 变化门控致密化, 率-失真 2.1 研究动机 核心问题: 在线 FVV 流式传输中,详细场景表示的存储需求与在线场景的速度需求互相拉扯,逐帧表示存在大量运动冗余与外观冗余 NeRF 与高斯泼溅在新视角合成上已经能从任意角度渲出高质量画面,也被扩展到了动态三维场景。但要做可持续的在线自由视点视频流式传输——尤其是较长的视频——仍然困难:详细的场景表示带来巨大的存储需求,而在线场景又要求足够快的重建与渲染速度。这两个约束互相拉扯:为了压缩存储就要简化表示,简化表示又会掉画质或拖慢重建。问题的症结在于逐帧表示中存在大量冗余——运动上的(大部分锚点其实几乎不动)、外观上的(静止区域被反复致密化)。 前序工作及局限: QUEEN / ReCon-GS / 3DGStream:在线动态高斯流式重建,但存储仍在数百 KB 到数 MB 量级 4DGC / ComGS:已做动态高斯压缩,但量化多为训练后处理,掉画质 与前序工作的本质区别: 量化进入优化循环(量化感知),网络主动把变形往格点靠;致密化判据从视空间梯度大小改为梯度差分,静止但纹理复杂的区域不再被反复致密化 2.2 方法原理 Overview of QuARC-GS for online FVV: (a) QuARC-GS starts with a base 3DGS from multi-view images at $t=0$ optimized with noise injection. This canonical 3DGS will be causally transformed to represent the scene at subsequent time points ($t>0$). (b) Following, QuARC-GS takes advantage of a hierarchical anchor-based representation of the deformation of the Gaussian 6D poses ($\delta_r, \delta_t$). Our insight was to quantize these deformations, resulting in a large number of static anchors thereby delivering substantial storage savings. (c) Complementarily, QuARC-GS includes a novel module that stems growth in number of Gaussians based on view-space gradients, resulting in storage savings. (d) The quantized anchor residuals and incremental Gaussian attributes are used to warm-start the next frame, or entropy-coded and transmitted to enable FVV. QuARC-GS 的两个模块各自针对一类冗余。运动冗余的处理是量化:动态场景中锚点的变形量分布是长尾的——绝大多数锚点的变形接近零(对应静止区域),少数锚点有显著变形。论文的变形直方图清楚展示了这一点。既然如此,用固定步长 Δ 做量化就能自然地把长尾的零附近部分压成 0,静态锚点因此完全不占存储,而真正有大变形的动态锚点仍被保留下来。这里的巧妙之处是「量化感知」——量化被放进优化循环,网络在训练时就知道自己的输出会被离散化,因此会主动把变形往量化格点上靠,而不是训练完再截断(后者会掉画质)。外观冗余的处理是门控致密化:标准 3DGS 的致密化靠视空间梯度大小判断哪里需要更多高斯,但在动态场景的流式设定下,一个静止但纹理复杂的区域每帧都会有大梯度,于是每帧都被致密化一次,纯属浪费。QuARC-GS 改用视空间梯度与高斯位置梯度的差分作为判据,这个量只在内容真正发生时序变化时才大,静止区域即使纹理复杂也不会触发。 2.3 核心创新 提出 QuARC-GS(Quantized Anchored Residual Coding Gaussian Streaming),一个量化感知的 4D 场景优化框架。整体结构是「单个规范帧 + 高度压缩的逐帧残差」,压缩由两个互补策略完成。第一是量化感知的锚点变形(quantization-aware anchor deformation):把全精度变形量按步长 Δ 量化,抑制掉不显著的运动更新,同时保留有意义的变形,从而在低存储的流式约束下维持重建质量——关键在于「量化感知」,即量化不是训练后的后处理,而是进入优化目标的。第二是变化门控的致密化(change-gated densification):只在真正表现出时序变化的区域分配新高斯,用视空间梯度差分作为判据,从根本上消除冗余的外观更新。 2.4 实验结果 Rate-distortion comparison on N3DV. QuARC-GS streams dynamic scenes at a fraction of the per-frame storage of recent online methods (ReCon-GS$\dagger$, QUEEN, ComGS, 4DGC, 3DGStream$\dagger$) and the offline 4DGS, while matching their rendering quality. Methods marked with $\dagger$ are reproduced by us in the same environment. 在常用动态场景数据集上,QuARC-GS 在保持有竞争力的重建质量与训练速度的同时,把每帧存储相比 SOTA 削减最多 11×。论文的率-失真散点图(横轴存储对数刻度、纵轴 PSNR、点大小表示训练时间)显示:QuARC-GS 位于约 32.16 dB / 30~40 KB 的位置,而 QUEEN-l 与 ReCon-GS 在相近画质(32.19 / 32.15 dB)下需要 500~800 KB,4DGS 约 300 KB 且仅 31.36 dB,3DGStream 更是要 8000 KB 量级。虚线显示的是 QuARC-GS 自身在不同工作点上的率-失真轨迹,最低存储点约 18 KB 时仍有 31.90 dB。论文含 9 页正文、5 张图、3 张表。 2.5 关键洞察 量化步长 Δ 的选择准则缺失 — 整个方法的压缩率由步长 Δ 直接决定——Δ 越大压得越狠、掉的动态细节越多。论文展示了不同工作点的率-失真轨迹,但没有给出「给定目标码率或目标画质时该怎么选 Δ」的可操作准则,实际部署时仍需人工扫参 变形分布的长尾假设对剧烈运动场景可能失效 — 量化能大幅压缩的前提是变形分布集中在零附近。这个假设在大多数区域静止的场景(会议室、单人表演)成立,但在整体镜头运动或大范围场景变化时,几乎所有锚点都有显著变形,量化的收益会急剧下降。论文未报告这类场景的结果 与同期 S²GS 的定位重合但无相互比较 — 同一周的 S²GS 也是「基底 + 稀疏残差 + 可学习稀疏决策」,两者在思路层面高度同构,QuARC-GS 用量化实现稀疏、S²GS 用门控实现稀疏。二者互不引用(时间上不可能),但这也说明领域缺一个统一基准:11× 与 85% 无法互相换算 技术演进定位: 把量化感知训练从网络权重迁移到高斯变形参数的首个动态 3DGS 压缩方案 可能的后续方向: 量化步长按内容自适应或按目标码率反解 与神经熵编码模型联合优化,进一步压缩残差码流 扩展到镜头大幅运动、变形分布不再长尾的场景 3. MetaSapiens v2:注视点感知剪枝加立体扭曲,VR 实时神经渲染平均加速 30.9×:罗切斯特大学与上交联手,把渲染管线一路做到加速器硬件设计 论文: MetaSapiens v2:注视点感知剪枝加立体扭曲,VR 实时神经渲染平均加速 30.9× arXiv: 2608.17969 机构: 罗切斯特大学(University of Rochester), 上海交通大学 关键词: 点基神经渲染, 注视点渲染, VR/AR实时渲染, 硬件加速器, 立体扭曲 3.1 研究动机 核心问题: VR/AR 设备算力功耗受限且双眼渲染需求翻倍,而现有 PBNR 按同一质量渲染全画面,把算力浪费在人眼外围视野看不清的区域 点基神经渲染(Point-Based Neural Rendering, PBNR)正在渗入社会各个方面,背后是 AR/VR 与数字孪生对实时照片级渲染日益增长的需求。但在 VR/AR 设备上实现实时 PBNR 非常困难:这类设备算力与功耗都受限,而 VR 需要双眼各渲一遍,算力需求直接翻倍。更关键的是,现有方法把整个画面按同一质量标准渲染,完全没有利用人类视觉系统的一个基本事实——人眼在外围视野的视锐度(visual acuity)远低于中央凹(fovea)区域,把算力均匀撒在整幅画面上,本质是把大部分算力浪费在了人眼根本看不清的地方。 前序工作及局限: MetaSapiens v1:首次尝试注视点 PBNR,但未处理双目冗余与负载不均衡 传统注视点渲染:在光栅化中成熟,但迁移到连续跨 tile 的高斯图元会产生衰减伪影 神经渲染加速器(NeuRex / GSCore 等):为渲染定制硬件的先例,但未考虑 FR 场景 与前序工作的本质区别: 四项组合:以渲染速度为目标的效率感知剪枝、配套高效图元的 PBNR 注视点渲染、双眼选择性扭曲复用、以及解决 FR 负载不均衡的双目加速器设计 3.2 方法原理 The overall architecture design. The the basic pipeline is similar to that of GSCore, a recent PBNR accelerator. We augment the baseline to support FR (yellow-colored) and warping (pink-colored), and to address the workload imbalance issue in PBNR/FR (blue-colored). MetaSapiens v2 的思路是把「人眼看不清的地方少算」这一原则贯穿算法与硬件两层。算法层的关键洞察是:注视点渲染在传统光栅化里很好做(外围降分辨率即可),但在 PBNR 里不好做——高斯图元是连续的、跨 tile 的,简单降分辨率会导致外围出现明显的高斯衰减伪影(论文给出了 falloff 在 1/8/128 三档下的对比图)。因此它设计了配套的高效图元表示,让外围质量的下降平滑可控。效率感知剪枝则把「剪掉哪些高斯」的目标从传统的重建误差换成渲染速度,因为这两者并不等价——一个图元的重要性与它的渲染开销无关。硬件层要解决的是 FR 引入的新问题:注视点区域图元密集、外围稀疏,各 tile 的工作量差异巨大,通用 GPU 的调度会因此严重欠载。加速器用 Tile Merge Unit 做 tile-point 累加与 tile ID 重分配来均衡负载,用 FoV Filter 在投影阶段就把无贡献图元挡掉,用专门的 Warping Unit 承担双目复用。整条管线用行缓冲与双缓冲把 DRAM 访问收敛成流式模式。 3.3 核心创新 提出 MetaSapiens v2,在保持人类视觉质量的前提下实现 VR/AR 设备上的实时神经渲染,由四项技术组合而成。第一是效率感知的剪枝(efficiency-aware pruning),直接以渲染速度为优化目标裁剪高斯图元。第二是面向 PBNR 的注视点渲染(Foveated Rendering, FR)方法,配一种高效的图元表示,利用人眼外围视野的低视锐度放松该区域的渲染质量以换取速度。第三是选择性扭曲(selective warping):利用双眼画面之间的冗余,一只眼的渲染结果经扭曲复用到另一只眼,减少双目渲染的计算开销。第四是一套面向双目注视点渲染的加速器设计,解决 FR 下 PBNR 特有的负载不均衡(load imbalance)问题,并在硬件层面支持扭曲操作。 3.4 实验结果 Performance and energy comparison of different accelerator variants. 论文报告 MetaSapiens v2 相比现有 PBNR 模型取得一个数量级(order of magnitude)的加速,同时保持视觉质量。加速比柱状图显示,在 Mip-NeRF360 等九个场景上,MetaSapiens 基线平均 18.5×,加上 Tile Merge 与负载均衡(TM+LB)后 20.9×,完整的 MetaSapiens v2 达到平均 30.9×;单场景最高为 Flowers 的 40.1×,最低为 Playroom 的 20.9×。论文含 14 页正文、20 张图、2 张表,另有能耗对比、PSNR-FPS 权衡曲线、主观实验与 GPU 消融等结果。 3.5 关键洞察 「保持视觉质量」的判据与注视点渲染的本质冲突 — 注视点渲染的核心就是主动放弃外围视野质量,而 PSNR/SSIM 这类全画面均值指标恰恰无法反映这种取舍是否被人眼察觉。论文做了主观实验,但样本规模、被试人数与统计显著性在摘要层面看不到,这是该方向的通病 注视追踪误差的鲁棒性未讨论 — 整套方法的前提是知道用户当前注视点在哪。真实 VR 头显的眼动追踪存在延迟与角度误差,一旦注视点估计偏离,被降质的外围区域会落进中央凹——这是注视点渲染最典型的失效模式,摘要与图表清单中未见对应实验 加速比含硬件加速器贡献,与纯软件方法不可直接比较 — 30.9× 的平均加速包含了专用加速器设计的收益,而对比基线是运行在通用硬件上的 PBNR 模型。这个比较对说明「软硬协同的上限」有价值,但读者容易误读为算法层面的改进幅度,论文需要更清晰地拆分两部分贡献 技术演进定位: 首个覆盖算法到加速器硬件的双目注视点 PBNR 系统 可能的后续方向: 与眼动追踪联合设计,容忍注视点估计延迟与误差 注视点感知剪枝从离线预处理改为运行时动态调整 扩展到动态场景与 4D 高斯的注视点渲染 4. GS-Voxel:免拟合结构化隐空间,让预优化好的 3DGS 直接进生成模型:阿里高德联合浙大北大,从卫星图生成城市级航拍 3DGS 场景 论文: GS-Voxel:免拟合结构化隐空间,让预优化好的 3DGS 直接进生成模型 arXiv: 2608.17988 机构: 阿里高德(Amap, Alibaba), 浙江大学, 北京大学 关键词: 结构化隐空间, 3DGS生成, 因子化VAE, 流匹配, 城市级场景 4.1 研究动机 核心问题: 可扩展三维隐空间生成器都在结构化张量上工作,而预优化 3DGS 是无序、空间不规则、图元数量差异极大的,两者结构性错配 可扩展的三维隐空间生成器基本都在结构化张量上工作——这是卷积、注意力这套工具链的前提。但预优化好的 3DGS 重建恰恰相反:它是无序的(高斯之间没有固定顺序)、空间不规则的(分布随场景内容变化)、图元数量差异极大的(一个场景几万,另一个几百万)。这个错配意味着,过去几年积累的海量 3DGS 重建资产无法直接喂给生成模型。已有的做法是为每个场景做额外的拟合优化(fitting)把它转成规则表示,但这在大规模场景上代价高得不现实。 前序工作及局限: TRELLIS 类结构化隐空间三维生成:确立了稀疏体素隐表示范式,但输入不是既有 3DGS 重建 逐场景拟合式转换:可把 3DGS 转成规则表示,但大规模场景上代价不现实 与前序工作的本质区别: 确定性、免逐场景优化的体素化(TopK 不透明度排序建立顺序、保留子体素偏移守住几何精度、8-bit 量化控数值范围),再用 GS 专用因子化 VAE 分路编码几何与属性,隐容量随占据体素数增长 4.2 方法原理 Deterministic conversion from a compatible pre-optimized 3DGS reconstruction to GS-Voxel. GS-Voxel 的核心是「怎么把无序点集变成规则张量而不丢关键信息,且不做逐场景优化」。它的三步是结构化、量化、因子化编码。结构化解决顺序问题:体素内的高斯按不透明度降序取 TopK 后拼接,这给了一个确定性的顺序(不透明度是内容属性,不依赖存储顺序),不足 K 个就零填充,低不透明度的直接过滤——后者本身也是有效的稀疏化,因为几乎透明的高斯对渲染贡献极小。子体素位置的保留很关键:如果只记录体素索引,高斯就被量化到体素中心,几何精度会大幅下降;保留体素内偏移则让精度不受体素分辨率限制。量化把五类属性(位置、尺度、不透明度、颜色、旋转)各自归一到合适区间后压到 8-bit,这一步让隐空间的数值范围可控。因子化编码是针对 3DGS 特性的设计:体素几何(哪些格子被占据)与高斯属性(每个格子里的高斯长什么样)是两类性质完全不同的信息,混在一个 VAE 里编码会互相干扰,分开编码则各自可用更合适的归纳偏置。最终隐表示的容量随占据体素数增长,这让大场景不必被固定的图元预算截断。 4.3 核心创新 提出 GS-Voxel,一个免拟合(fitting-free)的结构化隐空间框架,并在大规模航拍三维高斯场景生成上做了验证。它把兼容的预优化 3DGS 重建确定性地转换为稀疏活跃体素,不需要任何逐场景优化,同时保留被选中图元的子体素位置(sub-voxel position)与渲染属性。随后用一个 GS 专用的因子化 VAE(factorized VAE)分别编码体素几何与局部高斯属性,得到稀疏三维隐表示——关键性质是隐表示的尺寸随被占据体素数增长,而不是被一个全场景固定的图元数上限卡住。在 GS-Voxel 隐空间中训练图像条件的流模型来生成航拍 3DGS 场景,并用重叠感知的分块推理(overlap-aware tiled inference)把合成范围扩展到超过单个训练裁剪块的大面积场景。 4.4 实验结果 Large-area 3DGS generation (2/2). Overlap-aware tiled inference produces a large-area 3DGS primitive set from the satellite-view condition. 论文展示 GS-Voxel 能为预优化的航拍 3DGS 重建提供结构化隐表示,且隐容量随占据体素数增长。最直观的成果是大面积场景生成:论文给出的城市生成结果显示,由卫星视角图像条件生成的街区级 3DGS 场景包含完整的路网、行道树、建筑屋顶细节(含屋顶太阳能板、停车场车辆、环形交叉口的彩色路面标识),并附三个局部放大视角验证细节可用。方法概览图展示了「3DGS → GS-voxel → Latent」的确定性转换与解码链路。 4.5 关键洞察 缺少定量指标,成果主要以定性渲染图呈现 — 摘要的结论表述是「提供了结构化隐表示」「隐容量随占据体素数增长」,属于性质陈述而非性能声明,没有给出 PSNR/FID 这类可比数字。城市生成图很有说服力,但读者无法判断与其他 3D 生成方法的相对位置 「兼容的预优化 3DGS」这个前提条件模糊 — 摘要明确说输入是 compatible pre-optimized 3DGS。什么样的重建算兼容、不兼容会怎样、用不同重建管线产出的 3DGS 能否混用,都没有交代。这直接决定了「盘活已有 3DGS 资产」这个卖点的实际覆盖面 TopK 拼接对高密度体素的信息丢失未评估 — 体素内按不透明度取 TopK,超出 K 的高斯被丢弃。在几何复杂或高斯堆叠密集的区域(如植被、栏杆),实际高斯数可能远超 K,这部分丢失对渲染质量的影响需要 K 的消融实验支撑,摘要与图表未见 技术演进定位: 首个让预优化 3DGS 资产可直接进入隐空间三维生成的转换框架 可能的后续方向: 扩展到动态 4D 高斯场景的生成 结合文本条件做可控的大规模城市场景编辑 给出 TopK 与体素分辨率的联合选择准则 5. GroupForward:实例分组的前馈高斯泼溅,让 3D 场景能听懂复杂指代:上交与上海AI Lab 把每高斯高维语义换成紧凑实例嵌入,再让 VLM 在实例证据上推理 论文: GroupForward:实例分组的前馈高斯泼溅,让 3D 场景能听懂复杂指代 arXiv: 2608.17535 机构: 上海交通大学, 北京航空航天大学, 上海人工智能实验室, 华东师范大学 关键词: 前馈3DGS, 实例分组, 3D指代分割, 场景图推理, VLM 5.1 研究动机 核心问题: 前馈语义 3DGS 缺乏显式实例区分,只支持类别或短语级查询,无法回答需要区分同类多实例并理解空间关系的指代表达 具身智能体需要同时重建和理解三维环境。前馈语义 3DGS(feed-forward semantic 3DGS)在这方面很高效:从稀疏多视角观测直接构造出带语义的场景表示,不需要逐场景优化。但现有方法有个结构性缺陷——缺乏显式的实例区分,主要只支持基于类别或短语的语义查询。这意味着智能体能回答「哪些是椅子」,但回答不了「从第一个视角看左边那台显示器」这类需要区分同类多个实例、还要理解空间关系的指代表达。技术上的根因是现有做法给每个高斯挂一个高维语义特征,这种表示天然是逐点的、类别级的,无法表达「这些点属于同一个物体」。 前序工作及局限: pixelSplat / MVSplat / Uni3R:前馈 3DGS,从稀疏视角直接预测高斯但不含实例结构 LangSplat / 语义 3DGS:给每个高斯挂高维语义特征,逐点独立、无物体级分组 Sa2VA 等二维指代分割:语言理解强但无 3D 输出 与前序工作的本质区别: 用低维实例嵌入替代高维语义特征并聚类成跨视角一致 3D 实例,语义改在实例级聚合;再用 3D 场景图加三路相关性检索候选,交由 VLM 在结构化实例证据上做常识推理 5.2 方法原理 Overview of GroupForward and the Referential Scene Reasoning Framework (RSRF). Given sparse, unposed, and uncalibrated multi-view images, GroupForward reconstructs cross-view consistent 3D instance groups with compact instance embeddings and aggregates open-vocabulary semantics at the instance level. RSRF further organizes the instance groups into a 3D scene graph and integrates structured graph evidence with multi-view observations for VLM-based complex referential reasoning and 3D referring segmentation. GroupForward 的关键取舍在于把语义信息的载体从「高维特征」换成「低维实例嵌入 + 实例级聚合」。给每个高斯挂 CLIP 级别的高维特征有个隐藏代价:特征维度高、显存吃紧,而且这种表示本质是逐点独立的——两个属于同一把椅子的高斯,它们的特征相似只是因为长得像,模型并不知道它们是同一个物体。实例嵌入的做法反过来:嵌入本身很低维(只需支撑聚类),但通过实例损失被约束成跨视角一致,聚类后就得到了显式的物体级分组。语义则不再逐点存储,而是在实例级别聚合与传播——一个实例只需要一份语义,既省存储又更稳健。这个改动的真正价值在下游:有了显式实例,就能构造 3D 场景图,把「左边那台显示器」这类指代拆解为在图上做候选检索加关系判断。RSRF 的检索用三种相关性(语义、几何、跨视角可见性)缩小候选集,然后把结构化的实例证据连同多视角原图一起交给 VLM 做最终判断——这一步是必要的,因为像「我想坐在门附近,该坐哪」这类表达需要常识推理,几何与语义相似度算不出来。 5.3 核心创新 提出 GroupForward,一个实例分组的前馈高斯泼溅模型,从稀疏、无位姿(unposed)、未标定(uncalibrated)的多视角图像中同时重建几何、外观、实例结构与语义。关键改动是不再给每个高斯挂高维语义特征,而是学习紧凑的实例嵌入(compact instance embedding),把高斯分组为跨视角一致的 3D 实例——这把前馈语义 3DGS 从「逐高斯语义特征渲染」重构为「实例级语义聚合与传播」。在实例分组之上进一步提出指代场景推理框架(Referential Scene Reasoning Framework, RSRF)来做复杂 3D 指代分割:RSRF 构造实例分组的 3D 场景图,为给定的指代表达检索候选实例,再由视觉语言模型在结构化的实例证据与多视角观测上推理,从候选中确定被指代的那个实例。 5.4 实验结果 Qualitative comparisons of referential scene reasoning. Our method correctly grounds target instances with accurate novel-view segmentation and corresponding 3D outputs, while competing methods fail to ground the target instances or lack native 3D outputs. 在语义重建与指代推理两类任务上的实验验证了实例分组重建与推理框架的有效性。论文给出的定性对比显示,在四组指代表达(左侧显示器、靠垃圾架的容器、门附近可坐的位置、洗手的地方)上,GroupForward 的新视角分割结果比 Uni3R 与 Sa2VA 更准确;更关键的是 3D 输出一栏——Uni3R 在部分样例上给出的是空结果或错误的多物体,Sa2VA 完全不产出 3D 结果,而 GroupForward 能给出单一、正确的三维物体。这一列直接体现了实例分组带来的能力差异。 5.5 关键洞察 缺少定量数字支撑 — 摘要的结论是「实验证明了有效性」,未给出 mIoU、Acc@0.25 这类 3D 指代分割的标准指标。定性对比图很有说服力,但四组样例无法说明方法在困难指代(多同类物体、否定式表达)上的表现 RSRF 依赖外部 VLM,性能上界被它决定 — 复杂指代的最终判断交给 VLM,这让整个系统的推理能力与 VLM 选型强绑定。论文未讨论换用不同规模 VLM 时的性能变化,也未报告 VLM 调用带来的延迟——这对具身智能体的实时性是硬约束 实例嵌入的聚类超参敏感性未讨论 — 从嵌入到 3D 实例要经过聚类,聚类的粒度直接决定了「一个物体」的定义(椅子整体还是椅背/椅腿分开)。这个粒度对下游指代推理影响巨大,但摘要与流程图未交代聚类方法与超参选择 技术演进定位: 首个在实例分组基础上支持复杂 3D 指代推理的前馈语义 3DGS 可能的后续方向: 实例粒度层次化(物体-部件),支持部件级指代 端到端联合训练 VLM 与实例分组,降低对外部模型依赖 扩展到动态场景与多轮对话式交互指代 6. RS-Avatar:卷帘快门视频里的高斯化身,改一个合成算子就够了:澳门大学单人作者揭穿一个默认假设——同一帧的头和脚差了几十毫秒 论文: RS-Avatar:卷帘快门视频里的高斯化身,改一个合成算子就够了 arXiv: 2608.17314 机构: 澳门大学(University of Macau) 关键词: 高斯化身, 卷帘快门, 子帧渲染, 成像模型, 新视角合成 6.1 研究动机 核心问题: 化身重建默认「一帧的每个像素观测同一瞬间」,但卷帘快门逐行曝光使同帧内头脚相差数十毫秒运动,畸变被烘进规范表示并在新视角新姿态下持续存在 可动画人体化身的重建长期建立在一个无声的假设上:一帧图像的每个像素都观测到人体运动的同一瞬间。但卷帘快门(rolling shutter, RS)传感器是逐行曝光的——一帧之内,运动中的人的头部与脚部之间相差几十毫秒的关节运动,每一条扫描线看到的都是不同的姿态。把这样的视频喂给最先进的化身方法,畸变会被烘进规范表示(canonical representation)里,之后以剪切(shear)和抖动(wobble)的形式在新视角、新姿态下持续存在。更糟的是,多相机阵列中每台相机都有自己的读出时序,于是即便几何是正确的,驱动重建的多视角一致性也被破坏了。 前序工作及局限: GauHuman / 3DGS-Avatar 等高斯化身:把卷帘视频当瞬时曝光处理,畸变被吸收进规范空间 Deblur-NeRF / BAD-Gaussians:提供了子帧渲染机制,但合成算子是时间均匀平均 RS-SfM / RS-NeRF:已把逐行曝光建模进三维重建,但未涉及可动画人体化身 与前序工作的本质区别: 只把子帧渲染的合成算子从均匀平均换成按标定扫描线掩码的逐行选取,规范表示、warping、光栅化器全部不变;并给出反面证据——直接套用模糊模型不仅无效,还低于对快门无感知的基线 6.2 方法原理 Overview of RS-Avatar. Per-frame spline control points give $T$ sub-frame body states; the canonical Gaussians are warped to each and rasterized into the stack $R_1\dots R_T$ (stages 1--3). Stage 4 is the method: band $i$ of the synthesized frame is taken from the rendering at the instant that band was read out, so the observation selects among the renderings where the blur model beneath it averages them. The raw RS frames are the only supervision. 这篇论文的价值在于把一个物理成像事实精确地映射成一行代码级的改动。它的推理链条是这样的:任何运动感知的化身方法为了处理运动模糊,都已经具备「在一次曝光内渲染多个子帧姿态」的机制——用 B 样条从少量可学习控制点插值出 T 个子帧状态,各自 warp 并光栅化。模糊与卷帘的区别只在于如何把这 T 张渲染合成一张:模糊是时间上的均匀平均(每个像素都是全部子帧的平均),卷帘是空间上的逐行选取(第 i 条扫描线只取第 i 个子帧)。因此只需把平均算子换成按扫描线掩码的加权选取,其余部分完全不动。论文特别强调了反面结论的价值:直接套用运动模糊模型处理卷帘视频不仅无效,还比完全忽略快门效应更差。这说明子帧渲染机制虽然通用,但合成算子必须与真实成像过程严格对应——用错了算子,多出来的子帧自由度反而成了拟合错误目标的工具。 6.3 核心创新 提出 RS-Avatar,直接从卷帘快门视频重建清晰、无畸变、可动画的 3D 高斯化身。它的表述极为简洁:一个运动感知的化身本来就会在若干子帧时刻渲染人体,模糊模型(blur model)是把这些渲染做平均,而卷帘快门模型则是把它们逐扫描线合成(composites them scanline by scanline)。换掉这个算子是唯一需要的修改——规范表示、warping、光栅化器全部不变。论文还基于 ZJU-MoCap 构建了 RS-ZJU 基准。一个反直觉的发现是:建立在同一套子帧机制上的运动感知模糊模型并不能迁移到卷帘场景,实际表现甚至低于完全不考虑快门的基线——「机制是可复用的,算子不是」。 6.4 实验结果 Novel-view synthesis on RS-ZJU at $K\!=\!11$, held-out camera. The outstretched forearm sweeps the largest image-space distance within one readout, and is where the methods differ. 在基于 ZJU-MoCap 构建的 RS-ZJU 基准上,相比「当作瞬时曝光来训练」的做法,RS-Avatar 在每一个被试对象上都提升了新视角合成质量。反面对照同样明确:建立在同一套子帧机制上的运动模糊模型不仅没有迁移成功,表现还低于对快门无感知(shutter-oblivious)的基线。论文的定性对比图展示了六个视角下的行走化身渲染,肢体边缘(尤其手臂与腿部)保持清晰,没有出现卷帘畸变典型的剪切与抖动。 6.5 关键洞察 扫描线掩码需要标定,实际相机的读出时序未必可得 — 方法依赖「标定的扫描线掩码」把子帧与图像行对应起来。这在受控实验里可以测量,但消费级相机通常不公开读出时序,多相机阵列还要处理各自不同的时序偏移。若掩码估计有误,逐行选取的算子可能反而引入新的畸变 基准由 ZJU-MoCap 合成而来,缺真实卷帘数据验证 — RS-ZJU 是从全局快门的 ZJU-MoCap 构造出的卷帘数据。合成时的读出模型是理想的,而真实 CMOS 传感器还有行间曝光重叠、读出噪声等因素。缺少真实 RS 相机拍摄数据的验证,方法的实用性存疑 子帧数 T 与控制点数 P 的开销未量化 — 每帧要做 T 次 warp 与光栅化,训练开销随 T 线性增长。论文强调「唯一的改动是合成算子」,但这个改动的前提是已有子帧机制——对本来不做运动感知的化身方法,引入 T 倍渲染开销并非小事,摘要未给出 T 的取值与耗时对比 技术演进定位: 首个卷帘快门感知的可动画高斯化身重建,并明确「子帧机制可复用、合成算子不可复用」 可能的后续方向: 从视频自估计扫描线读出时序,去掉标定依赖 采集真实卷帘相机的多视角人体数据集 推广到卷帘视频的通用动态场景重建 7. NGS-Marker:原生水印堵上 3DGS 的版权漏洞——偷走一部分高斯也能验主:ICLR 2026,浙大团队指出现有方案只保护渲染图,部分侵权时形同虚设 论文: NGS-Marker:原生水印堵上 3DGS 的版权漏洞——偷走一部分高斯也能验主 arXiv: 2608.17447 机构: 浙江大学, 浙江省地理信息科学重点实验室 关键词: 3DGS水印, 版权保护, 部分侵权, 渐进式注入, ICLR 2026 7.1 研究动机 核心问题: 现有 3DGS 水印只保护渲染出的图像,底层高斯图元无防护;攻击者抽取复用部分高斯即可绕过检测(部分侵权) 随着 3DGS 快速发展与普及,有效的版权保护变得越来越关键。但现有 3DGS 水印技术主要保护渲染出的图像——靠预训练解码器从渲染图里读水印,底层的三维高斯图元本身却毫无防护。这留下一个尖锐的漏洞:论文称之为部分侵权(Partial Infringement)——攻击者只需抽取并复用一部分高斯(比如把场景里某个物体单独扒出来用),既不需要完整场景,也绕过了基于渲染图的检测,现有方法对此完全无效。这个威胁在 3DGS 真正成为可流通的三维资产时才会浮现,而这一天已经到了。 前序工作及局限: GaussianMarker 等 3DGS 水印:靠预训练解码器从渲染图读水印,对图元级抽取完全无效 HiDDeN 等深度图像水印:提供注入器-提取器联合训练范式,但载体是二维图像 点云与网格水印:三维资产版权保护的更早尝试,未适配高斯参数化 与前序工作的本质区别: 原生水印——直接在高斯参数中注入扰动,注入器与提取器联合训练后再用畸变邻域采样做基于梯度的渐进式注入确保全场景覆盖,使任意局部区域可解出所有权;并扩展为原生加渲染图的混合保护与多模态水印 7.2 方法原理 Overview of NGS-Marker. The watermark injector ($\mathcal{P}_g + \mathcal{P}_d$) is jointly trained with the message extractor $\mathcal{E}$. The trained extractor can guide a gradient-based optimization to protect the target 3D scene. Once the private watermark is embedded in $\mathcal{G}^w$, users can verify copyright ownership directly from the native 3D data without rendering. NGS-Marker 要同时满足两个互相拉扯的目标:水印要能从任意局部区域读出(鲁棒性),又不能明显影响渲染质量(不可感知性)。它的设计是两阶段的。第一阶段联合训练注入器与提取器:注入器用交叉注意力把消息特征融进局部高斯特征,输出对高斯参数的扰动;提取器则从被扰动的局部高斯里把消息读回来。这一阶段用普通的 k-NN 采样构造局部子集,训练出一对配合默契的编解码器。第二阶段是渐进式嵌入:冻结提取器,用畸变邻域采样(模拟攻击者可能做的各种局部抽取与扰动)对整个场景做梯度下降,让水印信号覆盖到场景的每一处。这里的「渐进」很关键——一次性在全场景注入会导致强度不均,某些区域信号过弱以致局部抽取后读不出来。用梯度驱动逐步扩展覆盖,能保证任意局部区域的信号强度都达标。混合保护则是承认两种水印各有所长:原生水印防的是图元级抽取,渲染图水印防的是截图与二次分发,二者叠加才覆盖完整威胁模型。 7.3 核心创新 提出 NGS-Marker,一个面向 3DGS 的原生(native)水印框架。它整合了联合训练的水印注入器(watermark injector)与消息解码器(message decoder),并采用基于梯度的渐进式注入策略(gradient-based progressive injection)确保全场景覆盖,从而能从任意局部区域解码出所有权信息。论文进一步把 NGS-Marker 扩展为混合保护(hybrid protection,把原生水印与间接的渲染图水印结合)并支持多模态水印。 7.4 实验结果 Simulated partial infringement scenarios on public datasets. It can be observed that NGS-Marker enables precise and fine-grained copyright protection. 大量实验表明 NGS-Marker 能有效防御部分侵权,同时为真实部署提供实用的灵活性。论文的定性图显示,在三个场景(厨房台面、公园长椅与树、玻璃房植物与人)上,水印场景与原始渲染在视觉上难以区分,而热力图(红色高亮)显示水印信号可从局部物体区域被正确检出。论文为 ICLR 2026 接收,图表规模较大(正文 5 图加附录 10 图,含多个大尺寸定性对比)。 7.5 关键洞察 「任意局部区域」的下界未量化 — 核心卖点是从任意局部区域都能解码,但一个局部区域至少要含多少高斯、占场景多大比例才能可靠解出,摘要没有给出。攻击者只需把抽取粒度压到这个阈值以下就能规避,这个数字是评估方案实用性的关键 与压缩、量化等下游处理的兼容性未讨论 — 水印靠在高斯参数上注入扰动实现,而同期的 QuARC-GS/GS-Voxel 恰恰要对高斯参数做量化与稀疏化。水印扰动很可能被量化步长抹掉,或被稀疏门控当成噪声丢弃。3DGS 资产的真实流通链路必然包含压缩,这个兼容性问题绕不开 自适应攻击者的威胁模型偏弱 — 论文防的是抽取局部高斯复用这类被动攻击。但若攻击者知道 NGS-Marker 的存在,可以做重优化(用水印场景的渲染图重新训练一个干净 3DGS)来洗掉水印。这类白盒自适应攻击在图像水印领域是标准评测项,摘要中未见 技术演进定位: 首次提出 3DGS 部分侵权威胁模型并给出局部可验证的原生水印方案(ICLR 2026) 可能的后续方向: 量化可解码的最小局部规模,给出可证明的鲁棒性下界 与高斯压缩/量化管线联合设计,让水印在压缩后存活 评估重优化类白盒自适应攻击下的鲁棒性 横向对比与技术脉络总结 横向对比:本期 3DGS 工程化七篇技术对比 论文 解决的部署瓶颈 核心机制 稀疏化/结构化手法 关键数字 验证环境 机构 S²GS FVV 流式传输:每帧优化时间与存储双高 流式八叉树 + 结构化门控(HFP + Gumbel-Sigmoid) 可微离散门控决定哪些锚点残差需更新 优化时间 -59%、存储 -85%(vs QUEEN, RTX 4090);Jetson AGX Orin 上 60+ FPS 消费级 GPU + 边缘 IoT + 物理远程呈现测试台 香港理工大学 QuARC-GS 动态场景在线流式传输的存储成本 规范帧 + 量化感知锚点变形 + 变化门控致密化 量化把长尾变形压零,梯度差分门控致密化 每帧存储最多压到 SOTA 的 1/11;约 32.16 dB @ 30~40 KB 常用动态场景数据集(N3DV 等) 杜克大学等 MetaSapiens v2 VR/AR 头显上的实时 PBNR,双眼渲染算力翻倍 效率感知剪枝 + 注视点渲染 + 选择性立体扭曲 + 专用加速器 按注视点剔除图元、外围降质、双眼冗余复用 平均 30.9× 加速(基线 18.5×,+TM/LB 20.9×),最高 40.1× 九个标准场景 + 加速器仿真 + 主观实验 罗切斯特大学 / 上海交通大学 GS-Voxel 预优化 3DGS 无法喂给结构化隐空间生成器 确定性体素化 + 因子化 VAE(几何/属性分路)+ 图像条件流模型 TopK 不透明度排序拼接、8-bit 量化、稀疏活跃体素 隐容量随占据体素数增长;重叠感知分块生成城市级场景 航拍/卫星条件的大规模城市场景生成 阿里高德 / 浙江大学 / 北京大学 GroupForward 语义 3DGS 只支持类别/短语查询,无实例区分 紧凑实例嵌入 + 聚类成跨视角一致 3D 实例 + RSRF 场景图 + VLM 推理 高维语义特征换成低维实例嵌入,语义在实例级聚合 3D 输出优于 Uni3R(空/多物体)与 Sa2VA(无 3D 输出) 语义重建 + 3D 指代分割定性对比 上海交通大学 / 北航 / 上海AI Lab / 华东师大 RS-Avatar 卷帘快门视频导致化身规范表示被烘进畸变 把子帧渲染的平均算子换成逐扫描线合成算子 不涉及(结构不变,只换合成算子) RS-ZJU 上每一个被试对象的新视角合成均提升;模糊模型迁移失败且低于无感知基线 RS-ZJU(由 ZJU-MoCap 合成) 澳门大学 NGS-Marker 3DGS 部分侵权:抽走一部分高斯即绕过渲染图水印 注入器-提取器联合训练 + 基于梯度的渐进式注入 + 混合/多模态水印 不涉及(反向:主动在参数中注入扰动) 任意局部区域可解码所有权;ICLR 2026 接收 多场景定性对比 + 部分侵权攻击实验 浙江大学 / 浙江省地理信息科学重点实验室 核心技术趋势 「静态基底 + 稀疏残差」成为动态 3DGS 的默认结构 本期两篇流式传输工作(S2GS、QuARC-GS)虽出自完全不同的团队,却给出了几乎同构的方案:先重建一个规范帧(canonical frame)作为基底,之后每帧只编码与基底的差异残差。这个结构之所以反复出现,是因为它精确匹配了动态场景的统计事实——绝大多数区域在相邻帧间是静止的,为它们重复存储完整高斯参数是纯粹的浪费。QuARC-GS 靠这一点把每帧存储压到 SOTA 的 1/11,S2GS 相比 QUEEN 减少 85% 存储。这已经不是某个技巧,而是这个子领域的基础设施。 更新决策从启发式阈值升级为可微门控 残差结构解决了「存什么」,但还剩一个更难的问题:哪些残差值得更新?早期方法靠手调阈值(梯度大于某值就致密化),本周两篇都换成了可学习的离散决策。S2GS 用 Gumbel-Sigmoid 加多级直通估计器(ML-STE)把层次动态线索转成稀疏更新掩码,让「更新与否」这个二元决策在反向传播中可微;QuARC-GS 则用视空间梯度差分做变化门控,只在真正发生时序变化的区域分配新高斯。共同逻辑是:稀疏化本身应当被优化目标驱动,而不是被人类先验决定。 评测环境从 A100 集群下沉到 Jetson 与头显 这是本期最直观的变化。S2GS 的实验矩阵横跨消费级 GPU、工业级边缘 IoT 设备与一套物理远程呈现测试台,核心结论报在 Jetson AGX Orin 上(60+ FPS、最低能耗);MetaSapiens v2 更进一步,直接给出了面向双眼注视点渲染的加速器硬件设计,讨论的是负载不均衡与线缓冲区(line buffer)这类体系结构问题。当论文开始画 DRAM 数据通路图而不只是画损失曲线,说明这个领域已经进入了软硬件协同设计阶段。 3DGS 正在被改造成生成模型的输入格式 GS-Voxel 揭示了一个被长期忽视的错配:可扩展的三维隐空间生成器都在结构化张量上工作,而预优化好的 3DGS 重建恰恰是无序、空间不规则、图元数量差异极大的。它的解法是确定性地把 3DGS 转成稀疏活跃体素,不做额外的逐场景拟合(fitting-free),再用 GS 专用的因子化 VAE 分别编码体素几何与局部高斯属性。这个方向的意义超出单篇论文——它意味着过去几年积累的海量 3DGS 重建资产,有可能被直接盘活成生成模型的训练数据。 从「渲染得像」转向「查得到、管得住」 另外三篇代表了 3DGS 走向应用后必然出现的需求。GroupForward 指出现有前馈语义 3DGS 只支持类别或短语查询,缺乏显式实例区分,于是把每个高斯挂高维语义特征改成学习紧凑实例嵌入并聚类成跨视角一致的 3D 实例,再让 VLM 在实例证据上做复杂指代推理。NGS-Marker 则揪出了一个尖锐的现实漏洞:现有 3DGS 水印只保护渲染出的图片,攻击者若直接抽走一部分高斯图元复用,水印形同虚设——它的原生水印方案让任意局部区域都能解出版权信息。这些问题在纯学术语境下不存在,只有当 3DGS 真的成为一种流通资产时才会浮现。 核心技术难点与开放问题 四大核心难点 1. 动态 3DGS 压缩缺统一标尺 本期两篇流式压缩工作思路高度同构(基底 + 稀疏残差 + 可学习稀疏决策),但报数方式完全不同:QuARC-GS 是「每帧存储压到 SOTA 的 1/11」,S²GS 是「相比 QUEEN 存储 -85%、优化时间 -59%」。基线不同、数据集不同、画质工作点不同,两个数字无法互相换算。这个子领域已经有足够多的工作,却还没有一条像视频编码 BD-rate 那样的公认率-失真曲线,导致进步只能靠各自的相对提升自证。建立统一基准(固定数据集、固定画质点、报存储+训练时间+渲染 FPS 三元组)是当务之急。 2. 稀疏化与长时间稳定性的张力 残差结构的收益完全建立在「基底帧长期有效」之上。一旦场景发生结构性变化——有人走进画面、灯光整体切换、镜头大幅移动——残差量会爆炸,稀疏化的收益急剧退化。QuARC-GS 的量化能压缩的前提正是变形分布集中在零附近,这在大部分区域静止的场景成立,但对整体镜头运动就不成立了。S²GS 的实验包含光照变化与设备拔插场景是加分项,但两篇都在数百帧量级测试,而真实远程呈现会话是几十分钟。误差沿残差链的累积规律、基底重设的触发准则,目前都是空白。 3. 注视点渲染的质量评估方法学缺失 MetaSapiens v2 暴露的是整个注视点渲染方向的评测困境:这类方法的本质是主动放弃人眼看不清区域的质量,因此 PSNR/SSIM 这类全画面均值指标在原理上就无法判断取舍是否成功——外围质量下降会拉低 PSNR,但如果人眼察觉不到,那正是方法的目标而非缺陷。需要的是与注视点位置相关的加权感知指标,以及考虑眼动追踪延迟与误差的鲁棒性评测。此外,加速比里算法贡献与专用硬件贡献混在一起,也让读者难以判断纯软件层面的改进幅度。 4. 3DGS 作为生成模型输入的信息损失未被量化 GS-Voxel 打开了「盘活已有 3DGS 资产」的方向,但转换链路上有三处有损操作,各自的代价都没被量化:体素内 TopK 拼接会丢弃超出 K 的高斯(植被、栏杆这类密集区域可能远超 K)、8-bit 量化会损失参数精度、低不透明度过滤会移除弱贡献高斯。更根本的是「兼容的预优化 3DGS」这个前提没有定义——不同重建管线产出的高斯在尺度分布、不透明度分布上差异很大,能否混用直接决定这个方向的实际覆盖面。缺了这些消融,方法在新数据上只能靠试。 5. 多目标优化的兼容性完全未被讨论 这是把本期七篇放在一起才看得见的问题。一个真实的 3DGS 产品链路需要同时满足:被生成模型采样(GS-Voxel 要求量化到 8-bit 的规则体素)、被压缩流式传输(S²GS/QuARC-GS 要求激进丢弃不显著更新)、被水印保护(NGS-Marker 要求在参数中注入可检出扰动)、被语言查询(GroupForward 要求携带实例嵌入)。这些要求彼此冲突显而易见:量化步长可能抹掉水印扰动,稀疏门控可能把水印当噪声丢弃,实例嵌入是额外的每高斯负载而压缩正要削减负载。目前没有任何一篇讨论这种叠加,而这恰恰是工程化落地必须回答的。 今日讨论 把这七篇放在一起看,3DGS 的工程化转向已经相当清晰:关注点从「重建得出来」全面转向「传得动、跑得起、管得住」。但方向一致也让几个共同空白格外刺眼。 最突出的是缺统一标尺。两篇压缩工作思路几乎同构,报数却一个是「压到 SOTA 的 1/11」、一个是「相比 QUEEN 减少 85%」,基线与画质工作点都不同,无法互相换算——这个子领域还没有像视频编码 BD-rate 那样的公认曲线。其次是长时稳定性没被检验:残差结构的收益全押在「基底帧长期有效」上,而测试只做到数百帧,真实远程呈现会话是几十分钟。 但最根本的问题只有把七篇并置才看得见:它们各自的优化目标彼此冲突。GS-Voxel 为了做生成要把高斯量化到 8-bit,NGS-Marker 为了水印要在参数里注入扰动,两篇压缩工作则要激进丢弃不显著的更新。一个真实产品链路需要同时被生成、被压缩传输、被水印保护、被语言查询,而这些操作的兼容性目前无人讨论——量化后的高斯还能承载水印吗?水印扰动会被稀疏门控当成噪声丢掉吗? 你认为 3DGS 的下一个瓶颈在哪:继续做表示压缩,还是像 GS-Voxel 那样把它彻底纳入生成模型的隐空间?欢迎在评论区讨论。 人工智能炼丹君 整理 | 数据来源:arXiv 2026-08-16 ~ 2026-08-22 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月23日
15 阅读
0 评论
0 点赞
2026-08-23
AIGC 基本功|视频生成中的强化学习与奖励模型-VideoRL
视频生成中的强化学习与奖励模型 所属方向:对齐与强化学习 | 难度:前沿专题 | 前置知识:DiffusionRL、FlowMatching 关键词:视频强化学习、奖励模型、Flow-GRPO、时序一致性奖励、人类偏好、reward hacking 01. 为什么需要它 先看一个用于说明奖励投机的假设场景;下面的“两千步”不是本文实际运行的视频实验记录。 你有一个文生视频模型,想用 RL 把它对齐到人类偏好。你手上有个打分器,在图像上验证过效果不错——清晰度、细节、构图都能打分。你把它接上视频,跑 GRPO,训了两千步。奖励曲线漂亮地往上走。 然后你去看生成结果:画面几乎不动了。 人物站在原地,衣角不飘,背景纹理纹丝不动。prompt 明明写着 "a person walking across the street",模型给你一张会呼吸的照片。 这不是 bug,是模型算得比你清楚。静止画面有一系列白拿的好处: 形状永远不会崩——因为它不变 帧间没有闪烁——因为帧之间完全一样 细节可以做到极精细——不用分算力去渲染运动模糊 而它放弃的只有「动态性」这一项。如果静止带来的加分超过动态性与指令遵循等全部损失,那么静止可能比运动拿到更高奖励,RL 会毫不犹豫地找到它。 视频奖励增加了运动与时序一致性维度。在有限模型能力下,运动幅度与形变、闪烁等伪影可能存在经验权衡;这不是“运动必然降低画质”的物理定律。图像的清晰度、构图、语义也可能冲突,不能假设图像奖励天然相容。 后面几节会把这笔账算成具体数字——用 VisionReward 真实发布的 29 个权重。 02. 最小可用理解 三句话: 采一组。对同一个 prompt 采样 $G$ 条视频(比如 8 条),用奖励模型给每条打一个分。 组内比。把这组分数减去组内均值、除以组内标准差,得到每条的优势(advantage)——比同组平均好就是正,差就是负。 按优势推。优势为正的往上推概率,为负的往下压。不需要训练价值网络(critic),组内均值就当基线用了。 这概括了 GRPO 的组内优势机制;完整目标还包含后文的概率比、裁剪和可选 KL。它省掉 critic 的代价是必须一次采一组,好处是少训一个网络、少一堆调不动的超参。 如果只记一件事:RL 不会给你「更好的视频」,只会给你「奖励更高的视频」。这两者的差距全部藏在奖励模型里。本文一半篇幅在讲奖励模型,不是跑题。 03. 数学推导 3.1 从策略梯度到组内基线 目标很直白:最大化生成样本的期望奖励。 $$J(\theta) = \mathbb{E}_{x \sim \pi_\theta} [r(x)]$$ 其中 $\pi_\theta$ 是生成模型(策略),$x$ 是一条采样出来的视频,$r(x)$ 是奖励模型给的分。对参数求梯度,用对数导数技巧: $$\nabla_\theta J = \mathbb{E}_{x \sim \pi_\theta} [r(x) \nabla_\theta \log \pi_\theta(x)]$$ 这个式子能用,但方差大得没法训。原因是 $r(x)$ 的绝对值直接乘在梯度上:假如所有样本的奖励都在 8.0 到 8.2 之间,那么每个样本都在说「往我这边推」,只是力度略有差别。真正有用的信息是「谁比谁好」,而不是「绝对分多高」。 标准解法是减一个基线 $b$: $$\nabla_\theta J = \mathbb{E}[(r(x) - b) \nabla_\theta \log \pi_\theta(x)]$$ 只要 $b$ 与 $x$ 无关,这个替换是无偏的(因为 $\mathbb{E}[b \nabla_\theta \log \pi_\theta] = b \nabla_\theta \mathbb{E}[1] = 0$)。PPO 那一路用一个学出来的价值网络当 $b$,GRPO 的选择更省事——同一个 prompt 采一组,用组内均值当基线: $$A_i = \frac{r_i - \mathrm{mean}(r_1, \dots, r_G)}{\mathrm{std}(r_1, \dots, r_G)+\varepsilon}$$ 这里不能直接套用上面的无偏证明:组均值含有 $r_i$,依赖当前样本。固定 prompt、独立同分布采样且不除标准差时, $$E[(r_i-\bar r)\nabla\log\pi_\theta(x_i)]=(1-1/G)\nabla J.$$ 使用不含自身的 leave-one-out 均值可消除该缩放;除以随机组标准差还会改变样本及 prompt 的相对权重。$\varepsilon>0$ 防止同分组除零,同分组的奖励优势为零。标准化是有用的工程选择,不能据此宣称完整 GRPO 无偏;奖励均值高本身也不等于期望梯度大。 这张图要看什么:左图是同一个 prompt 采出的 8 条视频的奖励,全挤在 8.0 到 8.2 之间——如果直接把 $r_i$ 乘在梯度上,8 条样本会一起喊「往我这边推」,有用的信息全被绝对值淹没(箭头方向完全一致)。右图减掉组内均值、除以组内标准差之后,同样的 8 个数字变成了有正有负的优势:绿的往上推、红的往下压。这就是 GRPO 不用 critic 也能训的原因——基线是从同组样本里白捡的(图由 code/make_figures.py 生成,下同)。 GRPO 出自 DeepSeekMath(arXiv:2402.03300),原本是给语言模型的数学推理用的,后来被搬到视觉生成上。 3.1.1 完整目标里还有两个护栏 上面那个式子是骨架。真实的 GRPO 目标还包着两层保护,后面 04 节的最小实现会把它们省掉,这里先说清省的是什么。 第一层是重要性采样比的截断(沿用 PPO 的做法): $$\mathcal{L} = -\mathbb{E}\left[ \min\left( \rho_i A_i, \ \mathrm{clip}(\rho_i, 1-\epsilon, 1+\epsilon) A_i \right) \right]$$ 式子里的 $\rho_i$ 是新旧策略的概率比,$\rho_i = \pi_\theta(x_i) / \pi_{\theta_{\text{old}}}(x_i)$。采样用的是旧策略 $\pi_{\theta_{\text{old}}}$,更新的是新策略 $\pi_\theta$,$\rho_i$ 修正这个偏差。clip 截断的是朝有利方向继续外推的收益,不保证每个 ratio 都在区间内,也不是 KL 的硬约束。神经网络共享参数,仍可能越界;需结合 KL 和梯度日志监控。视觉去噪实现通常按每个随机转移计算 ratio,不能把这里的整段视频记号误当成可直接算出的边缘密度。 第二层是对参考模型的 KL 惩罚: $$\mathcal{L}_{\text{total}} = \mathcal{L} + \beta \, \mathrm{KL}\left[ \pi_\theta \, \| \, \pi_{\text{ref}} \right]$$ $\pi_{\text{ref}}$ 通常是 RL 开始前的初始模型。这一项把策略拴在原始分布附近,是对付 reward hacking 最基础的护栏——因为大多数 hack(比如 01 节那个静止画面)都要求策略跑到离原始分布很远的地方去。$\beta$ 调的就是「允许它跑多远」。 代价是 $\beta$ 很难调:太大则学不动,太小则护栏形同虚设,而合适的值随任务和奖励模型变化。这也是为什么 04 节要先把护栏拆掉看清裸的优化行为——理解 hacking 怎么发生,比直接套护栏更重要。 3.2 flow matching:怎样得到随机转移的似然 Flow matching 的 ODE 为 $dx_t/dt=v_\theta(x_t,t)$。本文用 $t=1$ 表示噪声、$t=0$ 表示数据:给定初始噪声,逐步转移是确定性的条件 delta,不能直接代入高斯转移 log-prob 做 PPO/GRPO。 这不等于输出没有概率分布。随机初值经正则、可逆的 ODE 流仍可产生具有边缘密度的输出,CNF 可用散度积分计算密度;可微奖励还可以沿 ODE 用路径导数优化,确定性策略梯度也有自己的适用条件。受限的是本文这条“随机逐步转移似然 + score function”的路线。 Flow-GRPO 第 4.2 节 为它构造反向时间 SDE: $$dx_t=\left[v_\theta(x_t,t)-\frac{\sigma_t^2}{2}\nabla\log p_t(x_t)\right]dt+\sigma_t\,d\bar W_t,\qquad dt<0.$$ 由于时间从 1 向 0 走,score 修正前是减号;离散噪声标准差为 $\sigma_t\sqrt{-dt}$。若改用从噪声出发递增的时间坐标,漂移和 score 符号必须一起变换。准确 score、匹配的速度场与连续时间求解条件下,SDE 和 ODE 共享边缘分布;近似网络、有限步长及 RL 更新会带来偏差,不能保证实现后精确不变。 这使被训练的非退化转移具有可计算的高斯 log-prob。终步若噪声为零,仍要排除或另行处理,不能对零方差求对数密度。Flow-GRPO 还用 Denoising Reduction 减少训练采样步数、保留完整推理步数;这是论文所测任务上的经验结果,需在视频任务重新验证。 3.3 奖励从哪来:把打分变成一串是非题 现在缺的是 $r(x)$。视频的「好」是多维的,而人类偏好数据通常只有「A 比 B 好」这种成对比较,信息量很稀疏。 VisionReward(arXiv:2412.21059)的做法是把打分拆成一串可解释的是非题,再线性加权: $$r(x) = \frac{1}{K} \sum_{k=1}^{K} w_k \cdot a_k(x), \quad a_k(x) \in \{+1, -1\}$$ 其中 $a_k$ 是一个视觉语言模型对第 $k$ 个问题的回答(yes 记 $+1$,no 记 $-1$),$w_k$ 是该问题的权重。视频版一共 $K = 29$ 个问题,从「是否满足 prompt 的全部要求」到「细节是否精细」。 这个设计有两个好处。可解释:分低的时候能看出是哪一维拖的,不是一个黑盒数字。可控:想让模型更重视某一维,直接改 $w_k$ 就行。 代价是它把「好」压成了一个线性组合。而线性组合最容易被套利——下一节就用它真实发布的权重,把套利空间算出来。 04. 代码实现 4.1 先把奖励函数照抄一遍 VisionReward 的打分逻辑短到可以完整贴出来。这是它仓库里 inference-video.py 的核心两行(2026-08 的 main 分支): answers = np.array([1 if answer == 'yes' else -1 for answer in answers]) return np.mean(answers * weight).item() 有个细节值得停一下:no 记的是 $-1$,不是 $0$。这让答错变成实打实的扣分,而不只是「没拿到加分」。同一个维度上,yes 和 no 之间差了 $2 w_k$ 而不是 $w_k$——算套利空间时这个因子 2 不能漏。 29 个权重是仓库里 VisionReward_Video/weight.json 直接给出的。先看看它们长什么样(code/reward_hacking.py): 29 个维度,权重总和 6.2772,均值 0.2165 最高 1.1418(指令-未完全失败) 最低 0.0085(细节-不粗糙) 最高/最低 = 134 倍 指令遵循三档合计 2.3486,占总权重 37.4% 构图+色彩合计 0.0924,占总权重 1.5% 两个数字值得盯着看。最高和最低差 134 倍——这不是一个「各维度都重要」的均衡奖励,而是有着强烈倾向的。指令遵循三档占了 37.4%,构图加色彩只占 1.5%:在真实的人类偏好数据里,指令三档的权重合计是构图与色彩权重合计的约 25 倍。但这不是人类把指令遵循看得比整体美感重 25 倍的因果结论:其他维度也反映画质,且题目相关性、回答频率与权重尺度会影响解释。 这个结构反直觉但合理——观众要的是他要的东西,不是一张漂亮但无关的图。 这张图要看什么:左图把 29 个权重从低到高排开——最高的「指令-未完全失败」1.1418,最低的「细节-不粗糙」0.0085,相差 134 倍(红色是指令遵循三档,灰色是构图加色彩)。右图按语义归堆后更刺眼:指令遵循合计 2.3486、一家吃掉 37.4%,构图加色彩只有 0.0924、占 1.5%。指令三档的权重合计是构图与色彩这两组的二十多倍——记住这个比例,4.2 和 4.4 节的套利与翻转全是从它推出来的。 4.2 静态套利的账 回到 01 节那个静止画面。它能白拿哪些分、要放弃哪些分,现在可以精确算: 静止能白拿:全程形状保持+不混乱+画质稳定 = 0.7166 静止要放弃:镜头高度动态+不微弱 = 0.1634 净收益 +0.5532 (yes/no 相差 2 个单位,实际影响 ×2 = +1.1064) 上述 +1.1064 是未除以 $K$ 的加权和变化;score() 实际变化是 $1.1064/29\approx0.03815$。权重总和 6.2772 对应分数上限 0.2165,分数全范围宽度约 0.4329,因此这笔差额约占全范围 8.8%。这只是所选维度的局部账,不能省略指令等其他维度后宣称静止全局最优。 那它会不会因为违背 prompt 而被罚回来?我构造了两个视频画像对比(prompt 要求「人物走过街道」): 视频 A(几乎静止的精致画面,没照做 prompt) +0.1220 视频 B(照做了 prompt,但有形变和抖动) +0.1144 奖励模型更偏好:A(静态) 差值 0.0076 静态那个赢了。 拆开看差异来自哪: -1.9088 指令-全部满足 +0.8586 细节-非常精细 +0.5372 画质-非常稳定 +0.5272 全程形状-不混乱 -0.5048 指令-大部分满足 +0.3688 全程形状-完美保持 静态视频在指令遵循上亏了 2.41(这是权重最高的维度!),但靠画质那几项一点点堆回来,最后反超 0.0076。 需要说清楚:这两个 yes/no 画像是我按各维度语义人工假设的,不是真实模型的输出,所以这个结论说明的是「权重结构允许这样的套利」,不是「VisionReward 实际会这么判」。差值只有 0.0076 也说明它非常接近临界——是否会被优化器实际找到,还取决于策略可达性、采样噪声与正则约束,不能由这一对假设画像推断必然收敛。 4.3 让 GRPO 自己去找套利 手工构造画像终究不如让算法自己找。下面是完整的单参数 GRPO(code/grpo_minimal.py),策略只有一个参数:运动强度 $m$。 维度压到 1 维是刻意的——才能看清 GRPO 究竟把策略推向哪里。玩具概率按人为假设设定:$m$ 越大,指令遵循和动态性越容易拿 yes,形状保持、画质稳定、细节精细越容易拿 no。 def grpo(steps=400, group=32, lr=0.35, sigma=0.15, theta0=0.0, seed=0, weight=None): rng = np.random.default_rng(seed) theta = theta0 for step in range(steps): # 策略:m = clip(sigmoid(theta) + noise),高斯探索 mu = 1 / (1 + np.exp(-theta)) eps = rng.normal(0, sigma, group) ms = np.clip(mu + eps, 0.0, 1.0) rs = np.array([reward(m, rng, weight) for m in ms]) # 组内相对优势:减均值除标准差(3.1 节那个式子) adv = (rs - rs.mean()) / (rs.std() + 1e-8) # ∂mu/∂theta = mu(1-mu) grad = float(np.mean(adv * eps / sigma ** 2) * mu * (1 - mu)) theta += lr * grad return 1 / (1 + np.exp(-theta)) m_final = grpo() print(f"GRPO 收敛到 m = {m_final:.4f}") # GRPO 收敛到 m = 0.9657 十几行,没有 critic,也刻意去掉了 3.1.1 节那两层护栏(clip 和 KL)——保留的是组标准化 REINFORCE 示意,不是完整 PPO/GRPO 更新。代码中的高斯 score 对应裁剪前潜在动作 $a=\mu+\epsilon$,环境再执行 $m=\mathrm{clip}(a,0,1)$;不能把它当成裁剪后混合分布的普通高斯 log-prob。用完整的 29 个权重跑: step 运动强度 m 组内平均奖励 0 0.5000 -0.0238 80 0.9227 +0.0395 160 0.9420 +0.0346 320 0.9649 +0.0452 399 0.9660 +0.0370 GRPO 收敛到 m = 0.9657 → 策略选择:动态(照做了 prompt) 没有 hack。 策略从中性的 0.5 一路推到 0.966,选择了照做 prompt。换三个不同初值(0.27 / 0.50 / 0.73)出发,都收敛到 0.977 附近,说明这不是初值凑巧。 原因就是 4.1 节那个 37.4%:指令遵循的权重足够大,压住了画质维度的全部诱惑。这是玩具里的结果,不能验证 Flow-GRPO 的视频表现。Flow-GRPO 在其图像实验中他们报告「very little reward hacking occurred」,奖励涨上去了而画质和多样性没有明显退化。 4.4 关键对照:把指令遵循拿掉 那 01 节那个失败场景怎么发生的?答案在奖励模型上,不在算法上。 01 节的设定是「手上有个在图像上验证过的打分器」——图像打分器很可能根本不看时序,或者对指令遵循的权重远没有这么高。把三个指令遵循维度的权重置零,模拟这种情况,同一个 GRPO 再跑一遍: step 运动强度 m 组内平均奖励 0 0.5000 -0.0016 80 0.0305 +0.0269 160 0.0178 +0.0363 320 0.0099 +0.0396 399 0.0084 +0.0324 收敛到 m = 0.0084(完整权重下是 0.9657) 从 0.966 翻转到 0.008。 策略选择了几乎完全静止。注意中间那列奖励——它一路从 $-0.0016$ 涨到 $+0.04$,总体上也比初始值高,但逐步有明显随机波动。这就是 01 节说的:奖励曲线不能告诉你模型学到了什么。 奖励曲面看得更清楚——同一组物理约束,两种权重下的形状完全相反: m 完整权重 去掉指令遵循 0.0 -0.0393 +0.0393 0.3 -0.0298 +0.0228 0.5 +0.0006 -0.0006 0.8 +0.0446 -0.0322 1.0 +0.0379 -0.0394 → 完整权重的最高点在 m = 0.8(+0.0446) → 去掉指令遵循后最高点在 m = 0.0(+0.0393) 完整权重下曲面在 $m = 0.8$ 处见顶;去掉指令遵循后,在这一玩具设定下整体偏向低运动强度;表格是每点 4000 次随机采样的估计,不能仅凭稀疏网格确立精确单调性或全局最优。 这张图要看什么:左图是同一组物理约束下的奖励曲面——完整权重(蓝实线)在 $m=0.8$ 附近见顶,去掉指令遵循三档后(红虚线)整条曲线翻转成单调递减,最高点直接落到 $m=0$。右图是同一个 GRPO、同一个初值跑 400 步:蓝线冲到 0.966(照做 prompt),红线掉到 0.008(躺平)。而两条浅色细线是各自的组内平均奖励——二者总体奖励改善,但都有采样噪声,不能靠奖励曲线判断是否符合需求。奖励曲线不能告诉你模型学到了什么。 结论落在这里:reward hacking 不是算法出了毛病,而是它精确地最大化了你真正写下来的那个目标。 同一个 GRPO、同一个物理约束,只改奖励的权重结构,行为就翻转了。查 hacking 该去查奖励函数,而不是调 RL 的超参。 还要区分两种目标:图中的曲面是在固定运动强度 $m$ 上的采样均值,策略优化的却是高斯探索后再裁剪的期望奖励。$\mu=0.966$ 是裁剪前策略均值参数,不是实际运动强度的期望;它与网格中 $m=0.8$ 的峰值不能直接比较。因此这些数字不能证明“策略梯度过冲”,更不能归因为探索噪声必然造成方向性偏置。 05. 工业级实现对照 参考实现(以 2026-08 的 main 分支为准,上游会重构): THUDM/VisionReward → inference-video.py:score、compare_two_videos THUDM/VisionReward → VisionReward_Video/weight.json:29 个线性权重 上面的最小实现把奖励当成一个现成函数,生产上它是个 VLM,差别都在这。 5.1 打分要跑 29 次前向 score() 的实际流程是:抽帧、对每个问题拼一次 prompt、让 VLM 输出 yes/no。29 个问题就是 29 次 VLM 前向。 这直接决定了 RL 训练的成本结构。GRPO 每步要采一组(比如 8 条视频),每条视频要 29 次 VLM 前向,也就是每个训练步 232 次前向——而这还没算生成那 8 条视频本身的去噪开销。奖励计算不是附带开销,它经常是训练循环里最贵的一环。这也是 Flow-GRPO 要做 Denoising Reduction 的现实压力来源。 5.2 两套问题清单,别拿错 仓库里有两个文件长得很像: VisionReward_video_qa.txt:64 个问题,用于细粒度查询(问模型某一项如何) VisionReward_video_qa_select.txt:29 个问题,用于打分 inference-video.py 顶部读的是 _select 那个: QUESTIONS_PATH = "VisionReward_Video/VisionReward_video_qa_select.txt" WEIGHT_PATH = "VisionReward_Video/weight.json" 29 条问题对应 29 个权重,一一对齐。拿 64 个那份去乘权重会直接维度不匹配——这算好事,至少会报错。 5.3 比较两个视频不是比分数 想判断 A 和 B 哪个好,直觉是各算一次 score() 再比大小。它没这么做——compare_two_videos() 的结尾是: answers1 = np.array([1 if answer == 'yes' else -1 for answer in answers1]) answers2 = np.array([1 if answer == 'yes' else -1 for answer in answers2]) diff = answers1 - answers2 return np.sum(diff * weight).item() > 0 先求两个答案向量的逐维差 diff,再加权求和判正负。 只要两次打分使用同一组答案与权重,这与比较两个 score() 完全等价(仅差正的常数 $K$),并不能阻止不同维度相互抵消。VisionReward 论文的“多维一致性”另指偏好优化时筛选在各语义维度都一致占优的样本对;不是把减法移到加权和里面。 5.4 那些数字:这套设计到底有多少提升 VisionReward 报告的两个结果: 偏好预测准确率比 VideoScore 高 17.2% 用它做奖励的文生视频模型,pairwise win rate 比用 VideoScore 高 31.6% 这两个百分比对应不同指标与实验,不能相除推断“奖励改进被 RL 放大了”。VisionReward 的偏好优化还包括 DPO 等流程;本文引用的是论文报告结果,不是视频 GRPO 的对照实测。 06. 代价与边界 杠杆是双向的。 持续优化可能放大奖励偏差,但幅度不是由 5.4 节的两个异质指标决定的。奖励模型里一个不起眼的偏见——比如偏爱暖色调、偏爱中心构图——在评测里可能只是一两个百分点,但 RL 会把它当成目标,训几千步之后就是全部输出都发黄。奖励模型的偏见不会被平均掉,会被放大。 优化的是奖励,不是质量。 这句话看着像废话,但它有个实践推论:奖励曲线上升不能作为训练成功的证据。4.4 节那次 hack 的奖励曲线($-0.0016 \to +0.04$)和 4.3 节那次成功训练长得一模一样。 那怎么才能发现?三个手段,按性价比排: 盯住奖励模型看不见的指标。 挑几个不参与奖励计算的量化指标定期记录,比如帧间光流的平均幅度、逐帧 LPIPS 差异。静态 hack 在这类指标上一眼就露馅(光流幅度趋近 0),而奖励模型完全不看它们。这个办法便宜、能自动化,应该默认开着。 看奖励的维度分解,不只看总分。 VisionReward 这种线性结构的好处正在这里——把 29 维的得分分别记下来。总分涨、但某几维在持续下跌,就是套利正在发生。4.4 节第 5 段那张表就是这么读的。 固定一批 prompt 定期人眼看。 最贵但不可替代。前两个手段只能发现你预料到的失效模式,人眼能发现你没预料到的。 至于用第二个奖励模型交叉验证——听起来对称,实际有个陷阱:如果两个奖励模型是用同源的偏好数据训的,它们很可能共享同样的盲区,交叉验证会一起点头。要用就得选训练数据和架构都不同的。 成本很实在。 按 5.1 节的账,每个训练步是「$G$ 条视频的完整采样+ $29G$ 次 VLM 前向」。视频采样本身就比图像贵一个量级(多了时间维度),再乘上组大小,这是 RL 在视频上落地慢的主要原因。Denoising Reduction 这类工程手段不是优化项,是可行性前提。 线性加权是双刃剑。 它带来可解释性,也带来可套利性——线性函数没有交互项,意味着「这一维差到极点」不会拖累其他维度的加分。真实的人类判断不是这样的:一个完全静止的「视频」在人眼里直接不合格,不管它多精细。线性模型表达不了这种否决关系,所以 04 节那个套利在数学上成立。 什么时候不该用 RL。 如果你的问题能用更直接的手段解决,就别上 RL。想让输出更清晰——去修数据和 VAE;想让它听懂 prompt——先确认是不是文本编码器或者标注质量的问题。RL 适合的是「说得清好坏、但写不出损失函数」的目标,比如整体美感、运动自然度这类只能靠比较来表达的偏好。上 RL 之前先问一句:我的奖励模型真的比我的损失函数更懂这件事吗? 07. 经典论文脉络 这条线分两支:怎么优化和拿什么当奖励。两支交替推进。 奖励这一支: ImageReward(arXiv:2304.05977,2023-04)第一个规模化的文生图人类偏好模型,确立了「收集成对偏好数据训一个打分器」这个范式。它是个黑盒标量,可解释性问题从这里就留下了。 VideoScore(arXiv:2406.15252,2024-06)把细粒度人类反馈搬到视频上,成为视频奖励模型的常用基线——也就是 VisionReward 那两个数字(17.2% / 31.6%)超越的对象。 VisionReward(arXiv:2412.21059,2024-12)用分层是非题 + 线性加权换来可解释性,图像和视频统一处理。代价是线性结构本身可被套利(06 节)。 优化这一支: DDPO(arXiv:2305.13301,2023-05)把去噪过程当成多步决策,第一次让 policy gradient 在扩散模型上跑通。 DPOK(arXiv:2305.16381,2023-05)同期工作,补上了 KL 正则——防止策略为了刷奖励跑离原始分布太远。这是对付 hacking 最基本的护栏。 Diffusion-DPO(arXiv:2311.12908,2023-11)绕开 RL:直接用成对偏好数据做监督式优化,省掉在线采样。简单稳定,代价是只能利用已有的偏好数据,没有探索。 GRPO(arXiv:2402.03300,2024-02)出自 DeepSeekMath,本是给语言模型数学推理用的。用组内相对优势替掉 critic,把 RLHF 的工程复杂度砍掉一大块。 Flow-GRPO(arXiv:2505.05470,2025-05)第一个把在线 policy gradient 接进 flow matching 的工作,靠 ODE→SDE 转换取得随机逐步转移的可计算似然(3.2 节)。在文生图上把 GenEval 从 63% 拉到 95%、视觉文字渲染从 59% 到 92%。 需要说明:Flow-GRPO 的实验是在文生图上做的(SD3.5-M),不是视频。它之所以是视频 RL 的关键前置,是因为主流视频模型也是 flow matching 训的,ODE→SDE 那套推导可以直接搬过来——但视频上的实证还远没有图像充分。 08. 常见误解 「奖励涨了就是训好了」。 01 节整节都在讲这件事。奖励是你自己写的目标函数,模型最大化它是本分。奖励上升唯一证明的是优化在工作,不是效果在变好。 「reward hacking 是 RL 算法的问题,换个算法就好了」。04.4 节那个对照实验就是为了拆掉这个想法:同一个 GRPO,只改奖励权重,行为从 $m = 0.966$ 翻到 $m = 0.008$。算法只是执行者。出了 hacking 该去审奖励函数。 「GRPO 比 PPO 好」。 它主要是更省——不用训 critic,少一个网络和一堆超参。省掉 critic 的代价是必须一次采一组样本才能估出基线,采样开销更大。在视频这种采样极贵的场景里,这个权衡并不是无脑赚。 「多加几个奖励维度就能防 hacking」。 加维度确实提高了套利难度,但只要还是线性加权,套利空间就存在——4.2 节那个例子里有 29 个维度,静态依然套出了 1.1 的净收益。真正起作用的是权重结构(指令遵循占 37.4% 才压住了它),以及 DPOK 那种把策略拴在原始分布附近的 KL 护栏。 「flow matching 模型可以直接套用扩散模型的 RL 方法」。按随机转移似然做 PPO/GRPO 时,需要先定义非退化随机转移,例如 3.2 节的 ODE→SDE 路线。确定性 ODE 的输出边缘密度、可微奖励路径导数等另有方法,并不是所有 RL 都必须给每一步加噪。 09. 动手验证 三个实验,用到的脚本全文都在文末附录,纯 NumPy,没有 GPU 依赖,复制存成同名文件就能跑。 实验一:给自己的奖励函数算套利空间。 跑 reward_hacking.py,看第 2 段那笔账。然后把你自己项目里奖励各维度的权重填进 DIMS,重算一遍「静止能白拿 / 要放弃」的净收益。预期结论是:只要净收益为正,你的模型早晚会发现它。 实验二:找出翻转的临界点。 跑 grpo_minimal.py,把指令遵循的三个权重乘一个系数 $c$(改 weight_without_instruction 为按比例缩放),从 $c = 1.0$ 逐步降到 $0$,看收敛的 $m$ 在哪一步从 0.97 掉到 0.01。预期是个比较陡的转折而不是平滑过渡——这意味着奖励权重的微小改动可能导致行为质变,调权重时值得扫一遍而不是只试一个值。 实验三:验证组大小对方差的影响。 还是 grpo_minimal.py,把 group 从 32 改成 4、8、64,各跑三个不同 seed。预期看到组越小、收敛点越不稳定——因为组内均值和标准差是用这几个样本估的,样本太少基线就不可靠。还要一起权衡采样成本、同分组概率、奖励稀疏度和并行吞吐。 本文三张配图由 make_figures.py 生成(这个需要额外装 pip install matplotlib,其余脚本只要 NumPy)。想复现就把权重换成你自己的:左边的权重账本换成你的 29 维,右边的曲面和 GRPO 轨迹会直接告诉你你的奖励函数在纵容哪种躺平。 10. 延伸阅读 这篇在知识树里是 L4(前沿专题),前面还有三级台阶。如果 03 节读起来吃力,按下面顺序补更省时间: 策略梯度与 PPO 基础——3.1 节那个对数导数技巧、为什么要减基线、clip 是干什么的,都属于那一篇 从 DPO 到 GRPO:去掉价值网络——GRPO 本身的完整讨论在那篇。本文只用到它「组内相对优势」这一个机制,没有展开和 PPO、DPO 的对比 把 RL 用到扩散模型上——DDPO 那套「把去噪当多步决策」的建模 流匹配与 Rectified Flow——3.2 节 ODE→SDE 转换的前提 读完这篇可以继续看: 人类偏好数据怎么收(还没写)——4.1 节那 29 个权重是怎么从成对比较数据里拟合出来的 视频质量评测指标(还没写)——06 节说的那三个检测手段该怎么落实,尤其是「奖励模型看不见的指标」具体该记哪些 附录:完整代码 09 节用到的脚本全文如下(make_figures.py、reward_hacking.py、grpo_minimal.py)。复制到本地存成同名文件,按各脚本开头的依赖说明准备环境后即可运行。 make_figures.py #!/usr/bin/env python3 # -*- coding: utf-8 -*- """生成「视频生成中的强化学习与奖励模型」的三张解释图。 数值一律从同目录两个脚本里取(reward_hacking 的 29 个真实权重、 grpo_minimal 的奖励曲面与 GRPO 轨迹),这里只负责画——那边改了这里要重跑, 免得图和正文数字打架。 三张图分别回答: 1. 29 个奖励权重的账本长什么样(为什么「有没有照做」压过「好不好看」) 2. 组内优势到底把什么信息抽出来了(原始奖励看着都一样,标准化后才有正负) 3. 只改奖励权重、不动算法,GRPO 为什么会从「照做」翻转成「躺平」 只依赖 numpy + matplotlib。跑法:python make_figures.py """ import textwrap from pathlib import Path import matplotlib.pyplot as plt import numpy as np import grpo_minimal as G from reward_hacking import NAMES, WEIGHT ROOT = Path(__file__).resolve().parents[1] OUT = ROOT / "figures" OUT.mkdir(parents=True, exist_ok=True) plt.rcParams.update({ "font.sans-serif": ["PingFang SC", "Arial Unicode MS", "DejaVu Sans"], "axes.unicode_minus": False, "figure.dpi": 160, "savefig.bbox": "tight", }) INK = "#1f2937" MUTE = "#6b7280" C_INSTR = "#d1495b" # 指令遵循:红 C_OTHER = "#2f6fb0" # 其余维度:蓝 C_AES = "#c9ced6" # 构图/色彩:灰 C_FULL = "#2f6fb0" # 完整权重 C_NOIN = "#d1495b" # 去掉指令遵循 C_POS = "#2f9e6f" # 优势为正 C_NEG = "#d1495b" # 优势为负 # 维度分组(下标对应 reward_hacking.DIMS 的顺序) GROUPS = [ ("指令遵循", [0, 1, 2], C_INSTR), ("构图+色彩", [3, 4, 6], C_AES), ("光照", [7, 8, 9, 10, 11, 12], C_OTHER), ("形状保持", [13, 14, 15, 16, 17], C_OTHER), ("运动", [5, 18, 19, 20, 21], C_OTHER), ("画质+细节", [22, 23, 24, 25], C_OTHER), ("文字+内容", [26, 27, 28], C_OTHER), ] def style(ax, title, xlabel=None, ylabel=None): ax.set_title(title, fontsize=11.5, color=INK, pad=10, loc="left") if xlabel: ax.set_xlabel(xlabel, fontsize=10, color=MUTE) if ylabel: ax.set_ylabel(ylabel, fontsize=10, color=MUTE) ax.tick_params(colors=MUTE, labelsize=9) for s in ("top", "right"): ax.spines[s].set_visible(False) for s in ("left", "bottom"): ax.spines[s].set_color("#d1d5db") ax.grid(alpha=0.25, linewidth=0.6, axis="y") ax.set_axisbelow(True) def footer(fig, text, width=118): """把「这张图要看什么」放到坐标轴下方。 必须放在 y<0:bbox_inches="tight" 会把负坐标的 artist 一起收进来, 放在 0~0.05 之间会和 x 轴标签叠在一起。 """ wrapped = "\n".join(textwrap.wrap(text, width=width)) fig.text(0.012, -0.13, wrapped, fontsize=8.5, color=MUTE, va="top", ha="left", linespacing=1.6) # ────────────────────────────────────────────────────────────────────── # 图 1:29 个奖励权重的账本 # ────────────────────────────────────────────────────────────────────── def fig_weight_ledger(): order = np.argsort(WEIGHT) # 从小到大,画出来是升序 colors = [C_INSTR if i in (0, 1, 2) else C_AES if i in (3, 4, 6) else C_OTHER for i in order] labels = [NAMES[i] for i in order] fig, axes = plt.subplots(1, 2, figsize=(12.6, 6.4), gridspec_kw={"width_ratios": [1.45, 1]}) fig.subplots_adjust(wspace=0.34) ax = axes[0] ax.barh(np.arange(29), WEIGHT[order], color=colors, height=0.72) ax.set_yticks(np.arange(29)) ax.set_yticklabels(labels, fontsize=7.6) ax.set_xlim(0, WEIGHT.max() * 1.18) ax.tick_params(axis="y", length=0) style(ax, "29 个维度的权重(升序)", "权重 $w_k$", None) # 最高 / 最低标注 ax.text(WEIGHT[order][-1] + 0.02, 28, f"{WEIGHT.max():.4f} 最高", fontsize=8.5, color=INK, va="center") ax.text(WEIGHT[order][0] + 0.02, 0, f"{WEIGHT.min():.4f} 最低", fontsize=8.5, color=MUTE, va="center") # 图例:红=指令遵循,灰=构图色彩,蓝=其余 from matplotlib.patches import Patch ax.legend(handles=[ Patch(color=C_INSTR, label="指令遵循(3 维)"), Patch(color=C_AES, label="构图+色彩(3 维)"), Patch(color=C_OTHER, label="其余(23 维)"), ], fontsize=8.2, frameon=False, loc="lower right") ax = axes[1] gcolor = {name: c for name, _, c in GROUPS} gs = [(name, float(WEIGHT[idx].sum())) for name, idx, _ in GROUPS] gs.sort(key=lambda t: -t[1]) total = WEIGHT.sum() ys = np.arange(len(gs)) # 颜色必须按排序后的名字取:按 GROUPS 顺序 zip 会跟排序后的柱子错位 ax.barh(ys, [v for _, v in gs], color=[gcolor[n] for n, _ in gs], height=0.7) ax.set_yticks(ys) ax.set_yticklabels([n for n, _ in gs], fontsize=9) ax.tick_params(axis="y", length=0) for i, (_, v) in enumerate(gs): ax.text(v + 0.03, i, f"{v:.3f} ({v / total * 100:.1f}%)", fontsize=8.2, color=INK, va="center") ax.set_xlim(0, max(v for _, v in gs) * 1.45) style(ax, "按语义归堆:谁在主导总分", "权重合计", None) fig.suptitle("图 1 VisionReward 的 29 个权重不是均衡的:" "指令遵循一家占了 37.4%,构图加色彩只有 1.5%", fontsize=12, color=INK, x=0.012, ha="left", y=1.02) footer(fig, "要看什么:左图是 29 个权重从低到高排开——最高的「指令-未完全失败」1.1418," "最低的「细节-不粗糙」0.0085,相差 134 倍,根本不是「各维度都重要」的均衡奖励。" "右图把它们按语义归堆后更刺眼:指令遵循三档合计 2.3486,一家吃掉 37.4%;" "而构图加色彩只有 0.0924、占 1.5%。真实人类偏好数据里," "「有没有照着 prompt 做」比「好不好看」重要二十多倍——这个结构是后面所有套利的源头。") fig.savefig(OUT / "reward_weight_ledger.png") plt.close(fig) print(f"[图1] 29 维权重合计 {total:.4f};最高 {WEIGHT.max():.4f}/最低 {WEIGHT.min():.4f}" f" = {WEIGHT.max() / WEIGHT.min():.0f} 倍;指令遵循占 " f"{WEIGHT[[0, 1, 2]].sum() / total * 100:.1f}%") # ────────────────────────────────────────────────────────────────────── # 图 2:组内优势把「谁比谁好」抽出来 # ────────────────────────────────────────────────────────────────────── def fig_group_advantage(): rng = np.random.default_rng(2024) rs = 8.0 + rng.random(8) * 0.2 # 同一个 prompt 采 8 条,分都挤在 8.0~8.2 adv = (rs - rs.mean()) / (rs.std() + 1e-8) idx = np.arange(1, 9) fig, axes = plt.subplots(1, 2, figsize=(12.6, 4.6)) fig.subplots_adjust(wspace=0.26) ax = axes[0] ax.bar(idx, rs, color=C_OTHER, width=0.62) ax.set_ylim(0, 8.9) ax.set_xticks(idx) style(ax, "原始奖励:8 条都在 8.0~8.2 之间", "组内第 i 条", "奖励 $r_i$") for i, v in zip(idx, rs): ax.arrow(i, v + 0.42, 0, 0.30, width=0.055, color=INK, length_includes_head=True, head_width=0.16, head_length=0.12) ax.text(0.99, 8.72, "每一条都在说:往我这边推(只是力度略有差别)", fontsize=8.6, color=MUTE, ha="right", va="top") ax.text(0.02, 0.30, f"极差只有 {rs.max() - rs.min():.2f}", fontsize=8.6, color=INK, transform=ax.transAxes) ax = axes[1] cols = [C_POS if a >= 0 else C_NEG for a in adv] ax.bar(idx, adv, color=cols, width=0.62) ax.axhline(0, color=INK, lw=1.0) ax.set_xticks(idx) ax.set_ylim(-2.0, 2.0) for i, v in zip(idx, adv): ax.text(i, v + (0.09 if v >= 0 else -0.09), f"{v:+.2f}", ha="center", va="bottom" if v >= 0 else "top", fontsize=8, color=INK) style(ax, "减均值除标准差后:谁该推、谁该压,一眼分清", "组内第 i 条", "优势 $A_i$") ax.text(0.98, 0.94, "绿的往上推,红的往下压;组内均值自动当基线", fontsize=8.6, color=MUTE, ha="right", va="top", transform=ax.transAxes) fig.suptitle("图 2 GRPO 的组内基线:把「绝对分多高」换成「谁比谁好」", fontsize=12, color=INK, x=0.012, ha="left", y=1.04) footer(fig, "要看什么:左图是同一个 prompt 采出的 8 条视频的奖励,全挤在 8.0 到 8.2 之间——" "如果直接把 $r_i$ 乘在梯度上,8 条样本会一起喊「往我这边推」,只是力气略有差别," "有用的信息被绝对值淹没了(箭头方向完全一致)。右图减掉组内均值、除以组内标准差之后," "同样的 8 个数字变成了有正有负的优势:一半往上推、一半往下压。" "这就是 GRPO 不用 critic 也能训的原因——基线是从同组样本里白捡的。") fig.savefig(OUT / "group_advantage.png") plt.close(fig) print(f"[图2] 8 条奖励 {rs.min():.3f}~{rs.max():.3f}(极差 {rs.max() - rs.min():.3f});" f"优势 {adv.min():+.2f}~{adv.max():+.2f}") # ────────────────────────────────────────────────────────────────────── # 图 3:只改奖励权重,同一个 GRPO 翻转 # ────────────────────────────────────────────────────────────────────── def _trace_grpo(weight=None, seed=0, steps=400, group=32, lr=0.35, sigma=0.15): """复刻 grpo_minimal.grpo 的循环,只是把每步的 m 和组内平均奖励记下来。 抽随机的顺序必须和原函数完全一致,否则数字对不上正文。 """ rng = np.random.default_rng(seed) theta = 0.0 ms, rr = [], [] for _ in range(steps): mu = 1 / (1 + np.exp(-theta)) eps = rng.normal(0, sigma, group) m_clip = np.clip(mu + eps, 0.0, 1.0) r = np.array([G.reward(m, rng, weight) for m in m_clip]) adv = (r - r.mean()) / (r.std() + 1e-8) grad = float(np.mean(adv * eps / sigma ** 2) * mu * (1 - mu)) theta += lr * grad ms.append(mu) rr.append(float(r.mean())) return np.array(ms), np.array(rr), 1 / (1 + np.exp(-theta)) def fig_surface_flip(): w_no = G.weight_without_instruction() # 奖励曲面:与 grpo_minimal.main 同口径(rng=7,每点 4000 次采样) rng = np.random.default_rng(7) grid = np.linspace(0, 1, 21) surf_full, surf_no = [], [] for m in grid: surf_full.append(float(np.mean([G.reward(m, rng) for _ in range(4000)]))) surf_no.append(float(np.mean([G.reward(m, rng, w_no) for _ in range(4000)]))) surf_full = np.array(surf_full) surf_no = np.array(surf_no) # 正文引用的那张 11 点表,峰值标注以它为准 rng2 = np.random.default_rng(7) tbl = np.linspace(0, 1, 11) tf, tn = [], [] for m in tbl: # 抽随机顺序与 grpo_minimal.main 完全一致(逐点交错),否则峰值数字对不上正文 tf.append(float(np.mean([G.reward(m, rng2) for _ in range(4000)]))) tn.append(float(np.mean([G.reward(m, rng2, w_no) for _ in range(4000)]))) tf, tn = np.array(tf), np.array(tn) pk_f, pk_n = tbl[int(tf.argmax())], tbl[int(tn.argmax())] ms_full, rr_full, m_end_full = _trace_grpo(weight=None, seed=0) ms_no, rr_no, m_end_no = _trace_grpo(weight=w_no, seed=0) fig, axes = plt.subplots(1, 2, figsize=(12.6, 5.0)) fig.subplots_adjust(wspace=0.30) ax = axes[0] ax.plot(grid, surf_full, lw=2.4, color=C_FULL, label="完整 29 维权重") ax.plot(grid, surf_no, lw=2.4, color=C_NOIN, ls="--", label="去掉指令遵循三档") ax.axhline(0, color="#9ca3af", lw=0.8) ax.scatter([pk_f], [tf.max()], s=70, color=C_FULL, zorder=5) ax.scatter([pk_n], [tn.max()], s=70, color=C_NOIN, zorder=5) ax.annotate(f"最高点 m={pk_f:.1f}", (pk_f, tf.max()), textcoords="offset points", xytext=(10, -30), fontsize=8.6, color=C_FULL, arrowprops=dict(arrowstyle="->", color=C_FULL, lw=1.0)) ax.annotate(f"最高点 m={pk_n:.1f}", (pk_n, tn.max()), textcoords="offset points", xytext=(18, 26), fontsize=8.6, color=C_NOIN, arrowprops=dict(arrowstyle="->", color=C_NOIN, lw=1.0)) ax.legend(fontsize=8.6, frameon=False, loc="lower center") style(ax, "同一组物理约束,两种权重下的奖励曲面形状完全相反", "运动强度 $m$", "期望奖励 $r$") ax = axes[1] ax.plot(ms_full, lw=2.4, color=C_FULL, label="m(完整权重)") ax.plot(ms_no, lw=2.4, color=C_NOIN, ls="--", label="m(去掉指令遵循)") ax.set_ylim(-0.05, 1.05) ax.set_xlabel("训练步", fontsize=10, color=MUTE) ax.set_ylabel("运动强度 $m$", fontsize=10, color=MUTE) ax2 = ax.twinx() ax2.plot(rr_full, lw=1.1, color=C_FULL, alpha=0.45) ax2.plot(rr_no, lw=1.1, color=C_NOIN, alpha=0.45, ls="--") ax2.set_ylabel("组内平均奖励(浅色细线)", fontsize=9, color=MUTE) ax2.tick_params(colors=MUTE, labelsize=8.5) ax2.spines["top"].set_visible(False) h1, l1 = ax.get_legend_handles_labels() ax.legend(h1, l1, fontsize=8.6, frameon=False, loc="center right") style(ax, "同一个 GRPO 跑 400 步:一条冲到 0.97,一条躺到 0.01", None, None) ax.set_ylabel("运动强度 $m$", fontsize=10, color=MUTE) ax.set_xlabel("训练步", fontsize=10, color=MUTE) ax.text(0.02, 0.06, f"完整权重收敛 m={m_end_full:.3f}\n" f"去掉指令遵循收敛 m={m_end_no:.3f}", fontsize=8.4, color=INK, transform=ax.transAxes, va="bottom", bbox=dict(fc="white", ec="#d1d5db", lw=0.7, pad=4)) fig.suptitle("图 3 奖励曲线一样漂亮,学到的东西完全相反", fontsize=12, color=INK, x=0.012, ha="left", y=1.03) footer(fig, "要看什么:左图是同一组物理约束下的奖励曲面。完整权重(蓝实线)在 m=0.8 附近见顶," "去掉指令遵循三档后(红虚线)整条曲线翻转成单调递减,最高点直接落到 m=0——彻底不动才是最优解。" "右图是同一个 GRPO、同一个初值跑 400 步:蓝线冲到 0.966 选择照做 prompt," "红线掉到 0.008 选择躺平。而两条浅色细线是各自的组内平均奖励——它们都在稳步上涨," "形状和一次成功的训练没有任何区别。奖励曲线不能告诉你模型学到了什么。") fig.savefig(OUT / "reward_surface_flip.png") plt.close(fig) print(f"[图3] 曲面峰值:完整 m={pk_f:.1f} ({tf.max():+.4f})," f"去掉指令 m={pk_n:.1f} ({tn.max():+.4f});" f"GRPO 收敛 {m_end_full:.4f} vs {m_end_no:.4f}") def main(): fig_weight_ledger() fig_group_advantage() fig_surface_flip() print(f"[OK] 三张图已写入 {OUT}") for f in sorted(OUT.glob("*.png")): print(f" {f.name} {f.stat().st_size / 1024:.0f} KB") if __name__ == "__main__": main() reward_hacking.py """用 VisionReward 的真实权重,算一遍「静态视频能不能骗到高分」。 权重与问题取自 THUDM/VisionReward(2026-08 的 main 分支): VisionReward_Video/weight.json 29 个线性权重 VisionReward_Video/VisionReward_video_qa_select.txt 29 个 yes/no 问题 打分公式同 inference-video.py 的 score():yes=+1,no=-1,乘权重后取均值。 注意:下面两个视频的 yes/no 画像是**按各维度语义做的人工假设**, 不是真实模型的输出。它用来说明权重结构本身允许什么样的套利, 不构成对 VisionReward 实际表现的评测。 运行 `python reward_hacking.py`。 """ import numpy as np # (权重, 维度简称) —— 顺序与上游 weight.json 严格一致 DIMS = [ (0.9544, "指令-全部满足"), (0.2524, "指令-大部分满足"), (1.1418, "指令-未完全失败"), (0.0350, "构图-美观"), (0.0252, "构图-无明显缺陷"), (0.1260, "镜头运动-无明显缺陷"), (0.0322, "色彩-不难看"), (0.1629, "光照-完全准确"), (0.2167, "光照-无明显错误"), (0.0197, "光照-存在"), (0.1360, "光照-极美"), (0.0965, "光照-美"), (0.1549, "光照-不难看"), (0.1294, "首帧形状-完全准确"), (0.0989, "首帧形状-无明显错误"), (0.1884, "首帧形状-不混乱"), (0.1844, "全程形状-完美保持"), (0.2636, "全程形状-不混乱"), (0.1117, "镜头运动-高度动态"), (0.0517, "镜头运动-不微弱"), (0.0256, "物体运动-非常平滑"), (0.4390, "物体运动-完全真实"), (0.2686, "画质-非常稳定"), (0.4293, "细节-非常精细"), (0.0085, "细节-不粗糙"), (0.1276, "细节-不显著粗糙"), (0.0580, "文字-全部正确"), (0.1446, "文字-存在"), (0.3942, "内容-属于物理世界"), ] WEIGHT = np.array([w for w, _ in DIMS]) NAMES = [n for _, n in DIMS] Y, N = 1, -1 # 视频 A:几乎静止的精致画面。prompt 要求「人物走过街道」,它只给了个站着的人。 STATIC = [ N, N, Y, # 指令:没走,但也不算完全没关系 Y, Y, # 构图:精心构图 Y, # 镜头运动无缺陷(没动,自然没缺陷) Y, # 色彩 Y, Y, Y, Y, Y, Y, # 光照:静态画面容易做好 Y, Y, Y, # 首帧形状:完美 Y, Y, # 全程形状:不动=完美保持 N, N, # 镜头动态:没有 Y, Y, # 物体运动:平滑(无运动可挑)、真实(无违反物理) Y, # 画质稳定:不动=极稳 Y, Y, Y, # 细节:静态可以渲染很精细 Y, Y, # 文字 Y, # 属于物理世界 ] # 视频 B:真的走起来了,但运动带来形变、抖动和轻微模糊。 DYNAMIC = [ Y, Y, Y, # 指令:确实照做了 N, Y, # 构图:运动中构图一般 Y, # 镜头运动无明显缺陷 Y, # 色彩 N, Y, Y, N, Y, Y, # 光照:运动中光照没那么完美 Y, Y, Y, # 首帧形状:还行 N, N, # 全程形状:走动中有形变 ← 运动的代价 Y, Y, # 镜头动态:有 Y, Y, # 物体运动:平滑且真实 N, # 画质稳定:运动带来抖动 ← 运动的代价 N, Y, Y, # 细节:动态模糊,不够精细 ← 运动的代价 Y, Y, # 文字 Y, # 属于物理世界 ] def score(answers): """复刻 inference-video.py 的 score()。""" a = np.array(answers) assert len(a) == len(WEIGHT), f"维度不匹配: {len(a)} vs {len(WEIGHT)}" return float(np.mean(a * WEIGHT)) def main(): print("=== 1. 权重结构 ===") print(f" 29 个维度,权重总和 {WEIGHT.sum():.4f},均值 {WEIGHT.mean():.4f}") print(f" 最高 {WEIGHT.max():.4f}({NAMES[int(WEIGHT.argmax())]})") print(f" 最低 {WEIGHT.min():.4f}({NAMES[int(WEIGHT.argmin())]})") print(f" 最高/最低 = {WEIGHT.max() / WEIGHT.min():.0f} 倍") instr = WEIGHT[0] + WEIGHT[1] + WEIGHT[2] print(f"\n 指令遵循三档合计 {instr:.4f},占总权重 {instr / WEIGHT.sum() * 100:.1f}%") aes = WEIGHT[3] + WEIGHT[4] + WEIGHT[6] print(f" 构图+色彩合计 {aes:.4f},占总权重 {aes / WEIGHT.sum() * 100:.1f}%") print("\n=== 2. 静态套利的账 ===") shape_stable = WEIGHT[[16, 17, 22]].sum() motion = WEIGHT[[18, 19]].sum() print(f" 静止能白拿:全程形状保持+不混乱+画质稳定 = {shape_stable:.4f}") print(f" 静止要放弃:镜头高度动态+不微弱 = {motion:.4f}") print(f" 净收益 {shape_stable - motion:+.4f}" f" (yes/no 相差 2 个单位,实际影响 ×2 = {(shape_stable - motion) * 2:+.4f})") print("\n=== 3. 两个视频的实际得分 ===") s_static, s_dynamic = score(STATIC), score(DYNAMIC) print(f" 视频 A(几乎静止的精致画面,没照做 prompt) {s_static:+.4f}") print(f" 视频 B(照做了 prompt,但有形变和抖动) {s_dynamic:+.4f}") winner = "A(静态)" if s_static > s_dynamic else "B(动态)" print(f" 奖励模型更偏好:{winner} 差值 {abs(s_static - s_dynamic):.4f}") print("\n=== 4. 差异来自哪几个维度 ===") diff = (np.array(STATIC) - np.array(DYNAMIC)) * WEIGHT order = np.argsort(-np.abs(diff)) print(" (正值=这一维让静态视频占便宜)") for i in order[:8]: if diff[i] != 0: print(f" {diff[i]:+.4f} {NAMES[i]}") if __name__ == "__main__": main() grpo_minimal.py """GRPO 的最小可运行实现,跑在 VisionReward 的真实权重上。 策略只有一个参数:运动强度 m。这是刻意的——把维度压到 1 维, 才能看清 GRPO 到底把策略推向哪里,而不是被高维噪声淹没。 人为设定的玩具权衡(不是视频物理定律或真实 VLM 的测量): m 越大 → 指令遵循、动态性维度更容易拿 yes m 越大 → 形状保持、画质稳定、细节精细更容易拿 no(运动带来形变/抖动/模糊) prompt 明确要求运动("a person walking across the street"), 所以「照做」在语义上就等于 m 要大。看 GRPO 最后选了什么。 运行 `python grpo_minimal.py`。 """ import numpy as np from reward_hacking import WEIGHT, NAMES # 各维度对运动强度 m 的敏感方向 # +1: m 越大越容易 yes -1: m 越大越容易 no 0: 与 m 无关 SENSITIVITY = np.zeros(29) SENSITIVITY[[0, 1, 2]] = +1.0 # 指令遵循(prompt 要求运动) SENSITIVITY[[18, 19]] = +1.0 # 镜头动态 SENSITIVITY[[20, 21]] = +0.3 # 运动平滑/真实:要有运动才谈得上,但过猛会假 SENSITIVITY[[16, 17]] = -1.0 # 全程形状保持 SENSITIVITY[22] = -1.0 # 画质稳定 SENSITIVITY[[23, 24, 25]] = -0.7 # 细节精细(动态模糊) SENSITIVITY[[7, 8, 10, 11]] = -0.3 # 光照准确/美观:运动中更难保持 def yes_prob(m): """给定运动强度 m∈[0,1],各维度答 yes 的概率。 基线 0.5 表示「说不准」,敏感度把它往两边拉。 """ return np.clip(0.5 + SENSITIVITY * (m - 0.5) * 1.6, 0.02, 0.98) def sample_video(m, rng): """按概率采一个 yes/no 画像,yes=+1 no=-1。""" return np.where(rng.random(29) < yes_prob(m), 1, -1) # 指令遵循的三个维度。把它们置零就得到一个「只看画质」的奖励模型, # 用来对照权重结构对 reward hacking 的影响。 INSTRUCTION_DIMS = [0, 1, 2] def reward(m, rng, weight=None): """复刻 inference-video.py 的 score():np.mean(answers * weight)。""" w = WEIGHT if weight is None else weight return float(np.mean(sample_video(m, rng) * w)) def weight_without_instruction(): w = WEIGHT.copy() w[INSTRUCTION_DIMS] = 0.0 return w def grpo(steps=400, group=32, lr=0.35, sigma=0.15, theta0=0.0, seed=0, weight=None, verbose=False): """单参数 GRPO,返回收敛后的运动强度 m。 每步采 group 个动作,用组内均值/标准差做 baseline 得到 advantage, 再按 advantage 加权更新——不需要 critic,这是 GRPO 的核心简化。 为了看清裸的优化行为,这里省掉了 PPO 式的 clip 和对参考模型的 KL 惩罚。 """ rng = np.random.default_rng(seed) theta = theta0 for step in range(steps): # 策略:m = clip(sigmoid(theta) + noise),高斯探索 mu = 1 / (1 + np.exp(-theta)) eps = rng.normal(0, sigma, group) ms = np.clip(mu + eps, 0.0, 1.0) rs = np.array([reward(m, rng, weight) for m in ms]) # 组内相对优势:减均值除标准差 adv = (rs - rs.mean()) / (rs.std() + 1e-8) # 潜在动作 a = mu + eps 的高斯 score,m=clip(a) 只是环境映射。 # 这不是含边界原子质量的裁剪后 m 分布的逐点 log-density。 # ∂mu/∂theta = mu(1-mu) grad = float(np.mean(adv * eps / sigma ** 2) * mu * (1 - mu)) theta += lr * grad if verbose and (step % 80 == 0 or step == steps - 1): print(f" {step:>4} {mu:.4f} {float(rs.mean()):+.4f}") return 1 / (1 + np.exp(-theta)) def main(): print("=== 1. 优化前后的运动强度 ===") print(" step 运动强度 m 组内平均奖励") m_final = grpo(verbose=True) print(f"\n GRPO 收敛到 m = {m_final:.4f}") verdict = "静态(放弃了 prompt 要求的运动)" if m_final < 0.35 else \ "动态(照做了 prompt)" if m_final > 0.65 else "折中" print(f" → 策略选择:{verdict}") print("\n=== 2. 从不同初值出发是否都收敛到同一处 ===") for name, t0 in (("偏静态 (m≈0.27)", -1.0), ("中性 (m=0.50)", 0.0), ("偏动态 (m≈0.73)", 1.0)): mf = grpo(theta0=t0, seed=1) print(f" 初值 {name:<18} → 收敛 m = {mf:.4f}") print("\n=== 3. 奖励曲面:各运动强度的期望得分 ===") rng = np.random.default_rng(7) w_no_instr = weight_without_instruction() print(" m 完整权重 去掉指令遵循 (每点 4000 次采样)") best, best_no = (-9e9, None), (-9e9, None) for m in np.linspace(0, 1, 11): r = float(np.mean([reward(m, rng) for _ in range(4000)])) r2 = float(np.mean([reward(m, rng, w_no_instr) for _ in range(4000)])) best = max(best, (r, m)) best_no = max(best_no, (r2, m)) print(f" {m:.1f} {r:+.4f} {r2:+.4f}") print(f" → 完整权重的最高点在 m = {best[1]:.1f}({best[0]:+.4f})") print(f" → 去掉指令遵循后最高点在 m = {best_no[1]:.1f}({best_no[0]:+.4f})") print("\n=== 4. 对照:奖励模型不看指令遵循时,GRPO 选什么 ===") print(" step 运动强度 m 组内平均奖励") m_hack = grpo(weight=w_no_instr, seed=0, verbose=True) print(f"\n 收敛到 m = {m_hack:.4f}" f"(完整权重下是 {m_final:.4f})") print(" → 同一个算法、同一个物理约束,只改奖励的权重结构," "\n 策略就从「照做」翻转成「静止不动」。这就是 reward hacking 的来源:" "\n 不是算法坏了,是它精确地最大化了你真正写下来的那个目标。") print("\n=== 5. 两个收敛点在各维度上的差别 ===") p_ok, p_hack = yes_prob(m_final), yes_prob(m_hack) gap = (p_hack - p_ok) * WEIGHT order = np.argsort(np.abs(gap))[::-1] print(" (正值=hack 后的策略在这一维更容易拿 yes)") for i in order[:6]: print(f" {gap[i]:+.4f} {NAMES[i]}" f" (yes 概率 {p_ok[i]:.2f} → {p_hack[i]:.2f})") if __name__ == "__main__": main()
2026年08月23日
7 阅读
0 评论
0 点赞
2026-08-23
AIGC 基本功|旋转位置编码 RoPE 的原理与实现-RoPE
旋转位置编码 RoPE 的原理与实现 所属方向:注意力与核心零件 | 难度:核心组件 | 前置知识:MHA 关键词:位置编码、RoPE、旋转位置编码、相对位置、复数旋转、长度外推 01. 为什么需要它 先说一个具体的失败场景。 你训了一个视频 DiT,训练时用 480p、49 帧。推理时想出 720p、97 帧,结果画面从第 50 帧开始漂——人物五官慢慢挪位,背景纹理开始流动。你换了采样器、加了 CFG、调了 shift,都没用。 先把这次改动的量级算清楚。按常见配置(VAE 空间 8 倍、时间 4 倍压缩,再做 2×2 patchify): 480p/49 帧 → 13 个 latent 帧 × 1560 tokens/帧 = 20280 tokens 720p/97 帧 → 25 个 latent 帧 × 3600 tokens/帧 = 90000 tokens 总量涨了 4.44 倍,其中空间方向 2.31 倍、时间方向 1.92 倍。也就是说,模型要给四倍多的位置编号赋予意义,新增的较远坐标与注意力关系超出了训练范围(已有坐标仍然见过)。 这是一个待诊断的假设场景:位置编码、训练尺度、VAE、注意力规模和运动分布都可能造成失败,不能仅凭症状归因给 RoPE。 注意力机制本身是置换等变的:把输入序列的顺序打乱,输出也只是跟着打乱,每个 token 看到的上下文完全不变。换句话说,纯注意力分不清「第 3 帧」和「第 40 帧」。位置信息必须额外注入。 早期做法是可学习的绝对位置嵌入(learned absolute PE):给每个位置分配一个可训练向量,加到 token 上。这在训练长度内工作良好,但有个硬伤——没见过的位置没有对应向量。你训练时只见过 49 个位置,推理要 97 个,后面 48 个位置的嵌入是凭空来的,模型自然就崩了。 RoPE 解决的正是这件事:它不给位置分配「向量」,而是给位置分配「旋转角度」。角度公式可计算到新位置;生成质量能否外推仍需训练或扩展策略验证。 02. 最小可用理解 三句话: 把 query 和 key 的特征维度两两配对看成复数,每个位置 $m$ 把它们旋转 $m\theta$ 弧度。 两个向量做内积时,指数项相减,绝对位置 $m$、$n$ 自动消掉,只剩相对距离 $(m-n)$。 所以对固定的 q、k,位置项只依赖 token 间的相对距离;完整分数仍依赖内容特征,而旋转角度可以外推到训练时没见过的位置。 如果只记一件事:RoPE 是乘上去的旋转,不是加上去的向量。加法会污染特征的模长,旋转不会——这是它比绝对位置嵌入更「干净」的地方(3.4 节会把这句话量化)。 还有一个位置要记准:它作用在每一层注意力的 $q$ 和 $k$ 上,不是输入层加一次,通常不旋转 $v$。这是本文及常用实现的约定,某些变体也会旋转 value,不能一概判错。 03. 数学推导 3.1 我们到底想要什么性质 先把目标写成式子。设 $x_m$ 是位置 $m$ 上的 token 特征,我们要找一个变换 $f$,使得变换后的 query 和 key 的内积满足: $$\langle f(q, m), f(k, n) \rangle = g(q, k, m-n)$$ 左边依赖两个绝对位置 $m$ 和 $n$,右边只依赖它们的差值 $m-n$。这就是「相对位置不变性」的精确表述。注意 $g$ 的具体形式我们不关心,只要求它不含 $m$、$n$ 的单独出现。 3.2 复数域上的现成答案 二维情况下有个现成的东西满足这个条件:旋转。 把二维向量 $q = (q_0, q_1)$ 看成复数 $q_0 + iq_1$。复数乘法 $e^{im\theta}$ 的几何意义就是逆时针旋转 $m\theta$ 弧度,且不改变模长。 现在令 $f(q, m) = q e^{im\theta}$,算一下内积。复数域上的内积要取共轭: $$\langle f(q,m), f(k,n) \rangle = \mathrm{Re}\left[(q e^{im\theta}) \overline{(k e^{in\theta})}\right] = \mathrm{Re}\left[q \bar{k} e^{i(m-n)\theta}\right]$$ 关键一步在指数:$e^{im\theta} \cdot \overline{e^{in\theta}} = e^{im\theta} e^{-in\theta} = e^{i(m-n)\theta}$。绝对位置就这么消掉了,只留下 $(m-n)$。这就是 RoPE 的全部动机,后面所有工程细节都只是把这个二维结论铺到高维。 3.3 铺到高维 实际的 head_dim 是 64 或 128,不是 2。做法是把 $d$ 维切成 $d/2$ 组,每组两个相邻维度构成一个复数平面,第 $i$ 组用自己的旋转频率: $$\theta_i = \text{base}^{-2i/d}, \quad i = 0, 1, \dots, d/2 - 1$$ 这里的 base 就是代码里的 rope_theta,通常取 10000。 这个频率设计是理解 RoPE 行为的关键。展开看两端: $i = 0$ 时 $\theta_0 = 1$,位置每 +1 就转 1 弧度,转得最快 $i = d/2 - 1$ 时 $\theta_i \approx \text{base}^{-1} = 10^{-4}$,位置每 +1 只转 0.0001 弧度,转得最慢 也就是说,高频维度负责区分近距离,低频维度负责区分远距离。一个位置差 1 的 token 对,主要靠前面几维的相位差来分辨;位置差较大时,高频相位已多次绕圈,而低频相位仍提供变化较慢的尺度;各频段并非互斥地负责某一距离。 这张图要看什么:左图是 $\cos(m\theta_i)$ 的热力图(横轴位置、纵轴维度组)——256 长度内转满一整圈的只有前 13 组;这些高频组提供较大的近距离相位变化,维度索引越大,相位变化越慢,但并非不携带近距离位置信息;右图把位置拉到 32768,高频组早就转了几万弧度,低频组才刚积累出可分辨的相位。这是 32 组频率提供的多尺度结构,不是互斥的距离分工;后面所有外推方法(PI、NTK、YaRN)做的都是重新分配这个分工(图由 code/make_figures.py 生成)。 这个结构直接解释了长度外推的两种主流做法:位置插值(PI)把所有位置除以一个缩放因子,等价于整体降低旋转速度;NTK-aware 缩放只调 base,让低频维度转得更慢而尽量保住高频维度的分辨率。它们改的都是同一组 $\theta_i$。 写成矩阵形式,RoPE 就是一个分块对角的旋转矩阵 $R_m$,第 $i$ 个 $2\times2$ 块为: $$\begin{pmatrix} \cos m\theta_i & -\sin m\theta_i \\ \sin m\theta_i & \cos m\theta_i \end{pmatrix}$$ 于是注意力分数变成 $q_m^\top R_{n-m} k_n$——形式上是把相对位置信息塞进了双线性形式的中间,而没有动 $q$、$k$ 本身的模长。 3.4 「不改模长」为什么要紧 02 节说过 RoPE 是乘上去的旋转而不是加上去的向量,这里补上为什么这件事重要。 $R_m$ 是正交矩阵($R_m^\top R_m = I$),所以 $\|R_m x\| = \|x\|$——位置编码前后,token 的模长分毫不变。加法式绝对位置嵌入做不到这点:$\|x + p_m\| \neq \|x\|$,而且改变量取决于 $p_m$ 的方向,是随位置乱跳的。 这有实际后果。注意力分数里 $q$、$k$ 的模长直接决定 softmax 前的量级,而模长会影响打分量级,但不能普遍解释成 token 的重要性或置信度。加法式 PE 会把位置信息和这个量级搅在一起:同一个词放在句首和句中,模长不同,softmax 后的分布也跟着偏移。旋转则是干净的——位置只影响方向(相位),不碰长度。 实测一下(code/rope_decay.py 第 1 段): 原始向量模长 7.315344 RoPE 后(位置 0/1/100/511) 7.315344 7.315344 7.315344 7.315344 跨位置模长极差 8.88e-16 加法式 PE 后 9.843323 10.080425 10.808198 10.190631 跨位置模长极差 0.9649 ← 同一个 token 的模长被位置改写了 RoPE 那行四个位置的模长在浮点精度内完全一致(偏差 8.88e-16 是机器 epsilon 量级);加法式则在 9.84 到 10.81 之间晃,同一个 token 的「强度」被它所在的位置改写了将近 10%。 04. 代码实现 下面是完整可跑的最小实现。刻意用 numpy 而不是 PyTorch:讲原理时框架的抽象反而是噪声,而且 numpy 谁都能跑。 import numpy as np def build_rope_cache(seq_len: int, dim: int, base: float = 10000.0): """预计算 RoPE 的 cos/sin 表。 dim 必须是偶数:每两个相邻维度配成一个复数参与旋转。 base 就是常说的 rope_theta,调它会按维度改变旋转速度;最高频 i=0 始终为 1。 """ assert dim % 2 == 0, f"dim 必须为偶数,收到 {dim}" # theta_i = base^(-2i/dim):i 越大转得越慢,对应越低的频率 inv_freq = 1.0 / (base ** (np.arange(0, dim, 2) / dim)) pos = np.arange(seq_len) freqs = np.outer(pos, inv_freq) # [seq_len, dim/2] return np.cos(freqs), np.sin(freqs) def apply_rope(x: np.ndarray, cos: np.ndarray, sin: np.ndarray) -> np.ndarray: """把旋转作用到 x 上。x: [seq_len, dim] 最后一维两两配对看成复数 (x_even + i*x_odd),乘上 e^{i*m*theta}: 实部 = x_even * cos - x_odd * sin 虚部 = x_even * sin + x_odd * cos """ x_even, x_odd = x[..., 0::2], x[..., 1::2] out = np.empty_like(x) out[..., 0::2] = x_even * cos - x_odd * sin out[..., 1::2] = x_even * sin + x_odd * cos return out 验证核心性质:固定一对向量,只改赋予它们的绝对位置,间距始终为 1。如果推导是对的,内积应该完全不变。 rng = np.random.default_rng(0) seq_len, dim = 8, 64 cos, sin = build_rope_cache(seq_len, dim) q = rng.standard_normal(dim) k = rng.standard_normal(dim) for shift in range(4): qr = apply_rope(q[None, :], cos[shift:shift + 1], sin[shift:shift + 1]) kr = apply_rope(k[None, :], cos[shift + 1:shift + 2], sin[shift + 1:shift + 2]) print(f"位置 ({shift}, {shift + 1}) → 内积 {float(qr[0] @ kr[0]):.6f}") 真实输出: cos/sin 形状: (8, 32) (8, 32) 位置 1 的前 4 维 cos: [0.5403, 0.7318, 0.846, 0.9124] 位置 1 的末 2 维 cos: [1.0, 1.0] 同一对向量,平移绝对位置(间距恒为 1): 位置 (0, 1) → 内积 -11.297869 位置 (1, 2) → 内积 -11.297869 位置 (2, 3) → 内积 -11.297869 位置 (3, 4) → 内积 -11.297869 对照组,改变间距: 间距 1 → 内积 -11.297869 间距 2 → 内积 -12.637566 间距 3 → 内积 -13.049657 未加 RoPE 的原始内积: -9.701179 三个数字值得盯一下。 第一,四行内积完全相同(-11.297869),小数点后六位都不差。这就是 3.1 节那个式子在数值上的体现:绝对位置从 (0,1) 挪到 (3,4),分数一点没变。而间距一变(1→2→3),内积立刻变化。 第二,位置 1 的前 4 维 cos 是 0.5403、0.7318、0.846、0.9124,递增。对应 $\theta_i$ 递减:第 0 维转了整整 1 弧度(cos 1 ≈ 0.5403),第 3 维只转了约 0.42 弧度。这就是「高频维度在前」的直接观测。 第三,末 2 维 cos 打印出来是 1.0。不是真的等于 1,而是 $\theta_{31} \approx 10^{-4}$,位置 1 只转了 0.0001 弧度,$\cos(0.0001) = 0.999999995$,六位小数下显示成 1.0。这些维度在近距离上几乎不携带位置信息——它们是留给远距离的。也正因为如此,NTK-aware 缩放对这些低频维度施加更大压缩;实际质量代价仍取决于训练后的频段使用方式。 上面这张图(code/make_figures.py 图 3)把本节的两件事画在了一起。左图是平移不变性的可视化:同一对 $q$、$k$,把绝对起点放在 0 / 500 / 2000,逐点画出内积随相对距离的曲线——三条曲线完全重合(最大偏差 5.2e-13),这就是上面输出里「四行内积完全相同」的图形版。右图是另一个常被混着说的现象:距离越远,加了 RoPE 的分数与不加位置编码的原始内积的相关性在所采样的区间整体降低,但并不单调(4000 对随机向量实测,$\Delta=1$ 时 0.97、$\Delta=4096$ 时接近 0;对独立各向同性输入,虚线为 $\frac{2}{d}\sum_i\cos(\Delta\theta_i)$,d 是特征维度、Δ 是相对距离)。注意衰减的是这个相关性,不是内积本身的大小——旋转保模长,本文独立各向同性高斯向量的内积分布与距离无关(实验三会验证这一点)。 完整脚本见 code/rope_minimal.py。 4.1 顺手把两种外推方法也实现掉 3.3 节说过 PI 和 NTK-aware「改的都是同一组 $\theta_i$」。这句话用代码写出来就是两个函数,各三行——把它们并排放一起,两种方法的取舍立刻就清楚了。 def theta_original(dim=64, base=10000.0): return 1.0 / (base ** (np.arange(0, dim, 2) / dim)) def theta_pi(dim=64, base=10000.0, scale=8): """Position Interpolation:位置索引整体除以 scale。 等价于把每个 theta_i 都乘上 1/scale——所有频率被同等减速。""" return theta_original(dim, base) / scale def theta_ntk(dim=64, base=10000.0, scale=8): """NTK-aware:把 base 放大,让减速量随维度索引递增(频率越低减速越多)。""" new_base = base * scale ** (dim / (dim - 2)) return theta_original(dim, new_base) 跑 code/rope_extrapolate.py 看它们对各维度做了什么(外推 8 倍): 维度 i 原始 PI(÷8) NTK-aware PI减速比 NTK减速比 0 1.000e+00 1.250e-01 1.000e+00 8.00x 1.00x 4 3.162e-01 3.953e-02 2.418e-01 8.00x 1.31x 8 1.000e-01 1.250e-02 5.847e-02 8.00x 1.71x 16 1.000e-02 1.250e-03 3.419e-03 8.00x 2.92x 31 1.334e-04 1.667e-05 1.667e-05 8.00x 8.00x PI 那一列减速比是齐刷刷的 8.00x,从最高频到最低频一视同仁。NTK 那一列从 1.00x 单调爬到 8.00x——最高频维度完全没动,最低频维度承担了全部的 8 倍压缩。 这张图要看什么:左图把上表画成曲线——PI 是一条平线(每维都慢 8 倍),NTK 从最高频的 1.00x 单调爬到最低频的 8.00x,两条线夹出的面积就是「NTK 少减的部分」;右图是代价,PI 把每一维的近距离分辨率都砍到 12.5%,NTK 保住高频 100% 的代价是中低频一路掉到 34.2%。两种方法改的是同一组 $\theta_i$,区别只在把这次外推的代价放在哪个频段。 代价体现在近距离分辨率上: 维度 i 原始 PI NTK PI保留 NTK保留 0 1.000000 0.125000 1.000000 12.5% 100.0% 4 0.316228 0.039528 0.241809 12.5% 76.5% 8 0.100000 0.012500 0.058472 12.5% 58.5% 16 0.010000 0.001250 0.003419 12.5% 34.2% PI 让每维相邻位置的相位增量降到 12.5%;这可能影响局部分辨,但不等于任务指标必然下降,微调与模型适应会改变实际结果。NTK 在第 0 维保住了 100%,代价是第 16 维只剩 34.2%。 还有一个容易看漏的点。NTK 外推后,最高频维度在位置 32767 处的相位是 32767 弧度,仍然远超训练时见过的 4095: 训练时见过的最大相位(位置 4095) 4095.0 rad 原始(直接外推) 位置 32767 32767.0 rad ← 超出 8.0 倍 PI 位置 32767 4095.9 rad ← 接近但略超训练端点 4095 NTK-aware 位置 32767 32767.0 rad ← 超出 8.0 倍 这是该缩放的设计取舍:最高频保留原始步长,低频逐渐压缩。未展开相位超过训练最大值不等于必然失效,相位本身具有周期性;只有最低频获得完整 8 倍压缩,不能据此保证所有频段已回到训练范围或质量安全。PI 则把所有维度的相位范围压到接近训练区间,代价是相邻位置相位步长整体下降;精确端点对齐还需使用端点跨度比。YaRN 的贡献就是把「哪些频段该压、压多少」变成一组可调策略,而不是这两种极端。 05. 工业级实现对照 参考实现(以 2026-08 的 main 分支为准,上游重构频繁): huggingface/transformers → modeling_llama.py:LlamaRotaryEmbedding、rotate_half、apply_rotary_pos_emb huggingface/diffusers → embeddings.py:get_3d_rotary_pos_embed 生产代码和上面的最小实现有四处不一样,每一处都有理由。 5.1 配对方式不同,而且不能混用 这是最容易踩的坑。本文把第 $2i$ 和 $2i+1$ 维配成一个复数(奇偶交错),而 HF 的写法是把第 $i$ 和第 $i + d/2$ 维配成一对(前后半切分): def rotate_half(x): """Rotates half the hidden dims of the input.""" x1 = x[..., : x.shape[-1] // 2] x2 = x[..., x.shape[-1] // 2 :] return torch.cat((-x2, x1), dim=-1) q_embed = (q * cos) + (rotate_half(q) * sin) 配合 emb = torch.cat((freqs, freqs), dim=-1)(cos/sin 表沿最后一维复制两遍),展开就是 $x_i \cos - x_{i+d/2} \sin$ 和 $x_{i+d/2} \cos + x_i \sin$——和 3.3 节的旋转矩阵一模一样,只是谁跟谁配对换了。 那两者是等价的吗?我写了个脚本实测(code/rope_pairing.py): === 1. 两种配对都满足相对位置不变性 === 奇偶交错: 间距恒为 3 时内积 -13.049657,四个绝对位置间的最大波动 3.55e-15 前后半切分: 间距恒为 3 时内积 -7.706177,四个绝对位置间的最大波动 1.78e-15 === 2. 同一份权重下,两种配对给出的分数不同 === 奇偶交错 -13.049657 前后半切分 -7.706177 差值 5.343480 ← 不为 0,实现和权重必须配套 === 3. 重排维度后两者完全一致 === 奇偶交错(原始排布) -13.049657 前后半切分(重排后权重) -13.049657 差值 0.00e+00 ← 只差一个固定的维度置换 三段结论连起来才是完整答案:作为位置编码方案两者等价(都满足相对位置不变性,波动 1e-15 是纯浮点误差),但对同一份权重不可互换(差了 5.34),因为它们只差一个固定的维度置换(重排后差值精确为 0)。 实践意义:移植权重时如果配对方式对不上,模型不会报错,只会变笨。这种 bug 极难查——loss 能降,输出也通顺,就是长距离能力莫名其妙地差。判断办法很简单:看它的 cos/sin 表是 cat((freqs, freqs)) 还是 repeat_interleave(freqs, 2),前者是前后半切分,后者是奇偶交错。 5.2 inv_freq 存成 buffer,而且不进 checkpoint self.inv_freq = nn.Buffer(inv_freq, persistent=False) self.original_inv_freq = nn.Buffer(inv_freq.clone(), persistent=False) 缓存是为了省掉每步的幂运算。而 persistent=False 这个细节更值得说:它让 inv_freq 不写进 state_dict。好处是改 rope_theta 做长度外推时,不必担心 checkpoint 里存着旧频率把新配置覆盖掉——频率永远由 config 现算。留一份 original_inv_freq 是给 dynamic NTK 用的:那类方法会随序列长度临时改频率,改完得能退回原值。 5.3 接受 position_ids 而不是内部 arange def forward(self, x, position_ids): inv_freq_expanded = self.inv_freq[None, :, None].expand(position_ids.shape[0], -1, 1) position_ids_expanded = position_ids[:, None, :].float() 最小实现里位置就是 arange(seq_len),生产上不行,至少三个场景要显式传: KV cache 增量解码:第 101 个 token 单独前向,它的位置是 100 而不是 0 序列打包(packing):多条短样本拼成一条长序列喂进去,每条的位置要各自从 0 起算 多模态与视频:图像 token 和文本 token 的位置编号规则不同,位置得由外部算好 5.4 强制 fp32 算 cos/sin with maybe_autocast(device_type=device_type, enabled=False): freqs = (inv_freq_expanded @ position_ids_expanded).transpose(1, 2) emb = torch.cat((freqs, freqs), dim=-1) cos = emb.cos() * self.attention_scaling 注意它显式关掉了 autocast。原因是 $m\theta_i$ 在长序列下会长到几万,bf16 只有 8 位有效尾数,在这个量级上间隔已经大于 1——相邻位置会算出同一个角度,位置信息直接丢失。所以三角函数必须在 fp32 里算完,再转回低精度参与矩阵乘。 5.5 读陌生代码库时的四个问题 接手一个没见过的模型,想搞清它的 RoPE 怎么配的,按这个顺序问四个问题最快,也刚好对应上面四小节: cos/sin 表是怎么铺开的? 搜 cat 还是 repeat_interleave——torch.cat((freqs, freqs)) 是前后半切分,repeat_interleave(freqs, 2) 是奇偶交错。这决定了权重能不能和别的实现互换。 inv_freq 从哪来、会不会变? 搜 inv_freq 的赋值点。如果只在 __init__ 里算一次,就是静态 RoPE;如果 forward 里还会重算,大概是某种 dynamic NTK,那么推理时的行为会随序列长度变。 position_ids 谁给的? 如果是内部 arange,还要核对是否加了 cache offset 或传入各段位置;从零重启才会破坏 KV cache 增量解码,多模态场景基本要改。 三角函数在什么精度下算的? 搜附近有没有 float()、autocast、enabled=False。没有强制 fp32 的话,长序列下有精度隐患(5.4 节)。 这四个问题都能靠 grep 在几分钟内回答,比通读整个 attention 实现快得多。 5.6 视频侧:三个轴分走维度 视频 DiT 的 token 有时间、高、宽三个坐标,做法是把 head_dim 切成三份,每份跑一遍 1D RoPE 再拼起来。diffusers 里的分配是: dim_t = embed_dim // 4 # 时间轴,占 25% dim_h = embed_dim // 8 * 3 # 高,占 37.5% dim_w = embed_dim // 8 * 3 # 宽,占 37.5% 这个 1:1.5:1.5 的分配是 CogVideoX 相关实现的一种维度预算。不能从空间占 75%、时间占 25% 推断哪个轴更先失败或失败症状;需结合训练范围、每轴频率和实际消融。详见3D RoPE。 06. 代价与边界 RoPE 不是免费的。 它对固定内容向量只保证位置项的相对位置性质,不保证外推可用。 3.1 节那个性质对任意 $m$、$n$ 都成立,包括训练时没见过的位置。但「公式成立」和「效果好」是两件事:模型只在 $m\theta_i$ 落在见过的区间里学过怎么解释这些相位,超出去就是在外推一个没有监督过的函数。这也是为什么直接放长序列会崩,得配 PI 或 YaRN 这类手段。 它引入了远程衰减,而且衰减偏偏打在你最需要的地方。 这条值得展开,因为流传的说法不太准确。 「RoPE 自带远程衰减」几乎成了共识,但实测下来它只对一部分输入成立。我分两种情况量了一遍(code/rope_decay.py 第 2 段)。 先看彼此无关的随机 $q$、$k$: 不加 RoPE 6.2076 (基线) 相对距离 1 6.3182 (101.8% of 基线) 相对距离 64 6.2415 (100.5% of 基线) 相对距离 1024 6.2583 (100.8% of 基线) 相对距离 4000 6.4830 (104.4% of 基线) 完全没有衰减。 道理也简单:$R_m$ 是正交变换,对本文独立、各向同性高斯向量,不改变其内积的统计分布;任意非各向同性输入并无这个保证,转多少度都一样。 再看 $q = k$(一对高度相似的 token,比如相邻帧里的同一个主体): 全 1 向量(gap=0 时内积 64.00): 相对距离 1 +61.8337 ( 96.6% of gap=0) 相对距离 16 +38.7456 ( 60.5% of gap=0) 相对距离 64 +27.8122 ( 43.5% of gap=0) 相对距离 1024 +16.8272 ( 26.3% of gap=0) 相对距离 4000 +0.0989 ( 0.2% of gap=0) 衰减掉了 99.8%。 换个随机向量做同样的实验,结论一致(50.96 → 0.97)。 这两组实验只展示了各向同性独立输入与所选相似输入的差别。RoPE 的相位加权和依赖内容在各频段的分布;既不能推出“只有相似 token 才受影响”,也不能据此将真实视频的身份漂移归因于 RoPE,后者需要固定模型的消融实验。 顺带一个细节:衰减不是单调的。上面那个随机向量在 gap=256 处回升到 51.3%,比 gap=64 的 40.9% 还高。它是震荡衰减,因为各频率分量的相位在不同距离上会偶然重新对齐。所以拿单个距离点的数值下结论是不可靠的。 它无法表达绝对位置。 「这是第一帧」这类信息 RoPE 表达不了,因为它被设计成只看差值。需要绝对锚点的任务(比如首帧条件生成、指定时间戳编辑)得靠别的机制补,通常是额外的条件注入而不是位置编码。 算力和显存几乎不是代价。 这点顺手算清楚,免得担错心。拿 01 节那个 90000 token 的 720p 配置、假设 40 层 24 头、head_dim 64: 旋转本身约 33.2 GFLOPs,而同规模的注意力矩阵乘是 995.3 TFLOPs——RoPE 占 0.0033%,四舍五入就是零 cos/sin 表按半维存 fp32 是 22.0 MB,铺满 dim 是 43.9 MB(bf16 减半)。这个表在各层频率配置相同时可共享,算一次就够,相比激活值的开销可以忽略 所以选不选 RoPE 从来不是性能问题,纯粹是「要不要相对位置性和外推能力」的取舍。真正吃资源的是 5.4 节那个 fp32 约束——它强迫这一小段计算不能跟着整个网络一起降精度。 什么时候不该用:序列长度固定且很短、任务本身依赖绝对位置、或者模型是纯双向编码器且已有成熟的绝对位置方案时,换 RoPE 收益不大。RoPE 的价值集中在「训练短、推理长」这个场景上。 07. 经典论文脉络 五篇串起来就是位置编码近几年的主线: ALiBi(arXiv:2108.12409,2021-08)不做旋转,直接给注意力分数加一个随距离线性递减的偏置。外推能力很强,但把「远处不重要」写死成了先验,表达力受限。它是 RoPE 的主要对照组。 RoFormer(arXiv:2104.09864,2021-04)RoPE 的出处。贡献是用复数旋转同时拿到相对位置性和乘法式注入;留下的问题是没解决外推,那时也还没人需要 128K 上下文。 A Length-Extrapolatable Transformer(arXiv:2212.10554,2022-12)把「外推」这件事本身形式化,提出用注意力分辨率来度量,给后续方法提供了评价标准而不只是刷分。 Position Interpolation(arXiv:2306.15595,2023-06)最简单有效的一招:把位置索引整体除以缩放因子,让新长度挤回训练区间。代价是所有频率一起被压缩,近距离分辨率跟着下降。 YaRN(arXiv:2309.00071,2023-08)按频率分段处理——高频维度少动或不动以保住近距离分辨率,低频维度多压缩以覆盖新长度,再配一个注意力温度修正。这是目前长度外推的实用基线。 主线很清楚:RoPE 定下了「相对位置靠旋转」的框架,后面几年都在调同一组 $\theta_i$。理解了 3.3 节的频率分配,这些方法的差别只是一句话。 7.1 视频侧这条支线 上面五篇都出自语言模型。视觉生成这边是另一条时间线,起点晚但收敛很快: DiT(arXiv:2212.09748,2022-12)把扩散模型的骨干从 U-Net 换成 Transformer,位置信息用的还是固定的 sincos 绝对嵌入。它证明了 Transformer 在扩散上能 scale,但也把绝对位置嵌入那套外推问题一起继承了过来。 CogVideoX(arXiv:2408.06072,2024-08)视频 DiT 转向 3D RoPE 的代表作。diffusers 里那个 get_3d_rotary_pos_embed(5.6 节引的那段维度分配代码)就是为它写的。 HunyuanVideo(arXiv:2412.03603,2024-12)与 Wan(arXiv:2503.20314,2025-03)两个开源大模型延续了 3D RoPE 的路线。到这一步,「时间/高/宽三轴各分走一段 head_dim」基本成了视频 DiT 的默认选择。 值得注意的是这条支线继承了语言侧的全部外推工具:PI 和 NTK 的思路可以直接套到某一个轴上——比如只对空间两轴做插值来支持更高分辨率,时间轴不动。反过来,语言侧没有的新问题也在这里出现:三个轴的维度预算怎么分、变分辨率训练时坐标怎么归一化。这些留给「视频 DiT 里的 3D RoPE 与分辨率外推」。 08. 常见误解 「RoPE 是加在 embedding 上的」。 不是。它作用在每一层注意力的 $q$、$k$ 上,而且是乘法(旋转)。$v$ 在本文与常用实现里不旋转;存在其他变体,不能把所有旋转 value 的方案都判为错误。把它当成输入层的一次性操作,是最常见的理解错误。 「调大 rope_theta 就能延长上下文」。 只对了一半。调大 base 会让除最高频 $\theta_0=1$ 之外的频率变慢,能塞进更长序列,但不重新训练的话,高频维度的近距离分辨率会一起掉,表现为长文本能读了、短距离推理反而变差。YaRN 之所以要分频段处理,就是为了避免这个副作用。 「相对位置不变性意味着模型对绝对位置完全无感」。 不成立。注意力有 causal mask,第 0 个 token 只能看到自己,第 100 个能看到 100 个——这种「可见范围」本身就泄露了绝对位置。研究里管这叫隐式位置信息。 「间距相同分数就一定相同」。 还必须固定同一对内容向量 q、k;真实模型里的它们也会随上下文变化。真实模型里中间还夹着 softmax 归一化和 causal mask,同一对 token 在不同上下文里拿到的注意力权重是不同的。04 节验证的是旋转这一步的数学性质,不是整个注意力层的行为。 「RoPE 自带远程衰减」需要限定输入与统计口径。 独立各向同性高斯输入的内积分布不随旋转改变;所选相似向量可能在某些距离明显降低、在另一些距离回升。示例不是普遍衰减定律,也不能单独证明长视频质量的因果关系。 09. 动手验证 四个五分钟能跑完的小实验,用到的脚本全文都在文末附录,只依赖 NumPy,复制存成同名文件就能跑。另外跑一遍 make_figures.py 可以把本文三张配图重新生成(这个需要 matplotlib,其余脚本只要 NumPy)。 实验一:看外推在哪一步崩。 跑 rope_minimal.py,把 seq_len 从 8 改成 4096,然后对比位置 (0, 1) 和位置 (4000, 4001) 的内积。预期结果是两者仍然完全相等——因为数学性质对任意位置都成立。这恰好说明:外推失败不是公式失效,而是模型没在那个相位区间学过。这是本文最容易被误解的一点,值得亲手确认一次。 实验二:验证配对方式不能混用。 跑 rope_pairing.py,观察第 2、3 段输出。预期看到同一份权重下两种配对差 5.34,而重排维度后差值精确为 0。把 dim 改成 128 再跑一次,结论不变——这是结构性的,与维度大小无关。 实验三:亲手推翻一个常识。 跑 rope_decay.py,重点看 2a 和 2b 的差别。预期看到随机 $q$、$k$ 不衰减、$q = k$ 时衰减 99% 以上。然后把 2b 里的向量换成两个弱相关的向量试试(比如 k = 0.5 * q + 0.5 * rng.standard_normal(dim)),看衰减幅度怎么随相似度变化——这是理解 06 节那笔账的最快路径。 实验四:给自己的模型算外推预算。 跑 rope_extrapolate.py,把 SCALE 从 8 改成你实际需要的倍数(比如 480p→720p 大约是 2.25 倍 token),看 PI 和 NTK 各自在近距离分辨率上要付多少。预期规律是 PI 的保留率恒等于 $1/\text{scale}$,而 NTK 的保留率在高频维度接近 1、随维度下降。这些频率变化只能说明位置编码的几何差异,不能直接预测生成质量。如果任务依赖纹理、口型等近距离细节,应在目标分辨率上比较 PI、NTK 与必要的适配训练,结合质量和长距离一致性决定方案。 10. 延伸阅读 读这篇之前建议先看: 自注意力机制的计算与显存账本——RoPE 作用在 $q$、$k$ 上,得先清楚它们在注意力里的位置 读完这篇可以继续看: 视频 DiT 里的 3D RoPE 与分辨率外推——5.6 节那个 1:1.5:1.5 的示例维度分配,以及分辨率和帧数变化如何分别影响各轴相位 FlashAttention 为什么不需要存下注意力矩阵——RoPE 之后紧接着的那一步计算 附录:完整代码 09 节用到的脚本全文如下(make_figures.py、rope_decay.py、rope_minimal.py、rope_extrapolate.py、rope_pairing.py)。复制到本地存成同名文件,按各脚本开头的依赖说明准备环境后即可运行。 make_figures.py #!/usr/bin/env python3 # -*- coding: utf-8 -*- """生成「旋转位置编码 RoPE」的三张解释图。 数值全部来自同目录的三个脚本(rope_minimal / rope_extrapolate / rope_decay), 这里只负责画——改了那边这里要重跑,免得图和正文数字打架。 三张图分别回答: 1. 32 个频率是怎么分层铺在 64 维上的(高频相位在近距离变化更快) 2. PI 与 NTK-aware 把这 8 倍外推的代价分别摊到了哪些频段 3. 「相对位置不变」和「随距离衰减」在数值上长什么样 只依赖 numpy + matplotlib。跑法:python make_figures.py """ import textwrap from pathlib import Path import matplotlib.pyplot as plt import numpy as np import rope_decay as RD import rope_extrapolate as RE ROOT = Path(__file__).resolve().parents[1] OUT = ROOT / "figures" OUT.mkdir(parents=True, exist_ok=True) plt.rcParams.update({ "font.sans-serif": ["PingFang SC", "Arial Unicode MS", "DejaVu Sans"], "axes.unicode_minus": False, "figure.dpi": 160, "savefig.bbox": "tight", }) INK = "#1f2937" MUTE = "#6b7280" C_ORIG = "#2f6fb0" # 原始 RoPE:蓝 C_PI = "#d1495b" # PI:红 C_NTK = "#2f9e6f" # NTK-aware:绿 C_BAD = "#d1495b" C_OK = "#2f9e6f" def style(ax, title, xlabel=None, ylabel=None): ax.set_title(title, fontsize=11.5, color=INK, pad=10, loc="left") if xlabel: ax.set_xlabel(xlabel, fontsize=10, color=MUTE) if ylabel: ax.set_ylabel(ylabel, fontsize=10, color=MUTE) ax.tick_params(colors=MUTE, labelsize=9) for s in ("top", "right"): ax.spines[s].set_visible(False) for s in ("left", "bottom"): ax.spines[s].set_color("#d1d5db") ax.grid(alpha=0.25, linewidth=0.6) ax.set_axisbelow(True) def footer(fig, text, width=118): """把「这张图要看什么」放到坐标轴下方。 必须放在 y<0 的位置:bbox_inches="tight" 会把负坐标的 artist 一起收进来, 放在 0~0.05 之间的话会和 x 轴标签叠在一起。 """ wrapped = "\n".join(textwrap.wrap(text, width=width)) fig.text(0.012, -0.13, wrapped, fontsize=8.5, color=MUTE, va="top", ha="left", linespacing=1.6) # ────────────────────────────────────────────────────────────────────── # 图 1:32 个频率怎么分层铺在 64 维上 # ────────────────────────────────────────────────────────────────────── def fig_freq_layers(): dim = RE.DIM th = RE.theta_original() # [dim/2] pos_short = np.arange(0, 256) pos_long = np.arange(0, 32768, 8) cos_short = np.cos(np.outer(pos_short, th)) # [256, dim/2] phase_long = np.outer(pos_long, th) # 累积相位(不取模) fig, axes = plt.subplots(1, 2, figsize=(12.8, 4.4)) fig.subplots_adjust(wspace=0.42) ax = axes[0] im = ax.imshow(cos_short.T, aspect="auto", origin="lower", cmap="RdBu_r", vmin=-1, vmax=1, extent=[0, len(pos_short), -0.5, len(th) - 0.5]) ax.set_yticks([0, 8, 16, 24, 31]) cb = fig.colorbar(im, ax=ax, fraction=0.035, pad=0.02) cb.ax.tick_params(labelsize=8, colors=MUTE) cb.set_label(r"$\cos(m\theta_i)$", fontsize=9, color=MUTE) style(ax, "近距离(0~255):前 13 组完成至少一圈", "位置 m", "维度组 i") # 在 256 个位置内转满一整圈(2π)的维度组数 n_moving = int((pos_short[-1] * th / (2 * np.pi) >= 1).sum()) ax.annotate(f"256 长度内转满一整圈的只有前 {n_moving} 组", xy=(128, n_moving - 1), xytext=(12, n_moving + 7), fontsize=8.5, color="white", fontweight="bold", arrowprops=dict(arrowstyle="->", color=MUTE, lw=0.9)) ax = axes[1] for i, c in zip([0, 4, 8, 16, 24, 31], ["#1f6feb", "#2f9e6f", "#e0a03c", "#d1495b", "#8b5cf6", "#6b7280"]): ax.plot(pos_long, phase_long[:, i], lw=1.8, color=c, label=f"i={i}") trained = (RE.TRAIN_LEN - 1) * th[0] ax.axhline(trained, color=INK, ls="--", lw=1.2) ax.text(600, trained * 1.35, f"最高频训练最大相位 {trained:.0f} rad", fontsize=8.5, color=INK) ax.set_xscale("log") ax.set_yscale("log") ax.legend(fontsize=8.5, frameon=False, loc="upper left", ncol=2) style(ax, "远距离(到 32768):各频段的累积相位", "位置 m(对数轴)", r"累积相位 $m\theta_i$(rad,对数轴)") fig.suptitle("图 1 RoPE 把 64 维切成 32 组,从「每步 1 弧度」一路排到「每步 1e-4 弧度」", fontsize=12, color=INK, x=0.012, ha="left", y=1.02) footer(fig, "左图:0 到 255 的相位差中,只有前 13 组超过一整圈;低频也有非零相位变化。" "右图:不同频率提供不同尺度,不是互斥的距离分工。虚线只代表最高频的训练相位上限;" "每个频段的训练相位上限都不同。") fig.savefig(OUT / "rope_freq_layers.png") plt.close(fig) print(f"[图1] 相位变化>=2π 的维度组数(0→255): {n_moving}/{len(th)}") # ────────────────────────────────────────────────────────────────────── # 图 2:PI 与 NTK-aware 把 8 倍外推的代价摊在哪 # ────────────────────────────────────────────────────────────────────── def fig_extrapolation(): t_orig, t_pi, t_ntk = (RE.theta_original(), RE.theta_pi(), RE.theta_ntk()) idx = np.arange(len(t_orig)) slow_pi = t_orig / t_pi slow_ntk = t_orig / t_ntk keep_pi = t_pi / t_orig * 100 keep_ntk = t_ntk / t_orig * 100 fig, axes = plt.subplots(1, 2, figsize=(11.6, 4.3)) ax = axes[0] ax.plot(idx, slow_pi, color=C_PI, lw=2.4, label=r"PI:各维一律减速 8.00x") ax.plot(idx, slow_ntk, color=C_NTK, lw=2.0, label=r"NTK-aware:1.00x $\to$ 8.00x") ax.fill_between(idx, slow_ntk, slow_pi, color=C_PI, alpha=0.10) ax.set_yscale("log") ax.set_yticks([1, 2, 4, 8]) ax.yaxis.set_minor_formatter(plt.NullFormatter()) ax.get_yaxis().set_major_formatter(plt.FuncFormatter(lambda v, _: f"{v:g}x")) ax.legend(fontsize=9, frameon=False, loc="center right") style(ax, "谁被减速了多少(对数轴)", "维度组 i", r"$\theta_i^{\mathrm{orig}} / \theta_i^{\mathrm{new}}$") ax = axes[1] ax.plot(idx, keep_pi, color=C_PI, lw=2.4, label="PI:全线只剩 12.5%") ax.plot(idx, keep_ntk, color=C_NTK, lw=2.0, label=rf"NTK:{keep_ntk[0]:.0f}% $\to$ {keep_ntk[16]:.1f}%(i=16)") ax.fill_between(idx, keep_pi, keep_ntk, color=C_NTK, alpha=0.10) ax.axhline(100, color=MUTE, ls=":", lw=1.0) ax.set_yscale("log") ax.set_yticks([10, 20, 50, 100]) ax.get_yaxis().set_major_formatter(plt.FuncFormatter(lambda v, _: f"{v:g}%")) ax.legend(fontsize=9, frameon=False, loc="lower left") style(ax, "代价:相邻 token 的相位分辨率还剩多少", "维度组 i", r"$\theta_i^{\mathrm{new}} / \theta_i^{\mathrm{orig}}$") fig.suptitle("图 2 PI 把减速平均分给每一维,NTK 从高频不压缩逐渐过渡到低频压缩 8 倍", fontsize=12, color=INK, x=0.012, ha="left", y=1.02) footer(fig, "要看什么:左图 PI 是一条平线(每维都慢 8 倍),NTK 从最高频的 1.00x 单调爬到" "最低频的 8.00x。右图是这个分配的代价——PI 把每一维的近距离分辨率都砍到 12.5%," "这只是相位步长,不能直接预测任务质量;NTK 保住高频(100%),最低频与 PI 同为 12.5%。" "两者改的是同一组 theta,区别只在把代价放在哪个频段。") fig.savefig(OUT / "rope_extrapolation.png") plt.close(fig) print(f"[图2] NTK 减速比: i=0 {slow_ntk[0]:.2f}x -> i=31 {slow_ntk[-1]:.2f}x;" f"分辨率保留 i=16: PI {keep_pi[16]:.1f}% / NTK {keep_ntk[16]:.1f}%") # ────────────────────────────────────────────────────────────────────── # 图 3:相对位置不变 + 随距离衰减 # ────────────────────────────────────────────────────────────────────── def fig_relativity(): dim, seq_len = 64, 8192 cos, sin = RD.build_rope_cache(seq_len, dim) rng = np.random.default_rng(0) # ── 左:同一对 q,k,只平移绝对位置,内积应当逐点不变 ── q = rng.standard_normal(dim) k = rng.standard_normal(dim) gaps = np.arange(0, 512) starts = [0, 500, 2000] curves = {} for s in starts: qr = RD.apply_rope(q[None, :], cos[s:s + 1], sin[s:s + 1])[0] kr_all = RD.apply_rope( np.repeat(k[None, :], len(gaps), 0), cos[s:s + len(gaps)], sin[s:s + len(gaps)]) curves[s] = kr_all @ qr # ── 右:距离越远,RoPE 把「无位置编码的原始内积」改写得多彻底 ── # 独立各向同性高斯输入:corr(q^T R_gap k, q^T k) = (2/dim) Σ_i cos(gap θ_i)。 # 注意:这是「与原始内积的相关性」衰减,不是内积的绝对值变小—— # 独立各向同性高斯输入的内积分布与距离无关(RMS 为 sqrt(dim))。 Q = rng.standard_normal((4000, dim)) K = rng.standard_normal((4000, dim)) s0 = np.einsum("ij,ij->i", Q, K) th = 1.0 / (10000.0 ** (np.arange(0, dim, 2) / dim)) probe = np.unique(np.round(np.geomspace(1, 4096, 60)).astype(int)) emp, theo = [], [] for g in probe: qr = RD.apply_rope(Q, cos[0:1], sin[0:1]) kr = RD.apply_rope(K, cos[g:g + 1], sin[g:g + 1]) sg = np.einsum("ij,ij->i", qr, kr) emp.append(float(np.corrcoef(sg, s0)[0, 1])) theo.append(float(2.0 / dim * np.sum(np.cos(g * th)))) fig, axes = plt.subplots(1, 2, figsize=(11.6, 4.3)) ax = axes[0] cols = {0: C_ORIG, 500: C_NTK, 2000: "#e0a03c"} for s in starts: ax.plot(gaps, curves[s], lw=1.6, color=cols[s], label=f"绝对起点 {s}") ax.legend(fontsize=9, frameon=False, loc="upper right") style(ax, "同一对向量、同一组间距,换绝对位置后曲线完全重合", "相对距离 (n-m)", r"$q_m^\top R_{n-m} k_n$") ax = axes[1] ax.plot(probe, emp, marker="o", ms=3.5, lw=1.8, color=C_ORIG, label="实测(4000 对随机向量)") ax.plot(probe, theo, lw=1.4, ls="--", color=C_BAD, label=r"理论 $\frac{2}{D}\sum_i\cos(\Delta\theta_i)$") ax.axhline(0, color=MUTE, ls=":", lw=1.0) ax.set_xscale("log") ax.legend(fontsize=9, frameon=False, loc="upper right") style(ax, "独立高斯输入:与原始内积的相关性随距离振荡", "相对距离(对数轴)", r"$\mathrm{corr}(q^\top R_d k, q^\top k)$") fig.suptitle("图 3 固定内容的相对位置不变性,与高斯输入下的分数相关性", fontsize=12, color=INK, x=0.012, ha="left", y=1.02) max_dev = max(float(np.abs(curves[s] - curves[0]).max()) for s in starts) footer(fig, f"左图:固定 q/k 的三条曲线在浮点误差内重合,最大偏差 {max_dev:.1e},不是逐比特相等。" "右图:D=64、Δ 为间距,理论相关性是有限余弦和;它会振荡,不保证单调或在无穷远趋于零。" "本图的独立各向同性高斯输入下,内积分布不随旋转改变。") fig.savefig(OUT / "rope_relativity.png") plt.close(fig) print(f"[图3] 不同绝对起点的最大逐点偏差: {max_dev:.2e};" f"corr: d=1 {emp[0]:.3f} → d={probe[-1]} {emp[-1]:.3f}") def main(): fig_freq_layers() fig_extrapolation() fig_relativity() print(f"[OK] 三张图已写入 {OUT}") for f in sorted(OUT.glob("*.png")): print(f" {f.name} {f.stat().st_size / 1024:.0f} KB") if __name__ == "__main__": main() rope_decay.py """观测 RoPE 的两个常被口头断言、但很少有人实测的性质。 1. 旋转不改变模长(对比加法式绝对位置嵌入) 2. 所选输入的内积随距离变化;并非普遍衰减定律 运行 `python rope_decay.py` 复现。 """ import numpy as np def build_rope_cache(seq_len, dim, base=10000.0): inv_freq = 1.0 / (base ** (np.arange(0, dim, 2) / dim)) freqs = np.outer(np.arange(seq_len), inv_freq) return np.cos(freqs), np.sin(freqs) def apply_rope(x, cos, sin): out = np.empty_like(x) out[..., 0::2] = x[..., 0::2] * cos - x[..., 1::2] * sin out[..., 1::2] = x[..., 0::2] * sin + x[..., 1::2] * cos return out def demo_norm_preserved(rng, dim=64, seq_len=512): """旋转保模长,加法不保。""" cos, sin = build_rope_cache(seq_len, dim) x = rng.standard_normal(dim) print("=== 1. 模长是否被位置编码改变 ===") print(f" 原始向量模长 {np.linalg.norm(x):.6f}") norms = [np.linalg.norm(apply_rope(x[None, :], cos[p:p + 1], sin[p:p + 1])) for p in (0, 1, 100, 511)] print(f" RoPE 后(位置 0/1/100/511) " f"{' '.join(f'{n:.6f}' for n in norms)}") print(f" 跨位置模长极差 {max(norms) - min(norms):.2e}") # 加法式绝对位置嵌入:同尺度的可学习向量直接相加 pe = rng.standard_normal((seq_len, dim)) add_norms = [np.linalg.norm(x + pe[p]) for p in (0, 1, 100, 511)] print(f" 加法式 PE 后 " f"{' '.join(f'{n:.6f}' for n in add_norms)}") print(f" 跨位置模长极差 " f"{max(add_norms) - min(add_norms):.4f} ← 同一个 token 的模长被位置改写了") def _score(cos, sin, q, k, gap): qr = apply_rope(q[None, :], cos[0:1], sin[0:1]) kr = apply_rope(k[None, :], cos[gap:gap + 1], sin[gap:gap + 1]) return float(qr[0] @ kr[0]) GAPS = (1, 4, 16, 64, 256, 1024, 4000) def demo_long_range_decay(rng, dim=64, seq_len=4096, trials=2000): """「RoPE 自带远程衰减」到底成不成立——分两种输入分布看。 结论:本文独立各向同性高斯 q/k 的内积分布不变;所选 q=k 示例会振荡。 """ cos, sin = build_rope_cache(seq_len, dim) print("\n=== 2a. 随机无关的 q/k:取 |内积| 均值 ===") baseline = float(np.mean([abs(float(rng.standard_normal(dim) @ rng.standard_normal(dim))) for _ in range(trials)])) print(f" 不加 RoPE {baseline:.4f} (基线)") for gap in GAPS: m = float(np.mean([abs(_score(cos, sin, rng.standard_normal(dim), rng.standard_normal(dim), gap)) for _ in range(trials)])) print(f" 相对距离 {gap:>5} {m:.4f} ({m / baseline * 100:5.1f}% of 基线)") print(" → 没有衰减趋势。独立各向同性高斯输入在正交旋转下分布不变。") print("\n=== 2b. q = k(高度相似的一对 token)===") for name, vec in (("全 1 向量", np.ones(dim)), ("某个随机向量", np.random.default_rng(7).standard_normal(dim))): # gap=0 时位置 0 的旋转角为 0,内积就是未加 RoPE 的原值 head = _score(cos, sin, vec, vec, 0) print(f" {name}(gap=0 时内积 {head:.2f}):") for gap in GAPS: s = _score(cos, sin, vec, vec, gap) print(f" 相对距离 {gap:>5} {s:+9.4f} ({s / head * 100:5.1f}% of gap=0)") print(" → 这些采样点多低于 gap=0,也有回升;不代表任意输入或距离都衰减。") if __name__ == "__main__": demo_norm_preserved(np.random.default_rng(0)) demo_long_range_decay(np.random.default_rng(1)) rope_minimal.py #!/usr/bin/env python3 # -*- coding: utf-8 -*- """RoPE 的最小可运行实现,验证「注意力分数只依赖相对位置」这一核心性质。 只依赖 numpy,直接 python rope_minimal.py 即可运行。 刻意不用 PyTorch:讲原理时框架的抽象反而是噪声,而且 numpy 谁都能跑。 生产实现见文章第 05 节对 transformers 的引用。 """ import numpy as np def build_rope_cache(seq_len: int, dim: int, base: float = 10000.0): """预计算 RoPE 的 cos/sin 表。 dim 必须是偶数:每两个相邻维度配成一个复数参与旋转。 base 就是常说的 rope_theta,调它会按维度改变旋转速度;最高频 i=0 始终为 1。 """ assert dim % 2 == 0, f"dim 必须为偶数,收到 {dim}" # theta_i = base^(-2i/dim):i 越大转得越慢,对应越低的频率 inv_freq = 1.0 / (base ** (np.arange(0, dim, 2) / dim)) pos = np.arange(seq_len) freqs = np.outer(pos, inv_freq) # [seq_len, dim/2] return np.cos(freqs), np.sin(freqs) def apply_rope(x: np.ndarray, cos: np.ndarray, sin: np.ndarray) -> np.ndarray: """把旋转作用到 x 上。x: [seq_len, dim] 最后一维两两配对看成复数 (x_even + i*x_odd),乘上 e^{i*m*theta}: 实部 = x_even * cos - x_odd * sin 虚部 = x_even * sin + x_odd * cos """ x_even, x_odd = x[..., 0::2], x[..., 1::2] out = np.empty_like(x) out[..., 0::2] = x_even * cos - x_odd * sin out[..., 1::2] = x_even * sin + x_odd * cos return out if __name__ == "__main__": rng = np.random.default_rng(0) seq_len, dim = 8, 64 cos, sin = build_rope_cache(seq_len, dim) print(f"cos/sin 形状: {cos.shape} {sin.shape}") print(f"位置 1 的前 4 维 cos: {np.round(cos[1, :4], 4).tolist()}") print(f"位置 1 的末 2 维 cos: {np.round(cos[1, -2:], 6).tolist()}") # 固定一对向量,只改赋予它们的绝对位置,间距始终为 1 q = rng.standard_normal(dim) k = rng.standard_normal(dim) print("\n同一对向量,平移绝对位置(间距恒为 1):") for shift in range(4): qr = apply_rope(q[None, :], cos[shift:shift + 1], sin[shift:shift + 1]) kr = apply_rope(k[None, :], cos[shift + 1:shift + 2], sin[shift + 1:shift + 2]) print(f" 位置 ({shift}, {shift + 1}) → 内积 {float(qr[0] @ kr[0]):.6f}") print("\n对照组,改变间距:") for gap in (1, 2, 3): qr = apply_rope(q[None, :], cos[0:1], sin[0:1]) kr = apply_rope(k[None, :], cos[gap:gap + 1], sin[gap:gap + 1]) print(f" 间距 {gap} → 内积 {float(qr[0] @ kr[0]):.6f}") print(f"\n未加 RoPE 的原始内积: {float(q @ k):.6f}") rope_extrapolate.py """两种长度外推方法(PI / NTK-aware)到底改了什么。 结论先说:它们改的是同一组 theta_i,区别只在「怎么分配这次减速」。 运行 `python rope_extrapolate.py` 复现。 """ import numpy as np DIM = 64 BASE = 10000.0 TRAIN_LEN = 4096 # 训练时见过的长度 SCALE = 8 # 想外推到 8 倍,即 32768 def theta_original(dim=DIM, base=BASE): return 1.0 / (base ** (np.arange(0, dim, 2) / dim)) def theta_pi(dim=DIM, base=BASE, scale=SCALE): """Position Interpolation:位置索引整体除以 scale。 等价于把每个 theta_i 都乘上 1/scale——所有频率被同等减速。 """ return theta_original(dim, base) / scale def theta_ntk(dim=DIM, base=BASE, scale=SCALE): """NTK-aware:把 base 放大,让减速量随维度索引递增(频率越低减速越多)。 base' = base * scale^(d/(d-2)),于是高频维度几乎不受影响, 最低频维度与 PI 同样减速 scale 倍,其余维度的减速更少。 """ new_base = base * scale ** (dim / (dim - 2)) return theta_original(dim, new_base) def main(): t_orig, t_pi, t_ntk = theta_original(), theta_pi(), theta_ntk() print("=== 1. 三种方案下各维度的旋转速度 theta_i ===") print(" 维度 i 原始 PI(÷8) NTK-aware PI减速比 NTK减速比") for i in (0, 1, 4, 8, 16, 24, 31): print(f" {i:>4} {t_orig[i]:.3e} {t_pi[i]:.3e} {t_ntk[i]:.3e}" f" {t_orig[i] / t_pi[i]:>7.2f}x {t_orig[i] / t_ntk[i]:>7.2f}x") print(f" → PI 对每一维都减速 {t_orig[0] / t_pi[0]:.2f}x(均匀);" f"NTK 从最高频的 {t_orig[0] / t_ntk[0]:.2f}x 递增到最低频的 " f"{t_orig[-1] / t_ntk[-1]:.2f}x(越低频压得越狠)") print("\n=== 2. 外推到 8 倍长度后,各方案在第 0 维(最高频)的相位 ===") target = TRAIN_LEN * SCALE trained_max = (TRAIN_LEN - 1) * t_orig[0] print(f" 训练时见过的最大相位(位置 {TRAIN_LEN - 1}) {trained_max:9.1f} rad") for name, th in (("原始(直接外推)", t_orig), ("PI", t_pi), ("NTK-aware", t_ntk)): v = (target - 1) * th[0] flag = ("落在训练区间内" if v <= trained_max else f"接近但略超训练端点 {trained_max:g}" if v <= trained_max * 1.01 else f"超出 {v / trained_max:.1f} 倍") print(f" {name:<18} 位置 {target - 1} {v:9.1f} rad ← {flag}") print(" → NTK 在最高频维度上「不作为」是刻意的,它保留高频相位步长,逐渐压缩更低频的相位步长") print("\n=== 3. 代价:近距离分辨率还剩多少 ===") print(" (相邻位置差 1 时转过的角度,按维度看。越小=越难区分相邻 token)") print(" 维度 i 原始 PI NTK PI保留 NTK保留") for i in (0, 4, 8, 16): print(f" {i:>4} {t_orig[i]:.6f} {t_pi[i]:.6f} {t_ntk[i]:.6f}" f" {t_pi[i] / t_orig[i] * 100:5.1f}% {t_ntk[i] / t_orig[i] * 100:5.1f}%") print(f" → PI 在每一维都只保留 {t_pi[0] / t_orig[0] * 100:.1f}% 的分辨率;" f"NTK 在第 0 维保留 {t_ntk[0] / t_orig[0] * 100:.1f}%、" f"第 16 维只剩 {t_ntk[16] / t_orig[16] * 100:.1f}%。") print(" 两者都在同一组 theta 上做手脚,只是把代价放在了不同频段——" "\n YaRN 进一步把这个分配变成可调的分段策略。") if __name__ == "__main__": main() rope_pairing.py """对照 RoPE 的两种维度配对方式,并验证它们只差一个固定置换。 奇偶交错(本文最小实现):第 2i 维和第 2i+1 维配成一个复数 前后半切分(HuggingFace):第 i 维和第 i+d/2 维配成一个复数 结论先说:两者都满足相对位置不变性,但对同一份权重不可互换。 运行 `python rope_pairing.py` 复现下面的数值。 """ import numpy as np def rope_interleaved(x, pos, dim, base=10000.0): """奇偶交错配对:(x_0,x_1), (x_2,x_3), ... 每对是一个复平面。""" inv_freq = 1.0 / (base ** (np.arange(0, dim, 2) / dim)) ang = pos * inv_freq # [dim/2] cos, sin = np.cos(ang), np.sin(ang) out = np.empty_like(x) out[0::2] = x[0::2] * cos - x[1::2] * sin out[1::2] = x[0::2] * sin + x[1::2] * cos return out def rope_half_split(x, pos, dim, base=10000.0): """前后半切分配对:(x_i, x_{i+d/2})。等价于 HF 的 rotate_half 写法。 HF 把 cos/sin 表沿最后一维复制两遍(cat((freqs, freqs))), 于是 q*cos + rotate_half(q)*sin 展开后就是下面两行。 """ half = dim // 2 inv_freq = 1.0 / (base ** (np.arange(0, dim, 2) / dim)) ang = pos * inv_freq # [dim/2] cos, sin = np.cos(ang), np.sin(ang) x1, x2 = x[:half], x[half:] return np.concatenate([x1 * cos - x2 * sin, x2 * cos + x1 * sin]) def interleave_to_half(x): """把奇偶交错的排布重排成前后半切分的排布。 交错版的第 2i 维(复数实部)搬到前半的第 i 位, 第 2i+1 维(虚部)搬到后半的第 i 位。 """ return np.concatenate([x[0::2], x[1::2]]) def attn_score(rope_fn, q, k, m, n, dim): return float(rope_fn(q, m, dim) @ rope_fn(k, n, dim)) def main(): rng = np.random.default_rng(0) dim = 64 q = rng.standard_normal(dim) k = rng.standard_normal(dim) print("=== 1. 两种配对都满足相对位置不变性 ===") for name, fn in (("奇偶交错", rope_interleaved), ("前后半切分", rope_half_split)): scores = [attn_score(fn, q, k, m, m + 3, dim) for m in range(4)] spread = max(scores) - min(scores) print(f" {name}: 间距恒为 3 时内积 {scores[0]:.6f}," f"四个绝对位置间的最大波动 {spread:.2e}") print("\n=== 2. 同一份权重下,两种配对给出的分数不同 ===") s_i = attn_score(rope_interleaved, q, k, 0, 3, dim) s_h = attn_score(rope_half_split, q, k, 0, 3, dim) print(f" 奇偶交错 {s_i:.6f}") print(f" 前后半切分 {s_h:.6f}") print(f" 差值 {abs(s_i - s_h):.6f} ← 不为 0,实现和权重必须配套") print("\n=== 3. 重排维度后两者完全一致 ===") qp, kp = interleave_to_half(q), interleave_to_half(k) s_h_perm = attn_score(rope_half_split, qp, kp, 0, 3, dim) print(f" 奇偶交错(原始排布) {s_i:.6f}") print(f" 前后半切分(重排后权重) {s_h_perm:.6f}") print(f" 差值 {abs(s_i - s_h_perm):.2e}" f" ← 只差一个固定的维度置换") if __name__ == "__main__": main()
2026年08月23日
10 阅读
0 评论
0 点赞
2026-08-22
AIGC 每日速读|2026-08-22|阿里6B小模型编辑分反超20B的Swift-Image
今日 AIGC 论文速览 今日共 10 篇 · 统一图像生成与编辑 3 篇 · 视频生成与世界模型 1 篇 · 4D 人体与数字人 2 篇 · 3D 生成加速 1 篇 · 音频与动作生成 2 篇 · 生成评测 1 篇 重点论文标题列表 Swift-Image(阿里巴巴集团):6B编辑分4.33反超20B模型 Stream4D(UCLA、清华大学):3DGS奖励会奖励画面冻结 4DAnyone(浙江大学 CAD&CG 国家重点实验室、Robbyant、港中文、蚂蚁集团):手机随手拍重建4D人体 WithEveryone(复旦大学、腾讯混元、香港大学):十人合影身份不互串 ear-VAE2(阿里巴巴通义千问团队、Monash University):波形自编码器缺一根频率轴 今日论文速览 1. Swift-Image:6B编辑分4.33反超20B模型 Swift-Image: Exploring the Performance Frontier of Compact Unified Image Generation Models | 阿里巴巴集团 | arXiv:2608.20334 关键词:统一图像生成,图像编辑,单流DiT,多教师蒸馏,少步生成,DiffusionNFT 前序问题:统一图像生成模型(同时做文生图、单图编辑、多图编辑)目前的主流路线是把参数量往上堆,20B 级别已经是常态。但对大多数团队来说,这个规模既训不起也推不动。真正的问题是:在受限的计算预算下,一个相对小的视觉生成器到底能被系统性的训练工程推到什么位置?这里有两重困难。一是三类任务的目标彼此干扰——文生图要的是语义覆盖与美学,编辑要的是身份/布局保持,直接混合训练会互相拖累。二是要做少步推理就得蒸馏,而蒸馏一个已经在多任务上打了折扣的模型,误差会继续累积。所以「小而全」在实践中通常意味着「小而每项都差一点」。 本文贡献:Swift-Image 用 6B 的单流 DiT 打底,架构上把 Qwen3-VL 作为文本/图像理解侧的编码器,VAE embedding 与加噪 VAE embedding 分别经 projector 进入主干;每个 Single-Stream Parallel Block 内部把注意力和 MLP 并行放置,Q/K 各带 RmsNorm 与 RoPE,出口用一个受时间步 t 调制的 Zero-Init Gate 控制残差写入,Scale&Shift 也由 t 驱动。训练侧是渐进式管线:从广覆盖语义起步,逐步提高分辨率、强化视觉质量,最后加入生成-编辑统一监督。后训练是这篇的重头戏,共四段。第一段用任务专属教师(T2I-RL 与 Edit-RL,均为 6B 多步)分别做多步强化学习,提供互补监督;第二段做任务专属 few-step 蒸馏,以 DMD2 为骨架并叠加动态反向模拟、后期偏置停止、解耦噪声匹配、教师锚定对抗损失四个机制,把两个多步专家各自压成 6B few-step 专家;第三段是多教师 on-policy 蒸馏(OPD),让统一学生在自己的策略下同时向 T2I 专家和 Edit 专家学习,从而把两个专家合成一个模型而不是简单加权;第四段用 DiffusionNFT 做 few-step 强化学习,混合 T2I 奖励(对齐、质量)与编辑奖励(身份、布局)做 MixRL 精修。整套设计的核心思路是「先让专家各自强,再在学生策略下合并,最后混合奖励收口」,用流程隔离替代损失加权来缓解目标干扰。 Unified visual backbone for T2I generation and image editing. Semantic conditions from Qwen3-VL and image latents from FLUX.2 AE are jointly processed by parallel single-stream Transformer blocks. 实验效果:参数量-编辑得分的帕累托图给出的对比最直接:Swift-Image-6B-PE 的 Overall Edit Score 为 4.33,3B-PE 为 4.32,而横轴 20B 附近的 FireRed-Image-Edit 是 4.11、Qwen-Image-Edit-2511 是 4.07,9B 的 FLUX.2-klein 为 4.06、4B 版本为 3.89,15.7B 左右的 JoyAI-Image-Edit-Plus 只有 3.72。也就是说 3B/6B 两档都稳定位于图的左上角,用约三分之一到七分之一的参数量取得更高的编辑分。3B 与 6B 几乎打平这一点尤其值得注意——说明在这套后训练管线下,收益主要来自训练策略而非模型容量。 Comparison for parameter and overall edit score with open-source models. The overall edit score is computed as the average across three public editing benchmarks and our benchmarks. 本方法 achieves leading performance with only 6B and 3B parameters. 批判点评:这篇的价值在于它把「小模型能不能靠训练工程赢」这个问题做成了一个可复现的配方,而不是又一次架构宣称。四段式后训练里最有意思的是 OPD:用 on-policy 蒸馏来合并两个任务专家,比传统的多任务损失加权更能规避「学生在教师分布外的行为无人监督」这个老问题,思路是对的。帕累托图也画得诚实,把同期主要开源模型都摆进来了。但几点要保留。第一,Overall Edit Score 是论文自选的综合指标,4.33 与 4.11 的差距落在 5 分制里只有 0.22,缺少置信区间或多次评测的方差,很难判断这是稳定领先还是评测噪声——尤其 3B 的 4.32 与 6B 的 4.33 相差 0.01,几乎不可能是真实差异,反过来也提示这个指标在高分段的分辨力有限。第二,图上只有编辑分一个维度,文生图能力与多图编辑能力没有在同一张图里对照,「统一模型」的另两条腿表现如何需要翻正文。第三,四段后训练每一段都引入了额外的教师模型与奖励模型,总训练成本很可能远超「受限算力预算」的字面印象,论文若不给出与 20B 直接训练的总 FLOPs 对比,「省算力」的结论就只对推理侧成立。第四,DMD2 叠四个机制、DiffusionNFT 再叠 MixRL,组件数量偏多而消融只能覆盖其中一部分,哪几个是真正的关键路径并不清楚,复现者容易在超参上踩坑。 2. Stream4D:3DGS奖励会奖励画面冻结 Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models | UCLA、清华大学 | arXiv:2608.19556 关键词:流式自回归扩散,长视频生成,4D一致性,3DGS奖励,几何漂移,reward hacking 前序问题:流式自回归扩散模型是实时长视频生成的主流路线,但它的训练目标优化的是局部帧预测,而不是一个连贯世界的几何与动力学。后果是长 rollout 会累积几何漂移,最终退化成静止或不自然的运动。近期有一类双向方法试图用 3D Gaussian Splatting 重建构造的奖励来解决这个问题——让模型生成的视频能被 3DGS 稳定重建,间接逼它学会几何一致。作者指出这条路有一个根本性缺陷:单个刚性 3D 重建无法建模动态场景,于是这个 critic 会把真实的物体运动当成重建误差来惩罚,而它的最大化解恰恰是「把视频冻住」。在自回归设定下这个捷径尤其危险,因为每个 chunk 都可能把上一个 chunk 已经衰减的运动继续传播放大。 本文贡献:论文的第一贡献是把这个 reward hacking 模式明确暴露出来,并给出跨场景的可视化证据:在机甲战斗、赛车穿行、水下鱼群三个动态强度差异很大的场景里,逐帧对比 Base、VideoGPA、World-R1 与本方法在 t=0/0.50/1.00 的输出,用 MOVES / FROZEN / KEEPS MOTION 三个标签直接标注运动状态。同时也给了另一组更长时程(t=0s 到 10s,间隔 2.5s)的猫叼鱼跑动对比,可以看到 World-R1 与 VideoGPA 在后半段几乎不再有位移,而本方法保持了跑动姿态的连续变化。方法层面,Stream4D 的思路是把奖励从「静态刚性重建」升级到「4D 一致性」,即在允许场景本身随时间演化的前提下约束几何与动力学的连贯,从而让 critic 不再把合法运动误判为误差,同时保留对几何漂移的惩罚能力。这也让约束能适配自回归的分块推进结构,而不是只能在双向全序列设定下使用。 Static-3D rewards freeze the scene; a 4D reward keeps it moving. Five uniformly-spaced frames from a $10.3$,s LongLive rollout (“a cat running away with a fish while people chase behind”). The distilled base contains large motion but the cat and fish drift across frames; the static-3DGS rewards World-R1 and VideoGPA reduce the scene to a more rigid, low-motion configuration. Stream4D keeps the cat running with clear forward motion while preserving a coherent subject and scene. 实验效果:定性结果是这篇最有力的部分:三场景 × 三时刻的对比图里,两个基于 3DGS 奖励的基线(VideoGPA、World-R1)在全部三个场景都被判定为 FROZEN,而 Stream4D 在全部场景保持 KEEPS MOTION;十秒时长的长程对比进一步显示基线在 t=5s 之后主体位移基本停滞。原始 Base 模型虽然 MOVES,但可以看到画面结构在后续帧出现明显漂移与内容突变。也就是说 Base 有运动但没有几何一致性,3DGS 奖励方法有一致性但杀掉了运动,Stream4D 试图同时拿住两者。 批判点评:这篇最值得记的不是方法而是那张 FROZEN 标签图。它把「用静态重建指标当动态生成 critic」这个设计错误做成了可以一眼看懂的反例,而这类奖励设计在过去一年的世界模型工作里被大量采用——凡是拿单次 3D 重建误差当监督的方案,都应该拿这张图自查一遍。与昨天 DynaForcing 揭示的 DMD 反向 KL 偏好静止放在一起看,可以归纳出一条更一般的规律:动态生成任务里任何不显式建模时间演化的奖励,静止都是合法捷径。但要清醒几点。第一,论文给出的主要证据是定性对比图,MOVES/FROZEN/KEEPS MOTION 这三个标签是作者判定的,缺少像 Dynamic Degree、光流幅度这类可量化的运动指标表格来支撑「基线冻结、我们不冻结」的强论断,读者只能相信示例的代表性。第二,示例场景都是运动幅度较大的(战斗、赛车、鱼群),恰恰是最容易凸显冻结问题的设定;在运动本就轻微的场景里,4D 一致性约束是否会反过来引入不必要的抖动,论文没有讨论。第三,作者团队没有公开 comment 信息(无会议接收、无项目页),代码与权重是否开放不明,而这类涉及奖励设计细节的工作可复现性高度依赖实现细节。第四,「4D 一致性」如何具体参数化、计算开销相对 3DGS 奖励增加多少,是评估这套方案能否落到实际训练里的关键,需要读正文确认。 3. 4DAnyone:手机随手拍重建4D人体 4DAnyone: Create Anyone in 4D from a Casual Monocular Video | 浙江大学 CAD&CG 国家重点实验室、Robbyant、港中文、蚂蚁集团 | arXiv:2608.20335 关键词:4D人体重建,单目视频,多视角一致性,视频扩散,4DGS,有界注意力上下文 前序问题:从一段没有标定的手机随手拍视频里重建出可自由换视角的 4D 人体,最自然的路径是先用相机可控的视频扩散模型合成多个新视角视频,再把它们抬到 4D Gaussian Splatting。但这条路在实践中卡住了:现有的相机可控视频扩散能生成看起来合理的新视角视频,一旦把目标视角数量扩到 4DGS 重建所需要的数十个,一致性就崩了。作者把这个失效精确归因为「有界注意力上下文」问题——当目标视角数超过单次 DiT 前向能容纳的容量,就必须把视角分成若干组分批生成,而这一分组同时打开了两个互相耦合的瓶颈:参考上下文侧,如果让每一组都以此前生成的全部视角为条件,代价随视角数呈 O(N²) 增长;不这么做,则组与组之间失去共同参照,跨组一致性无从保证。 本文贡献:4DAnyone 的框架从源视频出发,一路 VAE 编码得到 Src Tokens,另一路过 HMR 模型估计人体,把目标视角的骨架渲染图经可训练的 Skel Enc 编码为 Skeleton Tokens。参考上下文侧维护一组 Ref Tokens 并配合 Pack Ref Context 机制压缩,与 Noise Tokens、Skeleton Tokens 一起拼接后送入 Diffusion Transformer。主干里每个 block 包含三种注意力,其中 Video Attention 与 Cross Attention 保持冻结、只有 Multiview Attention 可训练,作用维度上前者按 v(f h w) d 组织、后者按 f(v h w) d 组织——也就是说把「同一视角内跨帧」和「同一帧内跨视角」两种一致性显式分离到不同的注意力上,训练成本集中在真正需要新增的多视角一致性上。生成的多组目标视角视频最后统一用来训练 4DGS,得到可自由视角渲染的动态人体。 Overview of 本方法. Given a source video, we extract a 3D skeleton sequence via GVHMR and render skeleton videos and skeleton depths for $v$ target viewpoints. The 3D-aware skeleton encoder injects skeleton tokens into the DiT via residual addition. The source video is encoded by the pretrained VAE and concatenated with noisy target latents along the view dimension. The DiT denoises the target latents via Target Context Routing and the decoded target videos are packed into the Reference Context Packing module as references for subsequent generation rounds. The final 4DGS model is reconstructed from the generated multi-view videos using FreeTimeGS. 实验效果:论文的定位是生成「重建级别」的多视角一致视频,即质量足以直接支撑 4DGS 优化,而不只是看起来合理。配套的定性素材覆盖较广:既有工作室级的舞蹈/戏服序列,也有十余段真实户外手机视频(wild_demo)以及游戏角色多视角样本(supp_mvgamehuman),另有专门的挑战性案例与失败案例分析。核心主张是在目标视角数扩展到数十个的规模下,跨组一致性不再随视角数增加而崩溃,从而让单目随手拍视频到 4D 可渲染人体这条链路真正跑通。 Qualitative comparison with baselines. We show target-view generated videos (Gen.) and their corresponding 4DGS renderings (Rend.) across diverse human-centric videos. 本方法 produces geometrically accurate and visually detailed results across viewpoints, while the baselines suffer from inaccurate camera control (our fine-tuned ReCamMaster$^\dagger$) or geometric distortions (MV-Performer). See the project page for dynamic results. 批判点评:把问题归因到「有界注意力上下文」是这篇最扎实的部分——它不满足于说「一致性不够好」,而是指出根因是单次前向容量限制迫使分组,并把分组带来的两个瓶颈(参考上下文 O(N²)、跨组失参照)明确拆开,这种诊断方式让后续工作有明确的攻击面。架构上冻结 Video/Cross Attention、只训 Multiview Attention 也是有品位的选择:既复用了预训练视频先验,又把新增能力限定在真正缺失的维度上。但要注意几点。第一,整条链路对 HMR 人体估计的精度有硬依赖——骨架 token 是多视角生成的主要几何条件,一旦源视频里出现严重自遮挡或快速运动导致 HMR 失准,误差会直接传导到所有目标视角,论文提供了 failure case 但未量化这一依赖的敏感度。第二,casual monocular video(随手拍)的边界很模糊:wild_demo 里的素材多为竖屏高分辨率、主体居中、光照良好的短片段,与真正随手拍摄的抖动、遮挡、逆光场景差距不小。第三,工程成本不透明——生成数十个视角视频再优化 4DGS,单个对象的端到端耗时与显存需求是决定这套方案能否实用的关键,摘要与图里都没有交代。第四,方法涉及浙大、Robbyant、港中文、蚂蚁四方合作且投向 ACM 会议格式,属工程完成度较高的工作,但也意味着复现需要相当规模的算力与数据。 4. WithEveryone:十人合影身份不互串 WithEveryone: Unified Planning and Identity Grounding for Group Image Generation | 复旦大学、腾讯混元、香港大学 | arXiv:2608.20336 关键词:身份保持生成,群体图像,布局规划,身份接地,ID Loss,统一骨干 前序问题:身份保持的图像生成在单人场景已经比较成熟,但一旦场景里要出现多个指定的人,可靠性就迅速下降。难点不止是「每张脸都要像」,还要把每个参考身份绑定到画面里一个特定的人和特定的位置——模型很容易把 A 的脸特征渗到 B 身上,或者干脆漏掉某个参考。更棘手的是训练侧:常用的身份损失需要在若干张噪声预测出来的人脸之间建立对应关系,而在多人场景下这个对应本身就是模糊的,监督信号会被错配稀释,等于用一个不可靠的目标去训一个本就困难的任务。 本文贡献:WithEveryone 支持最多十个参考身份,把整件事组织成统一骨干上的一条多阶段序列。流程按阶段推进:先读用户提示与参考图,Reason 阶段做语义理解并输出 NTP 损失;接着 ID_IN 把身份 embedding 注入,Rep Forcing 阶段用 pred_emb 与 id_emb 之间的表征强制损失确保身份信息被真正吸收(而非被主干忽略);然后再一次 Reason 与 Layout Reason 阶段,以离散坐标 token(形如 <|x_130|><|y_288|>)的形式预测结构化的身份-布局规划;Layout Render 把这份规划渲染成一张可视条件图;最后 Denoise 阶段在 Flow Matching 与 ID Loss 联合监督下出图。关键设计是 Layout-Grounded ID Loss——利用标注的人脸区域,直接在正确的空间位置上监督对应的身份,绕开了多张噪声人脸之间建立对应关系这一模糊环节。整套方案把身份注入、布局规划、渲染约束串成一条链,每个环节都有明确的监督形态。 Overview of 本方法. The model loads selected reference identities as ID tokens, predicts structured Layout CoT, renders a visual layout condition, and predicts identity representations before generating the target group image. Modality-switch tokens that mark the boundaries between autoregressive reasoning and flow-based image generation are used in the sequence but omitted from the figure. 实验效果:方法支持最多十个参考身份的群体图像生成,配套的画廊素材(gallery1-3、quality)展示了多身份合影场景下的生成结果与质量对比,另有单步预测可视化与数据构造流程说明。消融部分覆盖较全:人脸尺寸的绝对/相对影响、高分辨率下的身份与规划表现、ID Loss 的布局项与权重设置、Rep Forcing 的余弦相似度与损失曲线,都各有独立分析图,说明作者对每个组件的作用边界做了系统检验。 Qualitative comparison with proprietary models. mark faces that reproduce a person already generated elsewhere in the image, that are not recognizable as their bound reference, and that appear transplanted without adapting to the pose, lighting, or viewpoint of the scene. These author annotations are illustrative; their quantitative counterparts are the duplicate rate, Sim(Ref), and Copy-Paste. 批判点评:这篇抓住的痛点很实在:多人身份保持的真正瓶颈不在人脸编码器强不强,而在「参考-人物-位置」这个三元绑定关系没有被显式监督。把布局作为中间产物先规划出来、再用人脸区域标注把 ID Loss 接地到具体位置,是对症的解法,比在损失里加更多身份约束更有希望。用离散坐标 token 让统一骨干直接输出布局规划,也避免了外挂一个布局模型带来的接口割裂。但几点需要保留判断。第一,整条链路依赖人脸区域标注来提供 Layout-Grounded ID Loss 的监督,这类标注在训练数据规模化时成本不低,且标注质量直接决定接地的准确性,论文的数据构造流程需要仔细看清楚这一步是人工还是自动、错误率多少。第二,「最多十个身份」是个上限声明而非能力曲线,实际效果在 2 人、5 人、10 人时大概率显著不同,摘要没有给出随身份数变化的量化衰减,而这恰恰是读者最关心的。第三,Rep Forcing 引入了额外的表征对齐损失,其权重与 ID Loss、NTP 损失、Flow Matching 损失之间的平衡是四项损失的调参问题,消融给了曲线但整体的调参难度可能被低估。第四,项目页与代码标注为「will be released」,当前无法验证,多阶段序列的实现细节(尤其坐标 token 的词表设计)对复现影响很大。 5. ear-VAE2:波形自编码器缺一根频率轴 Fourier is Frontier: Frequency-Aware Autoencoding for High-Fidelity Music Reconstruction | 阿里巴巴通义千问团队、Monash University | arXiv:2608.19843 关键词:音乐重建,复数STFT,音频自编码器,相位一致性,立体声,频段分工 前序问题:潜空间音乐生成模型的底座是连续潜表示的音频自编码器,而这些自编码器在高压缩率下普遍暴露三个失效:高频丢失、相位不连贯、立体声声像塌陷。以往这三个问题往往被分别当作独立缺陷来打补丁。作者提出一个结构性的共同根因:波形自编码器没有显式的频率轴,因此根本不存在一个可以做「按频段定向修正」的抓手——你想单独修高频或单独修相位,在波形域里没有对应的操作面。这个视角把三个看似不同的症状收敛到同一个表示选择问题上。 本文贡献:作者先在等预算条件下比较了五种表示,结论是复数 STFT 在全频带与高频谱距离上都最低,且能在每个频点上直接访问幅度与相位——也就是提供了那根缺失的频率轴。据此提出 ear-VAE2:立体声复谱经 Spec Encoder(Conv2d 与 Spec-Act 交替)压到 25 Hz 潜表示,Spec Decoder 还原出缺 Nyquist 的复谱,再由 Duplex-Aware Refiner 补齐为全频带复谱,最后 iSTFT 回到波形。两个核心部件各司其职:Spec-SnakeBeta 是频率相关的周期激活,对高/中/低频学习不同形状的非线性响应;Duplex-Aware Refiner 以 ConvNeXt-1D 为骨架,把输入复谱 X = M·e^{jφ} 按频段分工修正——高频(>4 kHz)只加幅度修正 δM,中频(1.5–4 kHz)同时加 δM 与相位修正 δφ,低频(<1.5 kHz)只加 δφ,并额外预测 Nyquist bin,整体带 bypass 残差。这个分工直接对应三个失效模式的物理成因:高频主要是幅度衰减,低频人耳对相位更敏感,中频两者都重要。 Architecture of 本方法. Stereo audio is transformed via STFT into a complex spectrogram; a Spec Encoder compresses it to a 25,Hz continuous latent and a Spec Decoder reconstructs a coarse complex spectrogram; the highest-frequency (Nyquist) STFT bin is removed to facilitate frequency downsampling. The subsequently applies band-specific complex corrections and restores the Nyquist bin to produce the full-bin spectrogram, which the iSTFT resynthesizes into a waveform. 实验效果:五种等预算表示的对比给出了方法选择的量化依据:复数 STFT 在全频带与高频谱距离两项上均为最低。系统层面的验证素材覆盖了各个组件的作用:输入表示的六面板频谱对比、潜空间频率探针、声学截止频率示例、STFT 漂移与波形对比、Spec-SnakeBeta 的二维响应可视化、refiner 前后对比,以及梯度范数稳定性与幅度损失的 A/B 消融曲线。训练在单节点 8 卡 A100 上完成,各阶段之间重置优化器状态。 Latent temporal-frequency probe for one track (Track 1004034; temporal split at 0.5). Rows (top to bottom): ground-truth audio; full reconstruction; low-temporal-frequency latent half decoded; high-temporal-frequency latent half decoded. Columns (left to right): 本方法, LeVo~2, SAME-L, and Stable Audio Open. For 本方法, the rapidly varying (high) latent half decodes to audio with a lower spectral centroid, matching Table. 批判点评:这篇的论证结构很干净:先指出三个症状共享一个结构性根因(没有频率轴),再用等预算的表示对比证明复数 STFT 是那根轴,最后按频段的物理特性设计分工修正。按频段拆分修正目标——高频补幅度、低频补相位、中频兼顾——是有听觉心理学依据的设计,不是拍脑袋的分段。作者来自通义千问团队,音乐生成底座的工程需求是真实的,方法的实用动机可信。但要注意几点。第一,摘要与配图里没有给出与主流音频自编码器(如 DAC、Encodec、Stable Audio VAE)在同一压缩率下的完整客观指标表格,「最低谱距离」只是五种表示之间的内部比较,跨方法的对照需要翻正文确认。第二,频段分工的三个边界(1.5 kHz、4 kHz)是硬编码的超参,不同音乐类型(电子、古典、人声)的能量分布差异很大,这套固定切分是否需要按内容自适应,论文未讨论。第三,25 Hz 潜帧率是个相当激进的压缩设定,在这个帧率下瞬态(鼓点、拨弦起振)的保真度是最容易出问题的地方,而给出的证据多为稳态频谱对比,缺少瞬态专项分析。第四,评估以客观谱距离为主,音乐重建的最终裁判是听觉,主观 MUSHRA 类测试的规模与结论需要核实。 6. VGI-Bench:27任务测视频模型会不会推理 VGI-BENCH: Probing Visual Intelligence in Video Generation Models | UIUC、清华大学、滑铁卢大学、MIT、UBC、Vector Institute、微软研究院 | arXiv:2608.19583 关键词:视频生成评测,视觉推理,零样本,任务分类体系,Seedance,MiniMax-H3 前序问题:已经有研究提示视频生成模型可能通过生成帧展现某种零样本视觉推理能力,但要可靠地评测这件事很难,原因有三。第一,输入必须与当前视频模型的视觉先验对齐,否则模型失败的原因是看不懂输入而不是不会推理。第二,评测必须要求一个有效的演化过程,而不是只看最终状态是否合理——否则模型可以靠猜一个看似正确的结果画面来蒙分。第三,任务难度需要标定在「有挑战但部分可行」的区间,太难则所有模型一起零分、太易则区分不出差异。这三条约束下的评测设计,比单纯堆任务数量困难得多。 本文贡献:VGI-Bench 包含 27 个任务、810 个实例,按「任务领域 × 技能标签」的两级分类体系组织,从而支持对视觉推理能力做细粒度拆解而非给一个总分。技能维度覆盖七项:规划(Planning)、空间(Spatial)、时序(Temporal)、属性接地(Attribute Grounding)、物理(Physics)、可供性(Affordance)、拓扑(Topology)。任务形态包括迷宫路径(线型迷宫、方格迷宫)等结构化推理场景,并配有专门的标注界面来保证判定一致。评测覆盖当前主要的商业与开源视频模型:Seedance-2.0、Kling-v3.0、MiniMax-H3、Gen-4.5、Sora-2、Wan2.7、Veo-3.1、Wan2.2 与 HY-1.5,商业模型走 API、开源模型本地在 H20 上跑,并给出了访问与算力预算说明。 Per-model performance across the skill tags. 实验效果:七维技能雷达图给出了清晰的能力画像:Affordance 是所有模型表现最好的维度,多数模型都能接近外圈;Topology 上 MiniMax-H3 反而领先 Seedance-2.0 与 Kling-v3.0;而 Spatial、Temporal、Attribute Grounding 三个维度整体收缩明显,多数模型落在 30 分以内的内圈。Seedance-2.0 与 Kling-v3.0 构成第一梯队且在 Planning 与 Physics 上拉开身位,Wan2.2 与 HY-1.5 作为较早的开源版本明显位于内圈。这幅图的信息量在于它显示当前视频模型的「视觉智能」是高度不均衡的——物体可供性这类偏静态语义的能力已经不错,而涉及多步空间/时序推演的维度仍是普遍短板。 Performance comparison in oracle prompting and in varying input visual styles. 批判点评:这份评测最有用的产出是那张雷达图,它把「视频模型会不会推理」这个含糊的问题拆成七个可分别观察的维度,并且直接暴露了能力结构的不均衡:Affordance 普遍高、Spatial/Temporal 普遍低。这个结构性结论比任何单一排行榜分数都更有指导意义——它告诉后续工作该往哪个维度投入。三条设计约束(对齐视觉先验、要求有效演化过程、难度标定在部分可行区间)也说明作者对评测方法学有认真思考,不是简单堆任务。但要保留几点。第一,810 个实例分摊到 27 个任务,平均每任务只有 30 例,而生成模型的输出方差很大,单任务 30 例的统计功效偏弱,雷达图上相近的两条线(如 Gen-4.5 与 Sora-2)差异是否显著难以判断。第二,视频生成模型的评测天然依赖判定器,迷宫这类任务尚可自动判定,但物理合理性、可供性这类维度的判定标准与判定者一致性论文需要交代清楚,否则维度间分数不可直接比较。第三,作者机构跨十家单位、参与者众多,评测规模与工程量可观,但也意味着不同任务的标注标准可能存在异质性。第四,商业模型走 API 意味着版本会持续变动,这份榜单的时效性有限,需要配套的持续更新机制才能长期有参考价值。 7. TextRefine:海报改字要避开商品主体 TextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters | 快手科技、中国科学院大学人工智能学院 | arXiv:2608.19637 关键词:文字编辑,商品海报,字形渲染,空间放置,奖励优化,罕见汉字 前序问题:商品海报里的文字编辑(插入新文字或替换已有文字)看着像通用图像编辑的子集,实际上有三个通用模型都做不好的具体要求:文字内容必须准确(不能漏字或写错,中文尤其困难)、放置位置必须合理(不能压在商品主体或已有内容上)、字形必须结构正确且与画面视觉一致(不能糊、不能变形、不能字重突变)。当前指令式编辑模型在这个场景下的失效是复合的:经常漏掉或错误渲染目标文字,把文字放到显著商品上,产出结构扭曲或视觉突兀的字形。三种失效原因不同,用一个笼统的编辑目标很难同时治。 本文贡献:TextRefine 是任务对齐的后训练框架,把监督微调与针对具体操作的奖励优化结合起来,分别对准上述三类失效。数据构造是这篇的重头,两条线并行。文字插入线:网络图像 → EasyOCR 检测文字 → Qwen-Image-Edit 移除文字 → 配对过滤与文字恢复(Qwen3VL-8B)→ 文字属性推断(相对位置、颜色效果、字体描述)→ 构造简单模板提示与描述式提示两种监督形态,形成训练对。文字替换线专门针对罕见汉字:同样先检测再移除,然后做罕见字替换与文字颜色推断(Qwen3VL-8B),从 50 种中文字体库中选字体,把目标文字渲染出来,再生成两种替换指令表述(「把『变』换成『蠹』」与「把『耐高温不变形』改成『耐高温不蠹形』」)。方法侧对插入操作采用基于文字跨度的奖励设计,配合有效跨度过滤与字形奖励信号;RL 阶段还做了难度感知的数据选择,优先挑信息量高的样本。训练用混合精度、全局 batch 8、学习率 1e-5,约 20 epoch,在 48 张 A800 上完成。 Overview of the data construction pipeline for text insertion and text replacement in OpenTextEdit. 实验效果:配套的验证素材覆盖了三类失效各自的改善情况:定性对比图、失败模式分析、SFT 训练样例,以及三组文字添加奖励曲线(FireRed、Qwen、TextRefine 各自一组)与两组文字替换对比(Qwen-FireRed 替换、TextRefine 替换),可以横向看到奖励优化在不同底座上的效果差异。评测样例图与有效跨度过滤、字形奖励信号的可视化则分别说明评测口径与奖励构造的合理性。 Comparison of binary OCR correctness and the proposed graded glyph signal. Whereas a binary reward retains only the final correctness decision, the target-glyph CTC posterior preserves continuous recognition evidence and provides a more informative signal for optimizing glyph fidelity. 批判点评:这是一篇工业味道很浓的论文,来自快手,解决的是电商海报本地化改字这个有明确商业价值的问题。它最扎实的地方是数据构造:用「检测→移除→恢复→属性推断→提示构造」这条流水线,从无标注网络图像里自动造出高质量训练对,而且专门为罕见汉字设计了字体渲染分支——中文文字编辑的长尾字形问题在英文为主的研究里几乎没人管,这个补位是实在的。把奖励按操作类型分开设计(插入用文字跨度奖励,字形另设信号)也比一个笼统的编辑奖励更对症。但几点需要注意。第一,整条数据流水线深度依赖 Qwen-Image-Edit 做文字移除、Qwen3VL-8B 做恢复与属性推断,这意味着训练数据的质量上限被这两个外部模型锁定,而且模型的失效模式可能被继承——如果 Qwen-Image-Edit 在某类背景上移除文字会留下痕迹,这些痕迹会作为「干净背景」进入训练集。第二,摘要与配图没有给出定量的文字准确率/位置合理率/字形质量三项指标表,改善程度只能从定性图判断。第三,48 张 A800 训 20 epoch 的成本对多数团队不现实,而论文没有交代更小规模下方法是否仍有效。第四,场景高度特化在商品海报,字体库限定 50 种中文字体,迁移到其他版式(如长图文、视频字幕)需要重新造数据,通用性有限。 8. Block3D:形状token切块自回归去噪 Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion | 浙江大学 ZipLab、西安交大、UC Berkeley、武汉大学、Monash、University of Adelaide | arXiv:2608.19567 关键词:文生3D,块状扩散,形状token,自回归,几何保真,生成加速 前序问题:文生 3D 已经推进得很快,但「高几何保真 + 低推理成本」这个组合仍然难拿。现有方法分两派,各有结构性缺陷。一派把离散形状 token 自回归解码出来,问题是严格串行、且一旦某个 token 错了就没有修正机会。另一派用扩散或流匹配迭代精修一个全局 3D 表示,问题是每一步都要处理完整表示,想要更高质量就得付更多步数,成本随质量线性甚至更快地涨上去。两派的共同困境是:生成粒度要么太细(逐 token 串行)要么太粗(全表示反复迭代),都没有落在效率与质量的合适折中点上。 本文贡献:Block3D 的做法是重新选择生成粒度:把离散形状 token 序列切成若干连续的块,块之间按自回归顺序生成、块内部联合去噪。这样既保留了自回归带来的顺序条件性(后面的块能看到前面已定的几何),又在块内获得了扩散的并行修正能力(一个块里的 token 可以互相纠错,不再是一锤定音)。相比逐 token 自回归,串行步数从 token 数降到块数;相比全表示扩散,每步只需处理一个块而不是整个表示,单步成本大幅下降。作者还给出了注意力可见性的可视化来说明块内/块间的信息流组织方式。 Block3D overview. Text and optional bounding-box conditions guide left-to-right block generation. Completed blocks form a frozen causal prefix, while M2T and T2T edit only the active block before the frozen decoder maps the completed codes to a mesh. 实验效果:端到端生成时间在 100 条 TRELLIS-500K 提示上测量,硬件为单张 A100 80GB,对照方法包括 ShapeLLM-Omni 与 TRELLIS 系列。生成质量方面给出了较丰富的定性素材:人形雕像、维纳斯像、王座人物、戒指、棋子、卡通角色、双头狮鹫、穹甲龟等多类几何,每个都配有原始文字描述并展示多视角结果,可以看出对复杂结构描述(「三颗八边形宝石对称镶嵌的戒指」「两个头、两条脖子、两条后腿、两条前腿和两条长尾的双头狮鹫」)有较好的服从度。另有场景级的复合结果(栅栏围合的院落)与大批量资产网格展示(40+ 个独立生成资产),说明方法在批量资产生成场景下的可用性。 Additional Block3D text-to-shape results. Each group contains multiple viewpoints of a single generated mesh, with its complete text prompt shown directly below. 批判点评:块状生成这个思路本身很自然——它就是在「逐 token 串行」和「全表示并行」这两个极端之间插入一个可调的中间点,用块大小当旋钮同时控制串行深度和单步成本。从工程角度这是个稳妥的改进,也容易与现有的形状 token 化方案组合。定性结果里对复杂组合描述(多部件、对称约束、计数约束如「两个头两条尾」)的服从度看起来不错,这类计数与对称约束恰恰是纯自回归容易翻车的地方,块内联合去噪的纠错能力在这里应该确实有帮助。但要保留几点。第一,块大小是核心超参,它直接决定效率-质量权衡的位置,论文若不给出块大小扫描曲线,读者无法判断报告的结果是在一个精心挑选的甜点上还是普遍成立。第二,效率对比表只给了端到端生成时间,缺少显存占用与质量指标的同表对照——单看时间快了但质量掉了多少,需要交叉验证。第三,块间自回归意味着误差仍会沿块序列累积,只是粒度变粗了,长序列(高分辨率形状)下这个累积是否可控,论文未专门检验。第四,作者机构跨六家单位,实验在单张 A100 上完成,规模适中;与工业级 3D 生成系统(如商业 3D 资产工具)的差距如何,缺少对照。 9. EfficientSync:口型编辑别再重绘整张下半脸 EfficientSync: Real-Time Lip Synchronization via Deformation-Based Reference Texture Mixing | 华南理工大学、罗切斯特大学 | arXiv:2608.18832 关键词:唇形同步,实时推理,参考纹理混合,形变对齐,口内细节,数字人 前序问题:音频驱动的唇形同步任务是把说话视频的嘴部区域改成匹配驱动音频,同时保持头部姿态、身份和背景不变。这在定义上是一个局部编辑任务,但主流做法却是用重型的 GAN 或扩散解码器把整个下半脸重建出来。代价有两层:一是延迟高,难以实时;二是更要紧的,重建式解码器会「幻觉」出口内细节——牙齿、唇纹这些高频结构被生成器凭先验编出来,而不是保留原视频里真实存在的纹理,结果是身份感和真实感都受损。作者的判断是,身份保持的瓶颈并不在参考帧数量不够,而在缺一个能把参考帧里已有的真实纹理忠实搬运过来的机制。 本文贡献:EfficientSync 由三个部件组成。STAR 采样(图中标注为 STAR Sampling)在拓扑特征空间 F_topo 里为当前目标选取合适的参考帧——驱动音频经 F_a 得到 e_a、源图像经 E_s 得到 e_s 与特征 F_s,参考图像经 F_r 编码后由注意力引导的 Warp 做形变对齐得到 F_r。动态纹理混合器(Dynamic Texture Mixer)把参考纹理 e_w 与 e_a、e_s 一起过自注意力,再在通道维度上学习一组打分曲线 R_1..R_N,据此对通道做加权混合,得到融合特征 F_mix——这一步是「混合真实纹理」而非「生成纹理」的关键。STAM 策略处理背景与遮罩的训练-推理差异:训练时用邻近帧配自适应遮罩,推理时用源帧配自适应遮罩,背景经 F_bg 与 Conv/Warp 分支处理后与 F_mix 相加,最后由 Spade 出图。整体是形变+混合的路线,绕开了重解码器。 The framework or our EfficientSync. (a) STAR Sampling first selects, from the source video, a reference pool that is both sharp and topologically diverse, supplying high-quality material for deformation at no inference cost. (b) The Dynamic Texture Mixer then aggregates the spatially aligned references into a high-fidelity mouth feature through a context-aware, channel-wise selection mechanism. (c) The Spatio-Temporal Shifted Adaptive Masking strategy finally composites the synthesized mouth back into the source frame, blending it seamlessly with the preserved background. 实验效果:效率对比在单张 A100 上进行,给出 FPS 等指标的完整表格,与主流唇形同步方法横向对照,主张达到实时。质量侧配有与 SOTA 的定性对比(vssota)、路由策略对比(comparison_routing)、动态纹理混合器的动机说明(dtm_motivation)与用户研究结果。核心主张是:在保持实时性的同时,口内细节来自真实参考纹理而非生成幻觉,因此在身份保真与真实感上优于重建式方法。这篇为期刊格式(含作者简介),实验组织相对完整。 Qualitative comparisons with state-of-the-art works under the cross-audio setting. EfficientSync preserves sharp, identity-consistent intra-oral textures, whereas competing methods either blur the mouth region or hallucinate teeth that deviate from the source identity. 批判点评:这篇的问题重述很有价值:把「口型同步身份不像」从「参考信息不足」重新归因为「缺少纹理搬运机制」,进而否掉了「重建整个下半脸」这条主流路径。用形变对齐加通道级纹理混合来替代生成式解码,在物理上更合理——真实牙齿纹理本来就在参考帧里,没必要让网络重新编一遍,这也顺带解释了为什么它能同时改善速度和真实感(不生成 = 不需要大解码器 = 更快)。三个部件(选帧、混合、训推一致)分别对准三个不同环节,设计不冗余。但几点要注意。第一,形变+混合路线的天花板受参考帧覆盖度限制:如果驱动音频要求的口型在所有参考帧里都没出现过(比如源视频从未张大嘴、或缺少特定音素口型),没有真实纹理可搬,这时方法要么退化要么产生不自然过渡,论文需要交代这个边界。第二,STAR 采样依赖拓扑特征空间的构造质量,这个空间怎么学、对新身份是否需要重新适配,是实用性的关键。第三,效率表是在 A100 上测的,「实时」在消费级显卡或移动端是否成立不明。第四,作者标注为 under review 的期刊投稿,方法组件较多(STAR/DTM/STAM 三件套加 Spade 解码),消融是否足以厘清各自贡献需要看正文;另外文中出现的 NVIDIA A100 仅为实验硬件,与机构归属无关。 10. DrumMotion:打鼓动作要精确到鼓面落点 Generalized Audio-Driven Synthesis of Precise Drummer Motion | Disney Research Studios、特拉维夫大学、ETH Zürich(SCA 2026 最佳论文) | arXiv:2608.19055 关键词:音频驱动动作生成,扩散模型,双目标损失,击打精度,SCA 2026 最佳论文,迪士尼 前序问题:音乐驱动的角色动画在娱乐与互动教育里有明确应用,但打鼓这个具体任务格外难:它要求高加速度的爆发式动作与极高的时空精度同时成立——鼓槌必须在正确的时刻落在正确的鼓面位置上,早几十毫秒或偏几厘米都会立刻显得假。现有方法多依赖动作匹配(motion matching)或 MIDI 输入,前者泛化到真实世界的多样音频很差,后者要求结构化输入而非原始音频。还有一个更基础的缺口:这个领域缺少能区分「精确打鼓」与「大致在动但不准」的标准化评测指标,导致方法之间无法有效比较。 本文贡献:系统分三段。数据获取段:动作捕捉采集鼓手动作,同时录 MIDI;数据增强用随机鼓组合成音频、再叠加随机音频滤波,从一份 MIDI 派生出多条音频(Audio 1..m),从而让模型见过大量音色与录音条件,这是「泛化到真实世界音频」的关键设计。动作合成段:音频先提取可解释音频特征(explainable audio features),与输入噪声 x_T 一起送入 Transformer Decoder 做扩散去噪,预测动作 x̂_0;姿态表示显式拆成 x = {r_body, r_sticks, p_sticks},即身体旋转、鼓槌旋转与鼓槌位置。核心是双目标损失 L(x, x̂) = L_body(r, r̂) + L_sticks(p_sticks, p̂_sticks),把「身体动作自然」与「鼓槌落点精确」两个诉求解耦到不同的监督项上——身体走旋转空间保自然,鼓槌单独走位置空间提精度。评测段提出两个新指标:Impact Point Deviation 衡量空间精度(鼓面落点偏差),Percussive Alignment Score 衡量时序对齐。长段落动作合成在推理时用滑动窗口拼接。训练用 Adam、学习率 3e-4、batch 128、6000 epoch,在单张 RTX 3090 上约 48 小时。 Overview. We augment the audio in our dataset resulting in motion sequences aligned with multiple audio variations to ensure generalization. Raw audio is then processed into explainable features to condition a diffusion-based Transformer Decoder. We employ a hybrid pose representation, using joint rotations for the body and Cartesian positions for drumsticks. The model is trained via a dual-objective loss to balance natural body dynamics with high-precision stick impacts. Finally, performance is evaluated using Impact Point Deviations and Percussive Alignment Scores to assess spatial and temporal fidelity. 实验效果:两个新指标给出的量化结果可以直接对照:Percussive Alignment Score 的小提琴图显示 GT 的平均 DAS 为 0.91,本方法 0.82,而仅旋转版本 0.69、两个消融档位分别为 0.59 与 0.80;数据增强的消融同样清楚——非增强版平均 DAS 0.70,增强版 0.84。也就是说双目标损失里的鼓槌位置项把 0.69 提到 0.82(向 GT 的 0.91 靠近),而随机鼓组+随机滤波的音频增强单独贡献了 0.70→0.84。另有击打点聚类影响分析、MIDI 对照、增益 0 vs -10dB 的鲁棒性测试、速度-加速度-MIDI 时序对照与用户研究。这篇获得第 25 届 ACM SIGGRAPH / Eurographics 计算机动画研讨会(SCA 2026)最佳论文奖。 Our model achieves temporal alignment comparable to ground-truth data. PAS distributions as violin plots for GT (leftmost, black), noisy GT (second and fourth, red), rotations-only model (middle, purple), and our model (rightmost, orange), when applied to our test dataset. Each sample is one-second long. Noisy GT is obtained by adding Gaussian noise with standard deviation $\sigma$=50 ms and $\sigma=25$ ms to every motion onset time. When noise is added to the data, PAS decreases, indicating that the metric successfully discriminates audio-motion alignment quality. 批判点评:这是今天最「小而完整」的一篇:问题定义清晰(高加速度 + 高时空精度的内在张力)、方法设计对症(双目标损失把自然性与精度解耦)、评测缺口自己补上(两个新指标)、消融给出了每个设计的独立贡献(位置项 0.69→0.82、音频增强 0.70→0.84)。用随机鼓组和随机滤波从一份 MIDI 派生多条音频这个增强设计尤其巧妙——它精准针对「泛化到真实录音」这个痛点,且成本极低。迪士尼研究院加 SCA 最佳论文的组合也说明工程完成度经得起图形学社区检验。要注意的是适用范围。第一,任务高度特化于打鼓,双目标损失的「身体走旋转、末端走位置」这个拆法虽然可以推广到其他需要末端精度的动作(弹奏、击剑、乒乓),但论文只验证了打鼓一种。第二,方法仍达不到 GT 水平(0.82 vs 0.91),这个差距在专业观众眼里是否可察觉,用户研究需要看具体设计。第三,训练依赖动捕数据加同步 MIDI,这类配对数据的采集成本很高,换一个乐器就要重新采集,数据门槛限制了推广速度。第四,48 小时单卡 3090 的训练成本很友好,但 6000 epoch 也提示数据量不大,泛化性主要靠音频增强撑起来,视觉侧(不同体型、不同鼓组布局)的泛化未见专门检验;文中提到的 RTX 3090 仅为实验硬件。 趋势观察 奖励函数写错了,模型就学会「什么都不做」 — 今天有两篇论文从完全不同的方向撞到了同一堵墙:当你用一个静态的重建指标去当动态生成的 critic,模型的最优策略往往是让画面停下来。Stream4D 把这件事说得最透——用 3D Gaussian Splatting 的重建误差当奖励,本意是逼视频模型学会几何一致,但单个刚性 3D 重建根本描述不了动态场景,于是真实的物体运动会被记成重建误差,而让整段视频冻结反倒能把这个 critic 刷满分。论文的对比图把三个场景摊开摆着:Base 模型 MOVES,VideoGPA 和 World-R1 两个用 3DGS 奖励训出来的方法双双标着 FROZEN,只有加了动态几何约束的版本 KEEPS MOTION。这个失效模式在自回归流式生成里尤其致命,因为每个 chunk 都会把上一个 chunk 的静止倾向继续放大。往回看昨天 DynaForcing 报告的「DMD 蒸馏后数字人变木头人」,会发现两者本质同源:一个是反向 KL 偏好低运动模式,一个是刚性重建 critic 惩罚真实运动,路径不同但都指向同一件事——凡是拿静态度量当动态目标的奖励设计,静止都是一个数学上合法的捷径。这也解释了为什么评测里必须单列动态幅度指标:只看画质分,两种崩塌都完全不可见。 小模型开始靠训练工程而不是参数量抢位置 — Swift-Image 的定位很直接:不比谁的参数多,比在受限算力预算下能把一个小生成器推到什么位置。它的 6B 单流 DiT 在统一编辑得分上拿到 4.33,而 20B 的 FireRed-Image-Edit 是 4.11、Qwen-Image-Edit-2511 是 4.07;更极端的是 3B 版本也有 4.32,几乎和 6B 打平。真正撑起这个结果的不是架构创新,而是一条堆到四层的后训练管线:任务专属教师做多步 RL、few-step 蒸馏、多教师 on-policy 蒸馏把 T2I 和编辑两个专家合成一个学生、最后再用 DiffusionNFT 做混合奖励精修。Block3D 走的是另一条省算力的路——把离散形状 token 序列切成块,块间自回归、块内联合去噪,避开了全表示反复迭代的开销。两篇放一起看,信号是清楚的:在开源生成模型这一层,参数规模的边际收益正在快速衰减,而蒸馏链路设计、专家合并策略、生成粒度切分这些「工程」变量的杠杆反而变大了。对算力有限的团队,这比追着堆参数更现实。 生成模型正在被拆开当几何编码器和信号处理器用 — 今天有几篇论文的共同动作是:不把生成模型当采样器,而是当一个特征提取或信号修正的组件。4DAnyone 把问题诊断为「有界注意力上下文」——当目标视角数超过单次 DiT 前向的容量,就必须分组,而分组会同时暴露参考上下文 O(N²) 增长和跨组不一致两个瓶颈;它的解法不是换模型,而是重新组织注意力的上下文结构,让视频扩散模型能稳定吐出数十个重建级一致视角,再抬到 4DGS。ear-VAE2 的思路更彻底:把音乐自编码器的失效(高频丢失、相位不连贯、立体声塌陷)归因到「波形自编码器根本没有显式频率轴」这个结构性缺陷,于是直接换到复数 STFT 表示,并按频段分工修正——高频只补幅度、中频补幅度和相位、低频只补相位。EfficientSync 则拒绝用重解码器重建整个下半脸,认为身份保持的瓶颈不是参考帧不够,而是缺一个把参考帧里已有真实纹理搬过来的机制。三篇的共性是把生成模型内部结构与任务的物理/几何先验对齐,而不是简单增大模型或加数据。 人工智能炼丹君 整理 | 2026-08-22 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月22日
21 阅读
0 评论
0 点赞
2026-08-21
AIGC 每日速读|2026-08-21|中科大揪出蒸馏后数字人变木头人DynaForcing
今日 AIGC 论文速览 今日共 10 篇 · 推理加速与蒸馏 3 篇 · 奖励模型与偏好对齐 1 篇 · 语音与音频驱动生成 2 篇 · 3D 与部件级生成 1 篇 · 视频编辑 2 篇 · 生成评测 1 篇 重点论文标题列表 DynaForcing(中国科学技术大学、南京大学、合肥工业大学、清华大学(ACM MM 2026)):蒸馏后数字人静止的真凶是反向KL VA-Judger(复旦大学、上海创智学院、华为诺亚方舟实验室):拼指标当奖励就是在教模型作弊 ⚡ SparsePR(Texas A&M University):22%密度换2.61倍加速靠残差回填 MDD(南京理工大学、华为):轻量模型管幅度缓存管方向 FireRedTTS3(小红书):冻结音频编码器当语义老师稳住自回归 今日论文速览 1. DynaForcing:蒸馏后数字人静止的真凶是反向KL DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation | 中国科学技术大学、南京大学、合肥工业大学、清华大学(ACM MM 2026) | arXiv:2608.17707 关键词:动态崩塌,DMD蒸馏,自强制,数字人,反向KL,ACM MM 2026 ⚠️ 前序问题:音频驱动数字人要同时满足三件事:口型对得上、表情有起伏、还能实时流式出帧。近期的做法是用自强制(self-forcing)配合分布匹配蒸馏(DMD)把多步教师压成少步学生,实时性确实拿到了,但这条路上藏着一个此前没人系统刻画过的失效模式:学生模型会收敛到一个近乎静止的最优解——单帧看上去画质很好,时序动态却被严重压制。这对数字人是致命的,因为哪怕只丢一点点运动幅度,口型同步和表情自然度就跟着崩。更麻烦的是常规评测发现不了:感知质量指标在这个过程中甚至还在上升,只有专门看动态幅度的指标才会暴露问题。 本文贡献:作者先把病因拆成两条。第一条来自 DMD 的目标函数本身——反向 KL 具有模式寻求(mode-seeking)倾向,会主动偏向低运动模式,因为静止解在分布上更「安全」。第二条来自无锚点的自条件:学生用自己上一步的输出继续往下推,一旦运动开始衰减,这个反馈回路会把衰减不断放大。对应地,DynaForcing 在三个不同层面下药。数据层的 Hybrid Forcing 把 rollout 按概率锚定到真实动态上,切断反馈回路;损失层的 Dynamics-Aware Reward Regularization 借 DMD 的强化学习解释引入显式运动奖励(用 Sync-C 和关键点方差构造 R_dyn,以 exp(α·R_dyn) 缩放 DMD 损失),直接对冲反向 KL 的偏置;条件层的 Reference Perturbation 用 Qwen-Edit 加 ArcFace 过滤造出五档相似度的扰动参考图,把身份从静态细节里解耦出来,逼模型只能靠音频去驱动运动。工程上还额外贡献了计算图剪枝与梯度重放,把自强制训练的显存开销压掉一个数量级以上。 Overview of . Three strategies intervene at different levels of the self-forcing training pipeline: (a) Hybrid Forcing at the input level, (b) dynamics-aware reward regularization at the loss level, and (c) reference perturbation at the conditioning level. 实验效果:动态幅度从崩塌状态恢复到与教师相当的水平:Dyn-Deg 从 0.31 提到 0.73,唇音同步 Sync-C 从 7.03 提到 7.68,而视觉质量指标同时改善,也就是说质量与动态的权衡在整个训练过程中被解开了,不再需要靠早停去凑一个折中点。训练曲线图给出的证据更直观:原始自强制方案在 T2V 和 Avatar 两个设定下,Dynamic Degree 都在 4000 步左右骤降到接近 0(Avatar 上 Sync-C 先冲到 7.8 再一路滑到 5 以下),而同期 Imaging Quality 和 Aesthetic Quality 几乎是平的甚至微升——这正是「只看画质指标会完全漏掉崩塌」的实证。作为对照,教师强制版的 CausVid 动态维持在 0.4-0.7 区间波动而不崩。 Dynamic collapse in self-forcing distillation. (a)~Text-to-video (Self-Forcing~huang2025self): VBench~huang2023vbench dynamic degree drops from 0.80 to 0.00 while visual quality improves. (b)~Audio-driven avatar (LiveAvatar~huang2025liveavatar): Sync-C and ExpVar degrade while IQA and ASE improve. (c)~Comparing self-forcing with CausVid~yin2025slow (GT-anchored): CausVid's dynamic degree fluctuates around 0.43 without collapsing, confirming that unanchored self-conditioning, not DMD distillation itself, drives the collapse. 批判点评:这篇的价值主要在诊断而非疗法。把「蒸馏后数字人变木头人」这个从业者都遇到过但说不清的现象,明确归因到反向 KL 的模式寻求性质加上无锚自条件的正反馈,并且用训练曲线证明感知质量指标对此完全不敏感——这个洞察本身就值得记下来,它意味着任何做少步蒸馏的团队都该在评测里补一个动态幅度指标,否则等于在盲飞。三条策略也确实分别对准三个不同层面,不是同质化的堆料。但要清醒几点。第一,Dyn-Deg 0.31→0.73 这个数字很漂亮,但 Dynamic Degree 本身是 VBench 系的粗粒度指标,它变高既可能是恢复了有意义的表情运动,也可能是引入了额外抖动,论文没有给出区分二者的证据(比如人眼评测里对「运动是否自然」的单独打分)。第二,Dynamics-Aware Reward 用 exp(α·R_dyn) 缩放损失,α 的取值必然敏感——给太大就变成鼓励乱动,论文对这个超参的鲁棒区间交代不足。第三,Reference Perturbation 依赖 Qwen-Edit 生成扰动参考图,这引入了对外部编辑模型能力的隐性依赖,换一个编辑器扰动分布就变了,结论的可迁移性未验证。第四,实验主要在 Avatar 场景,通用 T2V 上只给了崩塌现象的展示而非完整修复效果,「这套方法是否同样适用于一般视频蒸馏」仍是开放问题。 2. VA-Judger:拼指标当奖励就是在教模型作弊 VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation | 复旦大学、上海创智学院、华为诺亚方舟实验室 | arXiv:2608.18607 关键词:视听联合生成,奖励模型,人类偏好,思维链,维度级GRPO,LTX-2 ⚠️ 前序问题:要用强化学习后训练视听联合生成模型,第一件事是得有奖励信号。现在的通行做法是把音质、画质、音画同步度这几个单项指标加权拼成一个总分。问题在于这些指标各自只看一个感知维度,谁都没有捕捉到「文本提示、视频、音频三者之间的整体语义与时序连贯性」——而恰恰是后者决定了人类会不会觉得这段内容好。用拼出来的指标当优化目标,模型很快学会 reward hacking:每一项分数都刷得很高,成品放给人看却依然割裂、不忠于提示。这是奖励建模里的经典陷阱,只是在视听双模态下更隐蔽,因为可选的单项指标更多,堆起来看着更「全面」。 本文贡献:作者先补数据:构建 VAPref-10K,包含 9K 条提示和 10.3K 组细粒度成对比较,样本来自多个开源生成模型,标注由人类完成。再补评测:提出 VA-Judger-Bench,同时设置域内和域外的模型对比,专门检验奖励模型是否真的与人类偏好对齐,而不是只在训练分布上过拟合。核心方法 VA-Judger 是一个带思维链的 omni 奖励模型,训练分三段推进:第一段格式蒸馏,从质量差距明显的对子里学会结构化输出(提示对齐、音画一致性、音质、画质、完整度五个维度先想再答);第二段人类对齐,对质量接近的难例用拒绝采样,只保留与人类标注结论一致的解释链,再做 SFT;第三段维度级 GRPO,把人类反馈拆解到各个质量维度上分别给奖励,比单一二元偏好标签提供的信号密度高得多。三段的设计逻辑是从易到难、从格式到判断、从粗到细。 Overview of the VA-Judger training pipeline. Stage 1 cold-starts the model on easy preference pairs. Stage 2 aligns the model on harder pairs through human rejection sampling. Stage 3 performs GRPO using answer-level and dimension-level rewards grounded in human reasons. 实验效果:在域内和域外两套评测上,VA-Judger 预测人类偏好的准确率都超过拼指标的基线。更有说服力的是下游验证:用它的奖励去后训练视听生成模型,人类偏好率从 LTX-2 原始模型的 10.08%、OmniNFT 后训练的 27.63%,提升到 62.3%——三者相加正好 100%,说明这是一次三方对比的人类投票,而不是各自独立打分,62.3% 意味着在超过六成的对局里人类选了 VA-Judger 后训练的结果。 Human preference rates over 200 three-way comparisons. For each prompt, participants select the best video-audio output among LTX-2, LTX-2 post-trained with OmniNFT, and LTX-2 post-trained with VA-Judger. 批判点评:这篇把奖励建模里那个人人都懂但很少被正面处理的问题挑出来讲清楚了:单项指标线性加权不是「近似人类偏好」,而是「定义了一个可被刷分的新目标」。用 CoT 结构强制模型先在五个维度上给出理由再下结论,配合拒绝采样只保留结论正确的解释链,这套做法在文本奖励模型上已被验证过,搬到视听双模态并补上维度级 GRPO 是合理的推进。下游 10.08%/27.63%/62.3% 这个三方对比也比单看奖励模型准确率更有说服力,因为它证明奖励确实能转化成生成质量。但几点需要打问号。第一,训练数据的 CoT 由 Gemini 3.1 生成,这意味着奖励模型的判断风格与偏好倾向被教师模型的先验深度塑造,「与人类对齐」这个说法实际上是「与被人类标注筛选过的 Gemini 解释对齐」,两者不完全等价。第二,10.3K 组成对比较放在双模态偏好建模里并不算多,尤其还要覆盖 9K 条不同提示,平均每条提示只有约一组比较,难以刻画同一提示下的偏好分布。第三,下游验证只在 LTX-2 一个模型上做,而奖励模型最怕的就是与特定生成器的失效模式耦合——换一个音画同步机制不同的底座还能否维持 62.3% 的领先,论文没有回答。第四,域外评测虽然设置了,但「域外」仅指未见过的生成模型对比,提示分布仍来自同一批,真正的分布外泛化并未检验。 3. SparsePR:22%密度换2.61倍加速靠残差回填 Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models | Texas A&M University | arXiv:2608.18484 关键词:免训练稀疏注意力,块稀疏,残差重建,响应耦合分块,视频生成,世界模型 ⚠️ 前序问题:免训练的块稀疏注意力是给视频 transformer 加速的主流手段,但作者指出这条路上有两个被含糊处理的前提。第一,「注意力按行高度集中」这个观察本身并不能直接给出一个可执行的稀疏算子——共享同一块路由的多个查询,它们各自真正需要的 key 支撑集可能重叠得很差,池化后的并集会被撑得很大,稀疏度名义上高、实际执行的键值对并不少。第二,「保留了多少注意力质量」这个常用判据也不足以决定被跳过的交互会带来多大的 softmax 后误差,因为 softmax 是非线性的,丢掉的 logit 质量与输出偏差之间没有简单对应。换句话说,现有方法在「怎么分块」和「丢了多少」这两个关键环节上都在用代理指标做决策。 本文贡献:SparsePR 由两个部件组成。响应耦合分块(Response-Coupled Partitioning)不再对查询向量本身做 K-means,而是对采样查询的 key 响应做聚类,形成配对的 K/V 组,用组质心诱导出「查询-响应」坐标系再共享路由——这样落到同一路由的查询在支撑集上真正是相似的,图里给出的对比很直观:语义聚类下五个块的支撑集并集大小为 5,响应耦合聚类下降到 2。探针拟合残差重建(Probe-Fitted Residual Reconstruction)则拿一小批精确计算的查询行做探针,测出稠密输出与稀疏输出之差,在探针残差张成的输出子空间里拟合一个逐调用的仿射修正(b, B),再把这个修正加回稀疏输出上。整套流程免训练、逐调用自适应,不需要改模型权重。 Overview of SparsePR. Response-Coupled Partitioning builds executable K/V and query groups, and Probe-Fitted Residual Reconstruction uses exact probe rows to correct the sparse output. 实验效果:在四个异构的视频生成与世界模型上,SparsePR 一致降低了注意力重建误差。误差-密度权衡曲线显示,在 HunyuanVideo、Wan2.2、Cosmos-Predict2.5、Cosmos3-Nano 上,响应耦合分块的均值误差与 p99 误差都稳定低于语义分块,且优势在低密度端更明显。消融给出的归因是:探针拟合贡献了误差下降的主要部分,响应耦合分块主要负责降低硬丢弃误差、并在探针预算有限时改善重建质量。端到端上,在实际执行的键值对密度 22.0%-26.0% 时保持生成质量,取得 1.48 倍到 2.61 倍的整体加速。 Cross-model density sensitivity. Mean (top) and p99 (bottom) normalized attention-output error versus total executed-pair density for semantic and response-coupled partitioning under the same residual-repair configuration. The dashed line marks the (22%) reference density. 批判点评:这篇的问题定义比方法更值得读。「行稀疏集中不等于可执行稀疏算子」和「保留注意力质量不等于输出误差小」这两句话,把大量免训练稀疏注意力工作的隐含假设直接点破了,而且给出了可量化的反例——支撑集并集从 5 降到 2 这个数字,说明分块几何本身就能带来一倍以上的实际计算量差异,这是纯靠调稀疏率调不出来的。探针拟合仿射修正的思路也务实:既然误差主要落在一个低维子空间里,那就用少量精确行把它估出来补回去,成本可控。不过要注意几点。第一,1.48x-2.61x 的区间跨度很大,论文没有清楚交代这个区间对应的模型与分辨率组合,读者无法判断自己的场景落在哪一端;22.0%-26.0% 的密度区间同理。第二,探针本身要精确计算若干查询行,这部分开销随探针预算线性增长,而重建质量又依赖探针数量,端到端加速比与重建质量之间存在一个论文未充分暴露的权衡曲线。第三,评估以注意力重建误差为主,生成质量只说「保持」,缺少 VBench 之类的完整对照表,「误差降低」到「人眼看不出差别」之间还差一层证据。第四,作者机构在视频生成方向积累有限,四个模型的实验规模也不算大,工业级长视频场景下响应耦合聚类的开销是否仍可忽略,值得实测后再判断。 4. MDD:轻量模型管幅度缓存管方向 Magnitude-Direction Decoupling for Fast Video Generation with Flow Matching Models | 南京理工大学、华为 | arXiv:2608.17695 关键词:流匹配加速,幅度方向解耦,缓存复用,CFG复用,Wan2.1,华为 ⚠️ 前序问题:流匹配视频生成的效果已经很好,但迭代去噪带来的算力开销极高。一个自然的想法是:并非每一步都需要完整的大模型,有些步骤可以换成更便宜的替代品。现实中的两种替代手段各有毛病——直接缓存复用上一步的输出,或者直接换一个轻量模型来预测,都会让采样轨迹偏离原始去噪路径,最终画质和内容丰富度都掉下来。问题的症结在于,此前的加速工作把「用便宜的东西替代」当成一个整体决策,而没有去问:模型输出这个向量里,究竟哪一部分是轻量模型能可靠给出的,哪一部分必须靠别的机制补。 本文贡献:作者的实证分析给出了一个干净的拆分:把去噪输出看作幅度与方向两个分量,轻量模型能稳健地捕捉幅度分量,而缓存则能提供可靠的方向指引。基于这个观察,MDD 让方向校准后的轻量模型去替代原模型完成部分步骤——轻量模型负责出幅度,缓存负责纠方向,从而在加速的同时把轨迹偏移修正回来。此外 MDD 还在 classifier-free guidance 上做了进一步节省:CFG 需要跑条件和无条件两路,而作者发现两路的幅度信息可以复用,于是只算一路幅度,进一步压掉推理开销。整套方案不改模型权重,属于即插即用的采样器级加速。 实验效果:在多个基准上 MDD 优于既有加速方法,在 Wan2.1 上最高取得 2.95 倍加速,同时保持较高的视觉保真度与内容丰富度。支撑「幅度可替代、方向靠缓存」这一判断的实证曲线显示:在整个扩散过程中,大模型与残差复用、大模型与小模型两条余弦相似度曲线的走势差异明显(方向上小模型不可靠),而幅度比值曲线则长期贴近 1.0(幅度上小模型可靠);CFG 的条件/无条件两路幅度曲线在大部分时间步高度重合,只在末段分离,这是幅度复用可行的直接依据。 批判点评:把加速的替代决策从「整体换不换」细化到「幅度换、方向不换」,这个拆分角度是这篇最有价值的部分——它给后续工作提供了一个可复用的分析框架:先看输出向量的哪个分量对替代鲁棒,再决定用什么机制补另一个分量。CFG 幅度复用也是顺手捡的一笔便宜,工程上很容易落地。但这篇的呈现有明显短板。第一,论文的核心框架图用 TikZ 绘制、正文只有一个 tex 文件,可提取的图仅剩分析曲线,方法结构的可读性偏弱。第二,2.95 倍是「最高」值且限定在 Wan2.1 上,其他模型上的加速比与质量代价没有在摘要层面交代,实际收益范围不明。第三,「保持高视觉保真度」缺少人眼评测支撑,而幅度/方向解耦这类近似最容易在长时序上累积出细微的运动不连贯,这恰恰是自动指标最不敏感的地方。第四,方向来自缓存意味着对相邻步的相似性有隐含假设,在采样步数被压得很少(比如 4-8 步)的场景下相邻步差异变大,这套解耦是否还成立,论文未做低步数极限的验证。 5. FireRedTTS3:冻结音频编码器当语义老师稳住自回归 FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations | 小红书 | arXiv:2608.17492 关键词:连续自回归TTS,语音编辑,语义蒸馏,零样本音色克隆,指令控制,小红书 ⚠️ 前序问题:新一代连续自回归 TTS 直接在连续语音表征上工作,好处是保留了丰富的声学细节,同时能吃到文本 LLM 的指令跟随能力,音色克隆、指令化音色设计、语音编辑这些能力一下都打开了。代价是自回归固有的误差累积——生成越长,偏移越大,吐字和音色都可能跑偏。既有的缓解方案要么额外挂语义模块,要么搞多阶段 tokenizer 训练流程,要么把自回归架构改得很复杂,都是在系统复杂度上付账。作者想要的是在表征层面而不是架构层面解决这件事。 本文贡献:做法相当简洁:拿一个在多种语音理解任务上训练好的、冻结的音频编码器当语义教师,用它去正则化音频特征空间。这样做的效果是文本-语音对齐变好、自回归生成更稳定,而整个系统结构保持简单,不需要额外语义模块也不需要多阶段 tokenizer 流程。架构上分三块:RedAE tokenizer 把 24kHz 音频经 50Hz 序列压到 25Hz 潜表征,同时受重构损失和语义蒸馏损失双重约束;FireRedTTS3-Base 是 Backbone Transformer 加 Flow Head 与 Stop Predictor,做多语言多方言的零样本音色克隆;FireRedTTS3-Instruct 在此之上支持统一的音色克隆、指令化音色设计和语音编辑(例如「删除第一个词」这类编辑指令直接以文本形式输入)。代码与模型已开源。 An overview of FireRedTTS3, including (a) the RedAE Tokenizer with semantic supervision, (b) FireRedTTS3-Base for multilingual and multi-dialect voice cloning, and (c) FireRedTTS3-Instruct for voice cloning, instruction-controlled voice design, and speech editing. 实验效果:FireRedTTS3-Base 在 Seed-TTS-Eval 和 MiniMax-MLS-Test 上取得对比系统中最好的平均语音可懂度与说话人相似度;FireRedTTS3-Instruct 在 InstructTTSEval 和 Ming-Freeform-Audio-Edit 上超过竞争系统。作者据此论证:语义信息丰富的连续语音表征配上简单架构,就足以支撑稳定、可控、高保真的语音生成与编辑。 批判点评:这篇的取向很对我的胃口——不加模块、不加阶段,只在表征约束上动手,用一个现成的冻结理解模型当语义锚。这个思路的可迁移性其实超出 TTS:任何连续自回归生成任务,只要该模态存在成熟的理解侧编码器,都可以照这个套路给特征空间加语义正则。小红书把 Base 和 Instruct 两个变体分开发布也很实用,前者专注克隆质量,后者覆盖指令与编辑。但要注意的地方不少。第一,「简单」是相对的——冻结音频编码器本身就是一个在多任务上训过的大模型,把它算进系统开销后,与「额外挂语义模块」的复杂度差距没有摘要说得那么大,只是训练流程更短。第二,效果论证全部依赖自动指标(可懂度、说话人相似度),而语音生成里最关键的自然度、韵律合理性与情感恰当性都必须靠 MOS 类主观评测,摘要层面完全没提。第三,语音编辑的评测只在 Ming-Freeform-Audio-Edit 上做,这个基准的覆盖广度和难度分布尚未被社区充分检验,单一基准上的领先说服力有限。第四,论文只给出一张架构图,缺少可视化的实验对照,无法判断误差累积到底被压住了多少——「更稳定」这个说法需要长句合成的失败率曲线来支撑。 6. MegaParts:300部件3D生成靠离散token压出来 MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling | 香港大学、上海人工智能实验室、复旦大学、同济大学、浙江大学 | arXiv:2608.14783 关键词:部件级3D生成,自回归,向量量化,自适应长度tokenizer,256k上下文,上海AI Lab ⚠️ 前序问题:可控建模、编辑、关节化这些图形学应用都需要把物体表示成语义部件的有机组合,所以部件感知的 3D 生成很重要。但现有方法扩不上去:部件数一多,生成精细几何所需的 token 长度和显存就贵得离谱,于是大家只能停在几个到十几个部件的量级,而真实的复杂物体——一台钢琴、一架投石机——动辄上百个部件。这是一个纯粹的规模瓶颈,不是质量瓶颈。 本文贡献:MegaParts 把结构化序列建模和一个 token 高效的向量量化形状 tokenizer 结合起来。tokenizer 的目标函数是「在保证高保真重建的前提下最小化 token 用量」,因此学到的离散潜表征长度能随几何复杂度自适应——简单部件少花 token,复杂部件多花。在这个紧凑表征之上训一个大语言模型,在统一的结构化序列里依次生成物体包围盒、部件包围盒和部件形状 token,配合高效长上下文训练策略,支持最多 300 个部件、序列长度最长 256k token。架构图显示生成分两级:全局布局 token 负责规划(chain of thought 形式给出各部件的 bbox 与 token 预算),局部形状 token 负责逐部件生成几何,最后通过 SDF 与 Marching Cubes 出网格。 Overview of MegaParts. Our framework consists of two stages. Top: we learn a token-efficient vector-quantized representation for part geometry. Bottom: we train a part-aware autoregressive generator that represents a 3D object as a structured sequence conditioned on a text prompt and optional object- and part-level bounding boxes. If bounding boxes are absent, the model first predicts the object box and part boxes, followed by autoregressive generation of local shape tokens for each part. The decoded part geometries are then assembled into the final part-aware 3D asset. 实验效果:网格质量高于自回归与扩散基线,作者据此论证压缩后的离散部件 token 不仅解决了可扩展性,还提升了可达到的几何保真度。teaser 图给出的四个例子分别是 164、300、287、159 个部件的复杂物体(机械人形、投石机、伞状结构、三角钢琴),每个部件都以独立颜色区分且保持了可分离的语义结构,直观说明了「上百部件」这个量级不是统计口径而是真的能生成出来。 批判点评:「先把 token 压到极致,再让 LLM 原生自回归」这条路径在 3D 生成里的说服力正在变强,这篇把部件数推到 300、上下文推到 256k,是个实打实的规模跃升,而且顺手给出一个反直觉结论——压缩不但没损失保真度,反而提升了可达到的几何质量。两级生成(全局布局规划 + 局部形状填充)的分工也很自然,本质上是把 3D 建模里「先摆结构再抠细节」的人类流程编码进了序列顺序。需要冷静看的地方:第一,「网格质量高于基线」缺少具体数值,而部件级生成的基线本身就少,对比的公平性(同等算力、同等训练数据)无从判断。第二,300 部件是上限而非常态,论文没有交代部件数从 10 增到 300 过程中质量与耗时的退化曲线,实用价值主要取决于这条曲线的形状。第三,256k 上下文的训练成本必然可观,「高效长上下文策略」具体省了多少、单次生成的推理延迟是多少秒级还是分钟级,摘要层面没有回答,而这直接决定它是产品可用还是仅供研究。第四,部件的语义划分质量依赖训练数据里的部件标注,而高质量部件级 3D 数据本身稀缺,这套方法在标注体系之外的物体类别上泛化如何,是个真实的隐忧。 7. VicEdit:40万条数据把编辑指令从文字换成示例 VicEdit: Learning to Edit Videos from Visual In-Context Examples | 上海交通大学、腾讯优图实验室、浙江大学 | arXiv:2608.16745 关键词:视觉上下文编辑,视频编辑,模态自适应语义蒸馏,双上下文注入,VicEdit-400K,腾讯优图 ⚠️ 前序问题:指令式视频编辑已经做得不错了,但纯文本指令有个绕不过去的瓶颈:细腻纹理和复杂动态很难用语言讲清楚。你可以说「把花瓶涂成深番茄红」,但「深番茄红」到底是哪个红、光泽如何、材质反射怎样,文字给不出精确答案;「转成雪天」这类全局风格更是如此。这个感知鸿沟导致模型要么改得不够(干脆不动),要么改得过头(风格漂移、结构崩坏)。 本文贡献:作者提出视觉上下文编辑这一范式,把编辑条件从文本指令升级为多模态视觉引导,支持单张图像、图像对、视频对三种参考形式。配套造了 VicEdit-400K——首个大规模视觉上下文视频编辑数据集,用自动化流程生成 40 万条高质量样本、覆盖十类任务,并做了多维度过滤保证视觉保真与语义一致。方法上 VicEdit 要解决的核心问题是异构参考的统一:模态自适应语义蒸馏(Modality-Adaptive Semantic Distillation)从不同形式的视觉参考里抽出模态特定的语义 token,双上下文注入(Dual-Context Injection)再把这些视觉 token 与文本指令 token 拼接后送进 DiT 的交叉注意力,让生成同时受视觉与文本两路信号约束。MLLM 侧用 LoRA 微调,DiT 的自注意力冻结、交叉注意力可训。 . It consists of 1) MASD modulates base queries $Q_{base}$ with modality embeddings $E_m$ to distill visual tokens $T_{vis}$; 2) DCI applies a semantic shift to calibrate instruction extraction, yielding dual-context tokens. These unified embeddings are injected into a Video DiT to steer the generation process. All examples presented in the figure are collected from the open-source OpenVE~he2025openve. 实验效果:在 VicEditBench 上,VicEdit 在基础指令编辑和视觉上下文编辑两类任务上都取得最优。定性对比很直观:三个案例分别是局部风格(把花瓶涂成深番茄红)、全局风格(转成雪天)、局部移除(去掉时钟及其阴影)。基线们的失败模式各异——Lucy-Edit 和 NovaEdit 大量出现 No Change(干脆没动),VideoCoF 出现 Flat Coloring(上色平板无质感),Kiwi-Edit 则是 Severe Artifacts 和 Inpainting Failure;VicEdit 在三个案例上分别达到自然编辑、和谐风格化与完全移除。 Comparison with baselines on visual in-context editing tasks. All examples presented in the figure are collected from the open-source OpenVE~he2025openve and Senorita~zisenorita. 批判点评:「文字讲不清纹理和动态」这个判断本身没有争议,用视觉示例当条件也是图像编辑那边已经验证过的路子,这篇的贡献主要在于把它系统地搬到视频域并且把数据这一环补齐——40 万条、十类任务的规模在视频编辑数据集里是可观的,光这一项就有实际价值。技术上把三种异构参考(单图/图对/视频对)统一成模态特定语义 token,再与文本双路注入,设计是干净的。但要注意几点。第一,VicEdit-400K 由自动化流程生成,也就是说训练数据的编辑效果上限被生成流程所用的模型决定,「高质量」是过滤后的相对高质量,模型很可能继承了造数据时那些模型的偏好与瑕疵。第二,评测在自建的 VicEditBench 上进行,而这个基准与训练数据同源,域内优势难以排除——同组作者另一篇 PersonaShot 就明确指出现有视频评测在跨镜头连续性上普遍失灵,自建基准的覆盖面同样需要外部检验。第三,定性图里基线大面积出现 No Change 这个失败模式值得警惕:这更像是基线在该提示形式下未被正确调用,而非能力缺失,公平性存疑。第四,三种参考形式的相对贡献没有拆开,实际使用中「给一张图」和「给一对视频」的成本差异巨大,读者需要知道最便宜的那档能拿到多少收益。 8. MSEditor:多视角数据改造成跨镜头监督信号 MSEditor: Toward Consistent Multi-Shot Video Editing | 香港科技大学(广州)、香港科技大学、百度、清华大学(ECCV 2026) | arXiv:2608.17559 关键词:多镜头视频编辑,跨镜头一致性,监督适配器,跨镜头打包,ECCV 2026,百度 ⚠️ 前序问题:对一整条多镜头视频做统一修改,难点不在单镜头编辑本身,而在镜头之间。多镜头视频由时序上不连续的片段拼成,视角、机位尺度、主体姿态在切镜处大幅跳变,逐镜头独立编辑会导致严重的身份漂移,误差还会沿序列累积放大。要做到连贯,模型必须建立可靠的跨镜头语义感知,在这些断裂的边界之间维持主体外观稳定与视觉连续。而这类任务的高质量训练数据几乎不存在——没人专门去拍「同一编辑在多镜头下的前后对照」。 本文贡献:MSEditor 是首个专门面向一致性多镜头视频编辑的框架。数据这一环用了个巧办法:把现成的多视角视频数据集改造过来提供跨镜头监督——多视角天然就是「同一主体在不同视角下」,正好对应多镜头的核心难点。架构上引入监督适配器(Supervisory Adapter)把跨镜头信息注入扩散骨干,让模型学到身份一致的表征;这个适配器块与冻结的 DiT 块并行,只有适配器的 patchify、cross attention 与 FFN 可训。为了压住累积误差并保证长程时序连贯,还设计了跨镜头打包(Cross-Shot Packing)策略,在自注意力窗口内动态聚合语义相关的镜头,而非只看相邻帧。推理时先编辑首帧,再连同编辑掩码一起驱动整条多镜头序列。 Overview of our method. Top: Given an input multi-shot video and corresponding editing masks, our method first trains a Supervisory Adapter to inject multi-shot information into the diffusion backbone. We also introduce two key strategies: Cross-Shot Packing and Sparse Cross-Attention to keep the consistency during training. Bottom: During inference, editing is performed on the first frame and produces coherent and identity-preserving multi-shot video output. 实验效果:在作者整理的多镜头视频编辑基准上,MSEditor 在身份保持、时序稳定性和整体视觉质量上显著优于既有方法。四镜头编辑的定性对比(把黄色跑车改成蝙蝠车 Tumbler)显示:TokenFlow 基本没改动,Ins2V2 出现严重色偏和结构失真,VACE 在近景轮胎镜头里编辑出了完全不同的车,Ditto 在多个镜头间外观不统一,而 MSEditor 在四个镜头(含远景、轮胎特写、逆光剪影)里保持了一致的车身形态与材质。 Qualitative comparison results with the state-of-the-art methods. We compare our multi-shot approach against leading single-shot video editing baselines on a four-shot editing task. The results show that our method successfully executes the complex subject replacement, demonstrating superior cross-shot temporal consistency. 批判点评:「拿多视角视频数据集当多镜头编辑的监督来源」是这篇最聪明的一步——它把一个数据不存在的问题,转化成一个已有数据的重新解释问题,成本几乎为零而监督信号的语义正好对上。跨镜头打包按语义相关性而非时间邻近去聚合上下文,也比简单扩窗口更贴合多镜头的结构特点。ECCV 2026 接收和港科大+百度的组合也说明这套方案经过了同行审视。但几点需要留意。第一,多视角与多镜头并不完全等价:多视角是同时刻不同机位,主体姿态与光照基本一致;真实多镜头往往跨时间、跨场景、主体状态本身在变化。用前者监督后者,在「状态确实应该变化」的镜头切换上可能反而过度约束。第二,评测基准由作者自行整理,规模与构成细节不明,「显著优于」缺少可核对的数值。第三,推理链路依赖首帧编辑质量,首帧一旦有瑕疵会被跨镜头传播机制放大到全序列,这个失效模式论文未讨论。第四,定性对比里 TokenFlow 出现「基本没改动」的结果,与 VicEdit 那篇里基线的 No Change 现象类似,都提示当前多镜头编辑的基线调用方式尚未标准化,横向对比结果需要谨慎解读。 9. AnyTalk:零动画数据给任意角色配口型 AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model | KAIST(TVCG 接收) | arXiv:2608.16143 关键词:3D语音动画,视频扩散先验,零动画数据,blendshape优化,蒸馏实时化,KAIST ⚠️ 前序问题:给 3D 角色做音频驱动的语音动画,现有方法要么依赖该角色专属的动画训练数据,要么需要费力的绑定与重拓扑。这两条路都把成本卡在了「每来一个新角色就得重做一遍」上,风格化角色尤其吃亏——它们的面部拓扑和 blendshape 配置千差万别,几乎不可能有现成动画数据。作者想问的是:既然视频扩散模型已经在海量真人说话视频上学到了强大的运动先验,能不能把这份先验直接借给任意 3D 角色,从而完全绕开动画数据这一环。 本文贡献:AnyTalk 分两步走。第一步是角色专属微调(Character-specific Fine-tuning, CsF):拿目标 3D 角色的渲染图配上置零的音频嵌入(代表「无运动」)去微调预训练视频扩散模型——用零音频教模型「这个角色静止时长什么样」,从而在不需要任何动画数据的前提下把角色外观注入模型,同时保住大规模视频扩散模型原有的运动先验。第二步是把生成的说话头视频提升回 3D:通过一个优化过程估计 blendshape 参数,得到真正可用的 3D 语音动画。架构上用 ReferenceNet 加去噪 UNet 的双塔结构,音频经交叉注意力分别产出 pose、expression、lip 三路控制信号再经 adapter 注入。为了实用性,作者还把 AnyTalk 蒸馏成一个精简网络 AnyTalk_RT,实现实时性能。代码已开源。 Finetuning process of $D_{CsF}$. The rendered images of the target 3D character and the zero condition $C_{zero}$ are used to form a pair for fine-tuning the model. To preserve the motion prior, only the spatial residual network of denoising UNet is trained (flame icon), while the other layers remain frozen. 实验效果:方法可在多样的面部网格与 blendshape 配置上生成口型同步的动画,显著降低人工投入与数据需求。定性对比在同一个风格化卡通角色上进行,逐词展示九个时间点的口型:ScanTalk、DiffSpeaker+NFR、CodeTalker+NFR 三个基线在整段发音里嘴部开合幅度都很小、近乎静止,而 AnyTalk 在 child/native/grace/beauty/attire 等词上给出了明显区分的口型(含张口、圆唇等不同形状),这在风格化角色上尤为关键,因为这类角色缺乏专属训练数据、基线只能靠迁移硬套。 Comparison with baselines on Morphy. Each phoneme and its corresponding frame are presented for comparison. Ours best follows the given audio with wider mouth opening and precise lip closure, while ScanTalk, DiffSpeaker + NFR, and CodeTalker + NFR exhibit only subtle movement. 批判点评:用「置零音频嵌入」来做外观注入而不污染运动先验,这个技巧很聪明——它等价于告诉模型「这是该角色的静态基底」,剩下的运动能力完全交还给预训练先验,从而实现零动画数据。把视频生成的 2D 结果再优化回 blendshape 参数,也让产出物真正落在图形学生产管线里可用(能改、能复用、能接绑定),而不只是一段像素视频,这一点比多数 talking-head 工作更务实。TVCG 接收和额外蒸馏出实时版本也说明工程完成度不低。不过限制很明显。第一,整条链路依赖一次角色专属微调,也就是说「任意角色」的代价是每个角色都要微调一次,虽然免了动画数据但没免掉 per-character 训练,与真正的零样本仍有距离。第二,2D 视频再反解 blendshape 会引入两层误差(视频生成本身的误差 + 参数拟合误差),细微的唇形细节容易在这个过程中被平滑掉。第三,定性对比中基线普遍表现为「几乎不动」,这更可能是基线在风格化非人角色上的固有失效,而非同等条件下的公平比较——在真人网格上的对比才更能说明方法上限。第四,蒸馏版 AnyTalk_RT 的质量损失没有在摘要层面量化,实时与保真之间的取舍不明。 10. PersonaShot:16指标测出画质与叙事的断层 PersonaShot: Benchmarking Person-Centric Narrative Continuity in Multi-Shot Video Generation | 上海交通大学、腾讯优图实验室、浙江大学 | arXiv:2608.16717 关键词:多镜头评测,叙事连续性,物理连续性,情感动态,电影语法,腾讯优图 ⚠️ 前序问题:视频生成正从单镜头片段走向多镜头叙事,而人物角色是这类叙事的核心锚点。但现有基准主要评角色外观或单镜头质量,没人去量「人物的物理状态与情绪状态在切镜之后是否还连贯」。另一个被忽略的问题是评测方法的针对性:物理连续性、面部动态、电影关系这三类判断所需的证据完全不同——一个要看视觉空间关系,一个要看时序面部变化,一个要看镜头之间的关系逻辑,用一套通用打分器同时应付三者必然失准。 本文贡献:PersonaShot 是首个以人物为中心的多镜头叙事连续性基准,含约 1000 个多镜头片段和 16 项指标,覆盖三个维度:因果物理连续性(空间布局连续性 SLC、物体状态持久性 OSP、几何尺度一致性 GSC)、情感动态(表情自然度 EN、面部动作时序连贯 FATC、情绪-叙事对齐 ENA、情绪弧连贯 EAC)、电影语法(导演叙事排序 DNS、镜头切换恰当性 ST、切换节奏对齐 TRA、180 度规则遵守 180R、视线匹配正确性 EM)。评估分三个时间层级:镜头内状态、跨镜头转换、序列级轨迹。方法上把大型多模态教师的推理蒸馏成轻量的、按指标定制的专家评估器,每个评估器只依赖其指标所需的那类证据(视觉/时序/关系),再与专家人工判断做对齐。 Overview of PersonaShot evaluation framework. Given generated multi-shot videos and prompts, PersonaShot extends conventional quality assessment with three specialist dimensions for narrative-level evaluation: causal physical continuity, affective dynamics, and cinematic grammar. 实验效果:评测揭示不同 SOTA 模型呈现出各异的能力剖面,并暴露出感知质量与跨镜头叙事连续性之间存在明显落差——视觉上很有说服力的视频,仍频繁出现物理状态重置、情绪突变和电影关系断裂。雷达图对比 Seedance、HoloCine、EchoShot 三个模型:Seedance 在物体状态、几何尺度、表情自然度、180 度规则上明显领先,HoloCine 在物理连续性维度接近但在情绪弧和视线匹配上落后,EchoShot 整体最弱且在电影语法一侧塌陷严重。失败案例图给出的典型问题包括空间布局漂移(人物与电话亭的相对位置在三个镜头间跳变)。人类研究表明作者的评估器与专家判断高度一致。 Overview of PersonaShot's person-centric evaluation. Top: Qualitative examples illustrating our three core dimensions: physical continuity, affective dynamics, and cinematic grammar. Bottom: Quantitative comparison across fine-grained metrics for specific state-of-the-arts, revealing their distinct capability profiles. 批判点评:这篇最有价值的产出是那句结论:画质好和叙事连续没有必然关系,视觉惊艳的多镜头视频依然会出现物理状态重置和越轴。这对做多镜头生成的团队是个直接警告——现有的 VBench 类指标测不出这些问题,模型在这些维度上的退化是完全隐形的。把 16 个指标按证据类型分派给不同的专家评估器,而不是用一个通用 VLM 打全部分,是方法上的正确取舍;把电影语法(180 度规则、视线匹配、切换节奏)纳入自动评测也是此前少见的尝试。不过也有几点要保留。第一,约 1000 个多镜头片段对 16 项指标来说样本偏薄,尤其电影语法这类指标本身依赖具体拍摄语境,样本不足容易让排名不稳。第二,评估器由大型多模态教师蒸馏而来,因此整套基准的判断上限被教师模型的理解能力封顶——它测不出教师本身看不懂的问题,而电影语法恰恰是当前 MLLM 较弱的一环。第三,「与专家判断高度一致」的一致性数值、标注者数量与信度系数在摘要层面缺失。第四,与同组的 VicEdit 共享大部分作者,两篇分别造基准与造方法,需要留意后续是否出现自家基准上自家方法领先的循环论证。 趋势观察 蒸馏加速的代价终于被摆到台面上 — 今天有三篇论文从不同角度谈同一件事:把大模型压成快模型,损失的到底是什么。DynaForcing 给出了最锋利的答案——DMD 自强制蒸馏里的反向 KL 天然偏向低运动模式,学生模型会收敛到一个「画面精美但几乎不动」的伪最优解,作者把这个现象命名为动态崩塌,并且用训练曲线证明它不是偶发而是系统性的:Dynamic Degree 一路掉到 0.31,而感知质量指标反倒还在涨,所以只看 FID/IQA 的评测体系根本发现不了。SparsePR 从另一头切入,指出「保留了多少注意力质量」这个常用指标并不能决定被跳过的交互带来多大的 softmax 后误差,于是干脆用少量精确行拟合一个仿射修正把残差补回来。MDD 则把加速拆成幅度和方向两个分量,发现轻量模型能可靠承担幅度、缓存能可靠提供方向。三篇的共同信号是:加速研究正在从「跑得多快」转向「快的同时到底丢了哪一维」,而这一维往往不在主流指标里。 评测正在从「像不像」转向「成不成」 — PersonaShot 和 VA-Judger 都在推同一件事:单帧或单镜头的画质分数已经不足以区分模型好坏。PersonaShot 用 16 个指标覆盖物理连续性、情感动态和电影语法三层,结论直接而尴尬——视觉上很惊艳的多镜头视频,经常出现人物物理状态在切镜后被重置、情绪突变、越轴违规,也就是说画质和叙事连续性之间存在明显断层。VA-Judger 则指出把音质、画质、同步度三个单项指标线性加权当奖励,本身就是在鼓励 reward hacking:模型学会了把每项刷高,但整体听起来看起来仍然不连贯。它的解法是训一个带思维链的 omni 奖励模型,先从质量差距明显的对子里学格式,再用拒绝采样对齐人类对难例的解释,最后做维度级 GRPO。两篇一前一后,说明生成评测的重心正在从感知保真度移向任务完成度与跨镜头一致性。 视频编辑的条件通道从文字扩到了视觉 — VicEdit 提出的判断很直白:文字讲不清细腻纹理和复杂动态。所以它把编辑指令从纯文本升级为单图、图对、视频对三种视觉参考,并配了 40 万条数据的 VicEdit-400K。MSEditor 面对的则是另一个维度的难题——多镜头视频天然由视角、机位、姿态都不连续的片段拼成,逐镜头编辑必然身份漂移。它的做法是把多视角视频数据集改造成跨镜头监督信号,再用跨镜头打包策略在自注意力窗口内聚合语义相关的镜头。两篇一起看能发现视频编辑正在同时向两个方向扩张:条件端从文本扩到视觉示例,时序端从单镜头扩到整条多镜头序列,而这两个扩张都倚赖新造的数据而非新造的架构。 人工智能炼丹君 整理 | 2026-08-21 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月21日
3 阅读
0 评论
0 点赞
2026-08-20
AIGC 每日速读|2026-08-20|LumaAI首证扩散缩放定律要10倍数据(Abra)
今日 AIGC 论文速览 今日共 10 篇 · 训练缩放与数据基建 2 篇 · 图像编辑与超高分辨率 2 篇 · 视频编辑 2 篇 · 推理加速与高效架构 2 篇 · 生成评测与诊断 2 篇 重点论文标题列表 Abra(Luma AI):每参数200token是最优配比 EditBridge(上海交通大学·阿里 Qwen·新加坡国立大学):4K图像编辑61秒完成 ⚡ GRNEdit(西安电子科技大学·小米 MiLM Plus):2B模型打赢多个14B开源编辑器 CoinVE-200K(腾讯 PCG 在线视频事业部):一条指令同时改5处的数据集 LinCa(上海交通大学·阿里云终端智能计算·西安交大):5-7倍加速下文字仍不糊 今日论文速览 1. Abra:每参数200token是最优配比 Abra: Scaling Diffusion Image Training | Luma AI | arXiv:2608.17286 关键词:扩散缩放定律,IsoFLOP拟合,每参数200token,flow-matching,Luma AI ⚠️ 前序问题:语言模型这边,缩放定律早已是训练前沿模型的标准工具——给定算力预算,模型该多大、数据该多少,Chinchilla 给出了一条能直接照着执行的曲线。但视觉生成这边一直是空白:从业者知道模型越大越好、数据越多越好,却没人能回答「我有 10^21 FLOPs,参数和数据该怎么分」这个具体问题。此前少数几篇尝试过的工作,算力预算都偏小,拟合出的指数外推到实际训练规模时误差被放大得没法用。更麻烦的是,大家默认把 LLM 的经验直接搬过来——按 Chinchilla 的每参数 20 token 配比训扩散模型,而没有人验证过这个数字在视觉域是否成立。 本文贡献:这篇把这件事系统地做完了。作者构造了 Abra——一族受控的 flow-matching transformer,参数从 60M 覆盖到 2B,训练算力横跨 10^19 到 10^22 FLOPs 三个数量级,显著超出以往工作的预算上限。在这个规模上他们得到两个核心结论。第一,扩散模型的可预测性与语言模型一样好,损失随算力呈干净的幂律,IsoFLOP 曲线的最优点连成一条直线。第二也是最有价值的:扩散的计算最优点出现在每参数约 200 个图像 token,整整是 LLM Chinchilla 处方的十倍。第三个结论是给实践者的直接建议——与 LLM 不同,扩散模型对过训练相当鲁棒,所以拿不准时应该往「更多数据」而非「更大模型」的方向偏。最后他们证明这种可预测性不止于训练损失,还延伸到生成质量指标、最优 CFG 设置、表征质量,甚至训练曲线的形状本身都能坍缩到一个通用形式上。 Text-to-image diffusion transformers follow predictable scaling laws and require ten times as much data as a comparably sized language model to reach compute optimality. 实验效果:IsoFLOP 拟合给出 TPP = 191·C^0.0010(即最优 token-per-parameter 几乎不随算力变化,稳定在 200 附近),最优参数量 N = 0.0301·C^0.4951、最优数据量 D = 3.78·C^0.5049——两个指数都极接近 0.5,说明参数与数据应当同比例增长,这一点与 Chinchilla 一致,差别只在配比常数。过训练鲁棒性的证据来自 Iso-FLOP penalty 曲线:Abra 在 TPP 从 100 一路拉到 400 的区间内,惩罚基本贴着 0.2% 以下,而数字化重建的 Chinchilla LLM 曲线在 TPP 超过 100 后惩罚就迅速爬升到 3-5%。训练曲线的通用坍缩在 60M 到 2B 六个尺寸上验证,重标定后曲线几乎重合,相对波动收敛在 1% 以内。 Iso-FLOP suboptimality penalty $(L_N - L^*)/L^*$ versus TPP for the family (left) and the Chinchilla / Hoffmann et al. data (right), the latter figure-digitized by~besiroglu2024chinchilla and binned into log-$N$ model-size bands. Markers are the measured points ( evaluated checkpoints; digitized Chinchilla points); curves interpolate through them. The green/red bands mark the $0.2\%$ penalty threshold. 批判点评:这是今天这批里信息密度最高的一篇,而且是那种一旦被验证就会改变整个领域默认做法的工作。「每参数 200 token、是 LLM 的十倍」这个数字本身就足够有价值——它意味着相当多现有的文生图模型可能都处于数据不足的状态,一直在把预算错配到参数上。IsoFLOP 的两个指数分别是 0.4951 和 0.5049,加起来几乎正好是 1,这种干净程度说明拟合质量确实高,不是硬凑出来的。「对过训练鲁棒」这条实践建议也很务实:它把一个需要精确调参的问题变成了单边保守选择,工程上极其友好。不过要清醒几点。第一,最大只训到 2B 参数,而当前前沿文生图模型早已在 10B 量级以上,外推距离仍然不短——论文自己的图里最优点已经外推到 10^23 FLOPs 处的红点,这已是纯预测而非实测。第二,「200 token per parameter」这个数字必然依赖 tokenizer/patch 配置与图像分辨率,换一个 VAE 压缩率或 patch size,token 的信息量就变了,200 这个绝对值能否跨配置迁移,是使用者最需要知道却没有明确交代的。第三,全程使用 flow-matching transformer 这一种架构,结论对 UNet 或其他扩散形式是否成立未验证。第四,Chinchilla 的对比曲线是从原论文图里数字化重建的(论文自己在图注里标注了 curves are noisier than real per-run data),这个对照的严谨性弱于自己跑的实验,而「十倍」这个最抢眼的结论恰恰建立在这个对照上。第五,Luma AI 作为商业公司发布这份研究,代码与检查点是否开放决定了社区能否独立复现这条曲线。 2. EditBridge:4K图像编辑61秒完成 EditBridge: Towards Faithful and Efficient Ultra-High-Resolution Image Editing | 上海交通大学·阿里 Qwen·新加坡国立大学 | arXiv:2608.18063 关键词:超高分辨率编辑,扩散桥,分块稀疏注意力,4K保真,上交·阿里Qwen ⚠️ 前序问题:专业修图工作流里 4K 起步是常态,但扩散编辑模型基本卡在 1K 以下——注意力的二次复杂度加上显存墙,让高分辨率直接变成不可能。业界的通行绕法是两段式:先在低分辨率上编辑,再独立跑一次超分。这个做法看似合理,实际上埋了两个坑。一是信息发散:超分模型是在「猜」细节,它猜出来的东西与原始高分辨率图里真实存在的细节经常对不上——原图眼睛是棕色,低分编辑后超分给你补出一只绿色的眼睛,且补得很自信。二是纹理退化:超分要么把纹理磨得过平,要么锐化过头产生假质感。根子在于超分环节完全看不到原始 HR 图,它只能从 LR 结果凭空重建。 本文贡献:EditBridge 的做法是重新定义这一步在做什么。传统扩散是从噪声重新生成,而这里把细化过程形式化为一次结构化的数据到数据翻译:起点是 LR 编辑结果,终点是它的 HR 对应版本,整个过程显式地以原始 HR 源图为条件。这样一来,真实细节是「继承」来的而不是「猜」来的,信息发散问题从形式上就被堵住了。但引入 HR 源图作为条件会带来新的算力问题——两张超高分辨率图之间做全交叉注意力是不现实的。为此他们设计了先验引导的分块稀疏注意力:利用第一阶段编辑过程中已经产生的语义对应关系(用注意力图取 argmax 得到位置映射 π),把跨图交互限制在空间上真正对齐的区域内。也就是说,目标图的某个 chunk 只需要去看源图中与它对应的那几个 chunk,而不是全图。注意力被拆成两条路径:Path A 是域内自注意力,Path B 是先验引导的跨 chunk 稀疏注意力。 Overview of our proposed EditBridge. The upper section illustrates the inference process of the diffusion bridge, which transports the low-resolution edit to its high-resolution counterpart. The lower section details the construction of the correspondence prior and the proposed Prior-Guided Sparse Attention (PG-BSA) mechanism. 实验效果:在最高 4K 分辨率下实现高保真编辑且感知质量占优,2K 上相比基线取得 3.6 至 8.4 倍加速,4K 编辑可在 61 秒内完成——这个数字把超高分辨率编辑从「跑不动」推进到了可交互的区间。定性对比覆盖夜景霓虹招牌上的日文字符与水面倒影等细节密集场景,在 PISA-SR、Dit4SR、DiT-SR、TSD-SR、HiFlow 五个基线中,只有本方法保住了招牌上原本的文字笔画,其余方法要么把文字糊成噪点,要么改写成完全不同的字形。 Qualitative comparison at 2K resolution. Our method better preserves fidelity while enhancing visual clarity. 批判点评:这篇最值得肯定的是问题诊断的准确性:它没有把两段式方案的毛病归咎于「超分模型不够强」,而是指出结构性缺陷——超分环节看不到 HR 源图,所以必然只能幻觉。把修正手段定位在「让它看得到」而不是「让它更强」,这个判断决定了整个方案的正确性。复用第一阶段的注意力图来构建对应先验也很省——那份注意力本来就要算,等于白捡了一份稀疏化的依据,不需要额外的匹配网络。61 秒完成 4K 编辑这个数字给得具体且可验证,比笼统说「高效」有诚意得多。但有几处要打问号。第一,整个方法建立在「第一阶段的编辑注意力能给出可靠语义对应」这个前提上,而编辑幅度大的时候——比如把物体整个替换掉——目标区域在源图里压根不存在对应物,此时 π 映射会指向什么?这类场景恰恰是编辑任务里最常见也最难的,论文的示例(换伞的颜色、加一只小船)都属于局部小改动,大幅编辑下的行为没有交代。第二,3.6 到 8.4 倍这个区间跨度很大,说明加速比高度依赖图像内容与稀疏度,最坏情况是什么没说。第三,61 秒的硬件配置未在摘要中给出,A100 上的 61 秒和 H100 上的 61 秒不是一个概念。第四,方法仍然是两段式的,第一阶段 LR 编辑本身的质量上限直接决定了最终结果——如果 LR 阶段就改错了,桥接得再忠实也只是把错误高保真地放大到 4K。 3. GRNEdit:2B模型打赢多个14B开源编辑器 GRNEdit: Efficient General Video Editing from a New Binary-Evidence Perspective in Generative Refinement Networks | 西安电子科技大学·小米 MiLM Plus | arXiv:2608.16328 关键词:通用视频编辑,二元证据视角,生成式细化网络,空指令恒等通路,小米MiLM ⚠️ 前序问题:指令式通用视频编辑想用一个统一入口覆盖各种编辑操作,但现有方案在「怎么把源视频信息喂给模型」这一步上都很重:要么挂一条独立的重型条件分支,要么把源视频直接拼接进输入序列——前者增加大量参数,后者让序列长度翻倍,两条路都很贵。更本质的问题是,这些做法都把源视频当成一团需要重新理解的原始信息,而没有利用一个关键事实:编辑的绝大部分区域其实应该原封不动地保留下来。以「保持」为默认、只标注需要改的地方,信息量本该远小于从头重新描述整个视频。 本文贡献:GRNEdit 从 GRN(生成式细化网络)用 bit 组合编码视觉语义这一特性出发,把编辑语义重新表述成对每个 bit 的「保留还是翻转」的局部二元决策。这个视角转换是全文的支点:源信息不再是需要被重新编码的内容,而是支持当前二元状态的「坐标级证据」,而 GRN 主干继续负责把这些局部决策组合成全局连贯的生成语义。第一阶段用一个紧凑编码器把离散源码翻译为连续证据信号,在二元细化过程中持续注入。他们还借鉴 classifier-free guidance 的空提示训练,赋予空条件一个编辑专属含义——空指令即「不编辑」,由源重建来监督。这条恒等通路一石二鸟:既隐式强化了证据利用与内容保持,又在同一表示空间里产生了一个「源保持态」。于是第二阶段可以把每个编辑态与它对应的源保持态直接相减,用差异去修正那些第一阶段没定下来的目标 bit——这是一个相当巧妙的自我对照机制。 Overview of GRNEdit. Given a source video and an editing instruction, Stage I injects prompt-modulated source evidence into the GRN chunks through lightweight per-chunk projectors, each containing only about 3 M parameters for GRNEdit-2B and 7 M for GRNEdit-8B. Stage II refines the binary predictions by treating source evidence as support in keep regions and as counter-evidence in edit regions. 实验效果:仅用 0.6M 训练对、不到 3% 的条件化参数,GRNEdit-2B 与 GRNEdit-8B 在 OpenVE-Bench 上分别取得 4.03 与 4.18 分。2B 版本超过多个 14B 量级的开源编辑器,8B 版本与领先开源编辑器持平。第二阶段的监督设计在框架图中量化呈现:保持区域若用源信息使 p(target) 从 0.7 升到 0.9,交叉熵从 0.36 降到 0.11 作为奖励;编辑区域若照抄源信息使 p(target) 从 0.55 掉到 0.1,交叉熵从 0.6 升到 2.3 作为强惩罚——奖惩方向被显式分开。 Qualitative comparison across diverse editing tasks. GRNEdit performs more accurate edits while better preserving unedited content, whereas competing methods often miss the intended change or disrupt scene consistency. 批判点评:0.6M 数据加不到 3% 条件参数就让 2B 打赢 14B,这个效率比是今天最亮眼的工程数字,而且它不是靠更大的模型或更多的数据换来的,纯粹来自表示方式的重新选择。把编辑重述为 bit 级的保留或翻转,本质上是给模型换了一个更贴合任务的默认动作——从「重画」变成「保持」,这个先验一旦对了,学习难度会断崖式下降。空指令即恒等这条设计尤其漂亮:它不额外增加参数,却同时提供了内容保持的监督信号和第二阶段所需的对照基准,一个设计承担三个功能。但要看清几处限制。第一,整套方法深度绑定 GRN 这种二值化表示的骨干,对主流的连续 latent DiT 并不直接适用,普适性受限——这也解释了为什么它能这么省,代价是换不了底座。第二,OpenVE-Bench 上 4.03 对 4.18 这个 2B 与 8B 的差距只有 0.15,说明模型规模在这套方法下的边际收益极低,这既可以解读为「小模型就够」,也可以解读为「方法本身触到了天花板,加参数也没用」,论文倾向前一种解读但没有排除后一种。第三,「超过多个 14B 开源编辑器」这个表述里没点名是哪些,而开源 14B 编辑器的水平参差很大,这个对照的含金量无法判断。第四,0.6M 训练对相对于视频编辑任务的复杂度其实偏少,能力覆盖边界(能做哪些编辑类型、哪些做不了)没有说明。第五,两阶段推理意味着实际延迟是单阶段的两倍以上,效率优势主要体现在参数和训练成本上而非推理速度,摘要用 Efficient 一词容易造成误读。 4. CoinVE-200K:一条指令同时改5处的数据集 CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing | 腾讯 PCG 在线视频事业部 | arXiv:2608.17566 关键词:复合指令视频编辑,数据集与基准,原子操作解耦,Wan2.1-14B,腾讯PCG ⚠️ 前序问题:指令式视频编辑的数据集这两年质量在稳步提升,但有一个共同盲区:几乎全部只覆盖单一编辑操作。而真实用户的诉求往往是复合的——「把背景换成森林,同时把她的黄裙子改成深蓝礼服,再把桌上那台搅拌机拿掉」,这是一条指令里塞了三个互相独立的编辑意图,模型必须同时理解它们、并在同一段视频里各自忠实执行且互不干扰。用只含单操作样本的数据训出来的模型,面对这种复合指令时要么只执行第一条,要么把几个操作混在一起相互污染。数据的形态直接锁死了模型的能力形态。 本文贡献:针对性地补上这块。CoinVE-200K 包含 1080p、最长 201 帧的视频编辑对,每个样本涉及 2 到 5 个原子编辑操作,作用对象覆盖人物、物体与背景,操作类型覆盖添加、移除、修改与风格化。所有样本经过一套生成加过滤的管线,从指令忠实度、视觉质量、时序一致性、复合多样性四个维度把关。配套发布 CoinVE-Bench,按主体、操作类型、指令复杂度分层评测。更进一步,他们训了 CoinVE-Edit——基于 Wan2.1-T2V-14B 与 Qwen3-VL-8B-Instruct 构建的 22B 复合视频编辑模型。这个模型的关键设计是把不同编辑指令的注意力做区域感知的解耦:每条指令经 MLLM 编码为一组可学习 token,由 Mask Predictor 预测其作用区域 M,GateNet 输出门控系数 g 决定该指令是否需要掩码约束,再通过 Q-Blending 交叉注意力按权重 w_q = 1 - βg(1-M) 融合多条指令的输出。这样每条指令只在自己的区域内生效,天然避免了多指令互相污染。 An overview of the proposed CoinVE-Edit framework. 实验效果:在 CoinVE-Bench 上,CoinVE-Edit 在指令遵循、复合编辑准确率、视觉质量与时序一致性四项上均取得强表现。定性对比展示了一条指令含 4 个操作的案例(替换搅拌碗、添加菜刀、替换台面、移除玉米粒),与 SAMA、可灵 O3、Seedance 2.0 三个对照相比,只有 CoinVE-Edit 把四个操作全部正确执行且未误改其余内容——对照方法普遍出现漏执行或连带改动无关区域的问题。 Quality comparison of compositional-instruction video editing on CoinVE-Bench. 批判点评:复合指令这个切入点选得准。单操作编辑在学术基准上已经做得相当好,但用户真实场景里很少有人只提一个要求,这中间的差距被整个领域忽略了,而它偏偏是产品化的关键一环。Q-Blending 那个门控加掩码的设计也合理:g 决定要不要约束、M 决定约束在哪,两个自由度分开,比硬性给每条指令分配固定区域灵活。1080p、201 帧、20 万对的规模在视频编辑数据集里属于第一梯队,腾讯在线视频事业部的资源背景也让这个量级可信。但几点要留意。第一,也是最关键的:数据集是「生成加过滤」构建的,那些 2-5 个操作的复合编辑对本身是用什么模型生成的?摘要没说。如果生成器本身就是现有编辑模型,那 CoinVE-200K 的质量天花板会被它锁死,而 CoinVE-Edit 训完能超过的也只是那些数据更少的模型,未必超过数据生产者。第二,CoinVE-Bench 由同一团队用同一套管线构建,与训练集共享分布,22B 模型在上面的领先有多少能迁移到真实用户指令,是个悬念——定性图里的对照模型都是在自家基准上被评的。第三,22B 的推理成本没有交代,201 帧 1080p 的复合编辑单次要多久,这直接决定它是研究原型还是可用工具。第四,「2 到 5 个原子操作」的分布如何?如果绝大多数样本是 2 个操作,那么 5 操作场景的实际支撑就很薄。第五,多指令解耦依赖 Mask Predictor 预测的区域准确,当两条指令的作用区域天然重叠时(改人物服装 + 改人物姿态),这套机制如何处理没有说明。 5. LinCa:5-7倍加速下文字仍不糊 LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching | 上海交通大学·阿里云终端智能计算·西安交大 | arXiv:2608.17973 关键词:扩散推理加速,可学习特征缓存,可逆分解重构,ECCV 2026,阿里云 ⚠️ 前序问题:扩散模型迭代采样的成本一直是落地的主要障碍,特征缓存是近年最被看好的加速路径——把某些时间步的中间特征存下来,后续步骤直接复用或外推预测,跳过昂贵的完整前向。问题在于,现有的免训练缓存方法都在用一套统一的预测策略处理所有特征。而实际上不同特征的时序动态差异极大:有些特征随时间步平滑变化,零阶复用就够;有些高频剧烈波动,必须用高阶外推才不失真。用一把尺子量所有东西,结果就是在高加速比下质量崩塌——具体表现为文字糊成一团、细结构错乱。 本文贡献:LinCa 的思路是先分解再分别对待。它引入一个轻量可逆网络,把缓存特征拆解为若干具有不同连续性的子成分,对每个成分匹配相应阶数的预测策略——平滑的用零阶(直接复用),次之用一阶,波动大的用二阶外推。可逆性在这里是关键设计而非装饰:严格可逆保证了子成分预测完后能无损重构回原始特征空间,不引入分解误差,形成一条完整的「分解-预测-重构」闭环。可逆投影用 RevNet 结构实现(可逆 1×1 卷积 + 加减耦合的 MLP 分支),前向与反向严格互逆。训练层面,他们为不同模型、不同时间步区段分别训练预测器,让方法能自适应各处不同的特征动态。整套东西是「学出来的」而非手工设计的,这是与既有免训练方法的根本区别。 实验效果:已被 ECCV 2026 接收。在 FLUX、Qwen-Image 与 HunyuanVideo 三个模型上验证,额外参数少于 0.2%,在 5 至 7 倍加速下保持接近无损的质量,显著优于既有方法。FLUX 上 5.51 倍加速的定性对比最能说明问题:提示词包含大段英文文字时,TeaCache、FORA、ToCa、DuCa、TaylorSeer 五个基线在相近加速比下文字均出现不同程度的糊化、笔画粘连或整体消失,而 LinCa 的文字与原始无加速结果几乎逐字符一致;橙子笑脸、马背上的电视机等构图元素也未出现基线中常见的物体丢失或结构错乱。 批判点评:把「统一策略」换成「按连续性分解后差异化处理」,这个思路对得很自然——特征动态本来就不均质,用一套策略是明显的欠拟合。可逆网络的选择尤其到位:如果用普通的编码器解码器做分解,重构误差会在数十个时间步里累积放大,把加速带来的收益抵消掉,而严格可逆从数学上消除了这个隐患。0.2% 参数换 5-7 倍加速的性价比很高,文字保持能力那张对比图也非常有说服力——文字是检验扩散加速方法最狠的探针,因为它对高频细节的破坏零容忍,五个基线全部翻车而 LinCa 几乎无损,这个差距不是调参能解释的。ECCV 2026 接收提供了同行评议背书。但要留意几点。第一,「学习」是双刃剑:需要为不同模型、不同时间步区段分别训练预测器,意味着换一个基座模型就要重新训一遍,而它对标的 TeaCache/TaylorSeer 等方法是完全免训练、即插即用的。0.2% 参数听起来很少,但训练流程的存在本身就是部署门槛,这个对比维度摘要没有正面回应。第二,可逆网络在每个缓存步都要跑前向与反向两次变换,这部分开销是否已计入 5-7 倍的加速统计口径,直接影响数字的诚实度。第三,三个验证模型都是 DiT 架构,对 UNet 类扩散模型是否有效未验证。第四,加速比只报到 7 倍,而基线方法在 5 倍附近就已明显退化,那么 LinCa 在 10 倍以上的表现如何、崩塌点在哪,是使用者最关心却未披露的信息。第五,「分解为不同连续性的子成分」这个划分是学出来的,缺乏可解释性——学到的成分究竟对应什么语义、划分是否稳定,论文没有做分析。 6. CapData:4.4亿图按能力依赖排课 From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation | 阿里巴巴集团 | arXiv:2608.18076 关键词:图像生成数据基建,能力驱动排课,三引擎recaption,4.4亿图池,阿里巴巴 ⚠️ 前序问题:大规模图像生成的进步很大程度上来自数据侧——扩规模、提质量、做再平衡、重新写 caption。但常规做法有个结构性问题:每个任务的数据集都是孤立优化的。文生图数据管文生图,编辑数据管编辑,知识关联数据管知识关联,各建各的、各调各的。而真实情况是,生成能力之间存在依赖关系——模型得先能把文本和图像对上,才谈得上做图像到图像的变换;得先有稳定的视觉表达,才谈得上把知识实体正确渲染出来。数据如果不按这个依赖顺序组织,就会出现「教高级技能时基础还没打牢」的低效学习,算力被浪费在模型还接不住的监督信号上。 本文贡献:提出一套能力驱动的数据基础设施,把「针对能力构造监督」与「按能力对齐排课」耦合起来。三个专门但可互操作的数据引擎分别构建互补的关系型监督:T2I 引擎负责文本-图像接地(大规模图池 + 能力检索 + 多风格双语 recaption,覆盖 short/medium/long/dense/tags/entity 六种粒度),编辑引擎负责图像间变换(基础编辑、自然关联、专家自蒸馏等多维度策展 + T2I 对齐的编辑 recaption),知识引擎负责图像-知识关联(从 Wikidata 出发,PageRank 筛选实体后检索配图)。caption 专家横跨任务与粒度对齐 T2I 与编辑监督。多阶段课程沿能力获取的依赖顺序,联合演进任务构成、视觉概念分布、数据质量与图像分辨率,并由能力感知评测闭环——把失败案例送入 Failure Pool,触发邻近数据搜索与专家自蒸馏,再由分布控制器做缺口感知的重采样,持续失败的桶提高采样权重、已解决的降低权重。规模上策展出 4.4 亿图 T2I 语料、1.2 亿编辑对、超 2700 万图像-实体对,并用它从零训练 3B 与 6B 两个规模的多模态扩散模型。 Capability-specific data construction in our framework. Shared collection and wrangling feed three specialized but interoperable engines for visual expression, editing association, and knowledge-grounded reasoning. 实验效果:在 CPI-Bench 上做定量评测,并在多样的文生图与编辑场景做定性评估,结果显示广泛的视觉覆盖、多样的渲染能力,以及跨生成能力的有效迁移——即在一种能力上的数据投入能带动相关能力的提升,这正是「协同演化」这一命题的直接证据。 Capability-gap-driven active feedback loop. Capability-aware evaluation identifies failure cases, which seed neighboring-data retrieval and expert-driven construction. Gap-aware resampling then increases the weights of persistent failures and down-weights resolved gaps in subsequent training. 批判点评:把数据工程从「造语料」提升到「设计能力依赖图并据此排课」,这个视角在当前是稀缺的。大多数数据类论文的贡献是「我造了更多更好的数据」,而这篇的核心主张是「数据之间的组织顺序本身就是一种方法」,这是不同层级的命题。那个失败池 + 缺口感知重采样的闭环尤其务实——它把评测从「训完看看多少分」变成了「持续驱动下一轮数据采集」的控制信号,让数据基建具备了自我修复能力,而不是一次性的静态产物。4.4 亿图加 1.2 亿编辑对的规模,配合从零训练 3B/6B 两个尺度,工程投入相当扎实。但几处必须打问号。第一,全文没有给出任何具体数字——CPI-Bench 上得了多少分、与哪些基线比、领先多少,摘要用「broad coverage」「versatile rendering」「effective transfer」这类形容词全部带过,这在一篇以规模和方法论为卖点的论文里是硬伤,读者无法判断这套复杂基建的实际收益。第二,「按能力依赖顺序排课」这个核心主张需要消融来支撑——如果把课程顺序打乱,性能掉多少?没有这个对照,「依赖顺序很重要」就只是一个合理但未经检验的假设。第三,CPI-Bench 疑似自建,与训练数据的关系未说明。第四,整套基建的算力成本极高(4.4 亿图的策展、两个模型从零训练),学术界基本无法复现,其价值主要体现为工业界的方法论参考而非可直接采用的技术。第五,「能力依赖顺序」是人工设定的还是数据驱动得出的?如果是前者,那这套框架的效果高度依赖设计者的先验判断,泛化到新能力时需要重新人工设计。 7. MoE-ViE:1.7倍大模型的效果76%延迟 MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding | Meta | arXiv:2608.17402 关键词:视觉编码器,细粒度MoE,免辅助损失均衡,Group GEMM,Meta ⚠️ 前序问题:视觉编码器是多模态模型的关键部件,扩容它确实能带来性能提升,但稠密扩容的代价是算力与推理延迟同步上涨。MoE 在语言模型那边已经证明是高效扩容的答案——激活参数远小于总参数,容量涨而算力不涨。但把 MoE 用到 CLIP 风格的视觉编码器上,设计空间基本没人在 SOTA 水平上系统探索过:专家该多细粒度?路由怎么平衡?稀疏化带来的 kernel 开销怎么办?视频能力怎么加而不损失图像知识?这些问题各自都有多个可能答案,而缺少系统研究意味着大家只能凭直觉照搬 LLM 的配置。 本文贡献:Meta 把这个设计空间系统扫了一遍,给出四条结论加一套模型。第一,细粒度 MoE 拓扑(更多更小的专家)相比稠密基线和标准 MoE 都有实质增益——这与 LLM 领域近年的发现一致,但在视觉编码器上是首次在 SOTA 水平确认。第二,提出免辅助损失的负载均衡变体,避免了传统 aux-loss 对主任务的干扰,同时改善专家利用率。第三,设计专用 MoE kernel(Group GEMM + kernel fusion)来抵消稀疏计算带来的推理延迟开销——这一点很实在,MoE 理论 FLOPs 低但实际延迟常常因为访存不规则而吃亏,不做 kernel 优化的 MoE 在部署时经常「省了 FLOPs 但没省时间」。第四,为了在增强视频能力的同时保住图像知识,引入帧级蒸馏配合一种新的冻结机制:视频微调阶段专家与文本侧 MLP 全部冻结,只让预训练教师对第 i 帧的表示去蒸馏学生对整段视频的表示,从而把视频能力「加」上去而不覆写已有的图像能力。 Illustration of MoE-ViE architecture and training pipeline. MoE-ViE adopts a fine-grained MoE design with optimized MoE kernels for latency reduction. We first perform contrastive pretraining on large-scale image-text pairs. During video finetuning, we introduce frame-level distillation and expert freezing to preserve the pretrained image understanding capabilities. 实验效果:跨多个尺寸预训练的 MoE-ViE 系列一致优于对应的稠密版本。最大模型在零样本性能上匹配一个 1.7 倍于它的 SOTA 编码器,而延迟只有后者的 76%。与 LLM 对齐后,MoE-ViE 在图像与视频基准上超过所有对照编码器,包括激活参数多达 5 倍的模型。ImageNet 1K 错误率随 GFLOPs 的缩放曲线显示,ViT-B/32、ViT-B/16、ViT-L/14 三个骨干的 MoE 版本(实线)在各自算力区间内均位于稠密版本(虚线)下方,且差距在算力增大后不收敛。代码已开源,论文被 ECCV 2026 接收。 MoE-ViE vs. dense models at multiple scales. MoE-ViE consistently outperforms their dense counterparts under the same compute budget. 批判点评:这是一篇标准的工业界系统性研究:不追求单点创新,而是把一个设计空间扫清楚并交付可用的模型和 kernel。价值在于确定性——它把「视觉编码器该不该上 MoE、怎么上」从猜测变成了有依据的选择。专用 kernel 那部分尤其值得称道,因为它诚实地面对了 MoE 最常被回避的问题:理论 FLOPs 的节省经常在实际延迟上兑现不了,很多 MoE 论文只报 FLOPs 而绝口不提墙钟时间。这里直接给出 76% 延迟这个端到端数字,说明作者知道读者真正关心什么。冻结机制的设计也很克制——加视频能力时把专家全冻,本质是承认「不确定改动会不会伤到图像能力,那就干脆不改」,这种保守在多模态扩展里往往是对的。但要注意几点。第一,与本项目关注的生成方向的关联是间接的:视觉编码器主要服务理解任务,对生成的价值需要经过 MLLM 这一层传导,读者不应把这里的收益直接映射到生成质量上。第二,「匹配 1.7 倍大的 SOTA 编码器」——是哪个编码器?摘要没点名,而 SOTA 这个词在视觉编码器领域可以指向差异很大的几个模型。第三,76% 延迟是在什么硬件、什么 batch size 下测的没说,MoE 的延迟优势对 batch size 极度敏感,小 batch 下专家利用率低会显著劣化。第四,「超过激活参数多 5 倍的模型」这个比较用的是激活参数而非总参数,MoE 的总参数量通常远大于激活量,从显存占用角度看这个对比对 MoE 是有利但不完整的。第五,帧级蒸馏用单帧教师去教整段视频学生,这个设定对需要跨帧推理的能力(如动作识别、时序因果)是否够用,值得怀疑——它教会的可能主要是「每帧都看懂」而非「看懂帧之间发生了什么」。 8. WildMoire:用生成模型造出去摩尔纹标注 Improving Complex Moire Removal with Generative Supervision | 哈尔滨工业大学·阿里淘天集团 | arXiv:2608.17883 关键词:摩尔纹去除,生成式监督,数据引擎,6.8K训练对,哈工大·淘天 ⚠️ 前序问题:训练去摩尔纹模型需要成对数据——同一场景的带摩尔纹版本和干净版本。麻烦在于真实世界里最难处理的那类摩尔纹恰恰最难获得配对标注:拍公共显示屏、翻拍网络图片时产生的大尺度、多彩摩尔纹,其干净原图根本无从获取,因为你没法控制那块屏幕、也拿不到原始素材。现有数据集只能在受控环境下采集,覆盖的摩尔纹形态与真实野外场景差距很大。这构成一个死结:最需要解决的场景,恰恰是最拿不到监督信号的场景。 本文贡献:既然干净图拿不到,那就造一个。作者提出一套数据引擎来生成训练监督:先收集含复杂摩尔纹的真实图像并定位其中的屏幕区域,然后部署多个图像条件的生成基础模型(SDXL、Nano Banana 2、Qwen-Image-Edit、GPT Image 2、FLUX.2 五个)各自产出候选参考图,再对候选做 patch 级的质量控制来筛选出最优结果——后处理包含空间位置与色彩对齐、patch 裁剪、预过滤、最优 GT 选择四步。用这套范式构建了 WildMoire 数据集,含 6.8K 摩尔纹-GT 训练对,分辨率 1024×1024。评测侧另外采集了约 250 对带真实干净 GT 的独立测试集——这一点很关键,它保证了评测不是自己造的数据自己评。 Overview of WildMoir'e dataset construction. We first collect real screen-captured images containing complex moir'e and localize the display regions. Five image-conditioned generative models then produce candidate GT images. The candidates are processed at matched spatial locations through spatial and color alignment, synchronized patch extraction, pre-filtering, and optimal GT selection. This offline procedure yields 6.8K moir'e-GT pairs at 1024()1024 resolution. The plots on the right summarize the improvements obtained by training ESDNet, SDXL, and Qwen-Image-Edit with constructed WildMoir'e dataset. 实验效果:在 ESDNet、SDXL、Qwen-Image-Edit 三个不同类型的模型上验证,加入 WildMoire 训练后各项指标一致提升:PSNR 分别为 23.37 对 21.50、23.56 对 21.90、23.93 对 22.23;SSIM 为 0.7821 对 0.7341、0.7887 对 0.7522、0.7851 对 0.7578;无参考指标 MUSIQ 为 44.21 对 38.20、45.07 对 41.48、58.97 对 55.33;TOPIQ 为 0.3413 对 0.2770、0.3583 对 0.3203、0.4624 对 0.4276。三个模型、四个指标全部改善,方向一致。 Comparison of qualitative results. The first example emphasizes logo and text fidelity under broad color interference, while the second contains severe mixed chromatic patterns over fine scene textures. Nano-Banana-2 is relatively content-faithful but may retain moir'e, whereas GPT-Image-2 removes artifacts aggressively while replacing scene content and producing an overly digital-image appearance. Using WildMoir'e suppresses residual bands more effectively across all 3 trainable models. 批判点评:「用生成模型造监督信号来训练修复模型」这个思路本身是有循环论证风险的——生成模型自己也会产生伪影,用它的输出当 GT,等于把它的错误当成真理教给学生。这篇之所以站得住,全靠两个设计。一是不用单个生成模型,而是让五个模型各出候选再做 patch 级筛选,把「相信某个模型」换成「相信多个模型中被质控挑出来的那部分」,显著降低了单一模型偏差的传播。二是测试集用真实采集的干净 GT 而非生成的,评测环节的可信度得到了保证——如果测试集也是生成的,整篇的结论就没有意义了。三个模型上四项指标一致改善也排除了偶然性。但要看清限制。第一,6.8K 对的规模在数据驱动的低层视觉任务里偏小,PSNR 提升 1.7-1.9 dB 虽然明确但不算大幅度,而这个提升是在测试集只有 250 对的情况下测的,统计置信区间没有报告。第二,生成的 GT 本质上是「一个合理的干净版本」而非「真正的原始内容」——摩尔纹遮住的地方生成模型是在猜,猜得好看不等于猜得正确,而 PSNR/SSIM 是在与真实 GT 比对,所以训练数据的这种「合理但不真实」的偏差会以什么形式影响模型行为,值得进一步分析。第三,五个生成模型中多个是闭源商业模型(Nano Banana 2、GPT Image 2),意味着这套数据引擎的复现需要付费 API,且模型迭代后行为会变,数据可复现性存疑。第四,摩尔纹去除是个相对小众的低层任务,方法论的普适价值(用生成模型为难以获取 GT 的任务造监督)其实比这个具体应用更值得关注,但论文没有往这个方向延伸讨论。 9. TRACE-Bench:把多参考生成拆成四个算子 TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation | 上海交通大学 | arXiv:2608.16765 关键词:多参考图像生成,评测基准,四算子分解,属性解耦绑定,上海交大 ⚠️ 前序问题:多参考图生成——给几张参考图,要求把 A 的人物、B 的服装、C 的场景组合起来——的评测基准,目前都是按预定义任务类型组织的,比如「主体组合」「风格迁移」各设一类。但多参考本质上是组合性的,任务类型的笛卡尔积会爆炸,用有限的预定义类别去覆盖必然导致三个问题:覆盖碎片化(很多组合根本没被测到)、复杂度不受控(同一类别下的样例难度可能差几倍)、诊断价值近乎为零(知道模型在「主体组合」上得 0.6,但不知道是没抓对主体、没解耦属性还是没组合好)。 本文贡献:换一个视角:不按任务分类,按能力原子分解。作者观察到各种多参考任务其实共享一组原子操作,于是形式化出四个算子——Anchor(f,锚定参考图中的某个实体)、Disentangle(g,把实体的某个属性剥离出来)、Apply(⊕,把属性施加到目标上)、Compose(C,把多个结果组合成完整场景)。任何多参考提示词都能表示为这四个算子构成的组合公式,而公式中算子槽位的数量就是它的结构复杂度——复杂度从此变成了一个可精确控制的连续量而非模糊的难易标签。基于这套形式化构建 TRACE-Bench:约 1600 个评测样例,槽位数从 1 到 8 连续覆盖,由 631 个公式模板与约 4000 张参考图生成,涵盖多种艺术风格与真实主体。公式结构直接驱动两件事:算子对齐的评测协议(对每种能力单独打分)与诊断树分析(递归定位失败发生在公式的哪一层)。 Overview of the benchmark construction pipeline. Candidate images are first collected and filtered from multiple sources, then annotated through structured tagging. The tagged pool is then balanced through source-wise sampling and augmented with synthetic data. It is subsequently used for formula-template sampling and prompt construction. 实验效果:评测 9 个领先模型后得到了整体打分完全看不见的结论:主要瓶颈在解耦(g)与属性绑定(⊕),而非场景级组合(C)——这与直觉相反,人们通常认为「把多个东西组合到一起」才是难点。即使最好的模型在属性保真度上也只有 0.74 分。实体级锚定分数随参考图实体数量增加持续下降:Nano Banana 2 与 GPT-Image 1.5 从 2 个实体时的 0.78 降到 8 个实体时的约 0.55 与 0.49,EMU 3.5 从 0.70 降到 0.36,Qwen Image Edit 2511 从 0.60 降到 0.36——所有模型无一例外,且弱模型衰减更陡。已被 ACM MM 2026 接收。 Anchor performance versus template slot count (left) and reference-image entity count (right). 批判点评:把评测从「任务分类学」重构为「能力代数」,这是这篇真正的贡献。四个算子的抽象足够简洁,又足够表达绝大多数多参考场景,而槽位数作为复杂度度量把「难度」这个模糊概念变成了可控变量——这让基准第一次能回答「模型在复杂度 N 时开始崩」这类定量问题,而不只是给一个总分。诊断树的递归失败定位设计也很自然地从公式结构里长出来,不是额外硬加的模块。「瓶颈在解耦和属性绑定而非场景组合」这个发现具有明确的研究导向价值:它告诉后续工作该往哪儿使劲,而这正是一个基准最该产出的东西。实体数从 2 涨到 8 时所有模型锚定分数单调下降的曲线也很有说服力——它揭示了一个共性缺陷而非某个模型的问题。但几点要留意。第一,1600 个样例分摊到 1-8 共八个槽位档,平均每档 200 例,再按算子类型细分后每个诊断单元的样本量会相当小,per-capability 分数的统计稳定性存疑。第二,评测靠什么打分?摘要没说评分是人工还是 VLM 自动评。如果是 VLM 评分,那么「解耦和属性绑定是瓶颈」这个结论可能部分反映的是评委 VLM 在这两项上的判别偏好,而非被测模型的真实短板——这是自动评测基准的通病,需要人工一致性验证来排除。第三,四算子分解是作者提出的一种形式化,未必唯一,其完备性(是否所有多参考任务都能被这四个算子表达)缺乏论证。第四,9 个被测模型中包含 Nano Banana 2、GPT-Image 1.5 等闭源模型,其版本会持续更新,基准结论的时效性有限。 10. HarnessEval-W:评测世界模型要给出证据链 HarnessEval-W: Agentifying the Evaluation of Visual Worlds | MirroS·清华·北大·NVIDIA·UC Berkeley·上交·南洋理工 | arXiv:2608.16859 关键词:世界模型评测,智能体化流水线,层级证据树,人类偏好对齐,NVIDIA·清华 ⚠️ 前序问题:一个基准如果只吐出一个标量分数,那么它可信与否完全取决于你信不信它——分数背后的判断依据是不透明的。这个问题在世界模型评测上格外尖锐:判断一段 rollout 好不好,需要理解物理规律有没有被违反、因果链条对不对、世界状态的演化是否自洽。人类看一眼就知道哪里不对劲,但现有基准全靠暴力计算指标,算完给个数,没有任何可供检查或核验的推理链条。于是当两个模型分数接近时,你无从判断这个接近是真实的还是指标失灵。 本文贡献:把 LLM 生态里的 harness 范式搬到世界模型评测上,做成一条智能体化的评测流水线。核心区别在于它不套用固定评分表,而是先理解每个评测案例的上下文,把评测问题分解为若干可测量的子问题,再为每个子问题派生专门的子智能体——每个子智能体带着定制的上下文与诊断工具,只负责论证自己那一小块。父智能体随后校验汇总的证据并归纳为最终判定。这个层级化流程的产物不只是一个分数,而是一棵完整的证据树,每条推理链都可回溯查验。图中示例展示了这个过程:给定「让右夹爪把托盘上方的立方体举起来」这一意图性转换案例,系统先做案例专属的技能路由(启用 Intentional Change 与 Physical Plausibility,关闭 Offscreen Evolution 与 Drift Degradation),再由子智能体分别给出带理由的评分——target specificity 1.00、final state 0.25、no extra event 0.00(因为 rollout 里凭空出现了一只人手去捡立方体),最终聚合为 0.485。 Overview of the ourmodel evaluation pipeline. Given a case with its prompt and evaluation setting, the agentic planner routes the case to applicable skills from the skill library, recording an evidence-grounded reason for every activated and skipped skill (e.g., the Offscreen Evolution Verifier is skipped because all requested actions remain visible). Each activated skill spawns sub-agents that inspect the world model rollout for specific sub-questions, such as target visibility and final state validity; here, the Intentional Change Verifier detects an unrelated human intervention picking up the cube and zeroes the no-extra-event score. The collected evidence is finally aggregated into per-dimension scores and an interpretable final score. 实验效果:在 18 个代表性世界模型、330 个评测案例上应用,判定结果与人类偏好高度对齐:技能级别上与人类 Bradley-Terry 强度的相关性达到 ρ=0.93(意图类)与 ρ=0.87(物理类),Kendall τ 分别为 0.82 与 0.74。与最接近的既有 Wbench 协议对比,在意图与事件编辑任务上准确率 0.778 对 0.602、平局率 0.111 对 0.361;在物理与因果保真任务上准确率 0.717 对 0.319、平局率 0.018 对 0.522——平局率的大幅下降尤其说明问题:旧协议在超过一半的物理类对比中给不出区分,而本方法几乎总能分出高下。全流程开源为活体基准,接受社区贡献新技能与新案例。 Human alignment of ourmodel and its comparison with WBench. (a) Model-level human alignment: each point is one of the evaluated models; we fit a linear curve for both Intentional and Physical Transition. (b) Controlled comparison with the closest WBench protocols on the same data: we report pairwise accuracy (higher is better), draw rate, and Brier score (both lower is better). 批判点评:「评测的可信度来自论证而非分数」这个立论切中了当前评测体系的软肋。当各家模型在总分上越挤越近时,一个不能解释自己为什么这么打分的基准,实际上已经失去了指导价值。把评测拆成子问题再派智能体分别论证,得到的证据树让分数变得可审计——这是从「相信基准」到「检查基准」的转变。物理类平局率从 0.522 降到 0.018 是全文最有说服力的数字:它说明旧协议在过半的物理保真对比中根本没有分辨力,而这类失效在只看准确率时是看不出来的。ρ=0.93/0.87 的人类对齐度也相当高。作者阵容横跨 MirroS、清华、北大、NVIDIA、UC Berkeley 等十余家机构,Ziwei Liu 与 Ming-Yu Liu 在列,说明这是一次有组织的社区级基建投入而非单点工作。但要审视几点。第一,评测器本身是由 LLM/VLM 智能体构成的,那么它的判断能力上限就是这些基座模型的上限——当被测世界模型的能力超过评委模型的理解能力时,这套评测会失效,而这个交叉点何时到来没有讨论。第二,智能体化评测的成本远高于计算指标:330 个案例、每个案例派生多个子智能体,单次完整评测的 token 消耗与耗时未披露,这直接决定它能否作为常规回归测试使用。第三,「与人类偏好对齐」的人类标注规模、标注者背景与一致性未在摘要中交代,而 ρ=0.93 这类数字对标注质量极度敏感。第四,技能路由决定启用哪些评测维度,路由本身出错(该查物理却没查)会导致系统性漏判,而这类错误在证据树里恰恰是看不见的——树只记录做过的检查,不记录漏掉的。第五,作为活体基准接受社区贡献,长期的版本一致性与跨时间可比性如何保证,是这类开放基准共同的治理难题。 趋势观察 扩散模型的「训练配方学」正式补齐最后一块拼图 — 语言模型有 Chinchilla,视觉生成一直没有可对照的缩放定律。今天 Luma AI 的 Abra 把 10^19 到 10^22 FLOPs 三个数量级扫了一遍,给出「每参数 200 个图像 token」这个明确数字,是 LLM 的十倍;阿里的 CapData 则从数据侧回答同一个问题——不是单纯堆量,而是按能力依赖顺序编排课程。一个说算力该怎么分,一个说数据该怎么组织,共同标志着视觉生成开始有了可预测的工程学,而不再只是炼丹。 编辑任务集体转向「别从噪声重生成」 — EditBridge 把超高分辨率编辑重新形式化为 LR→HR 的数据到数据桥接而非从噪声重生,GRNEdit 把编辑语义拆成对每个 bit 的保留还是翻转决策,两者都在做同一件事:让模型只改该改的,其余部分从源头直接继承。这与传统「条件生成」范式的区别是根本性的——前者的默认动作是保持,后者的默认动作是重画,而编辑任务真正需要的恰恰是前者。 评测正在从「打一个分」变成「定位是哪一步错了」 — TRACE-Bench 把多参考图生成拆成 Anchor/Disentangle/Apply/Compose 四个算子,用公式结构定位失败发生在哪个算子上,发现瓶颈其实在解耦与属性绑定而非场景合成;HarnessEval-W 更进一步,让子智能体各自论证再汇总,把评测变成可查验的证据树。当模型能力普遍变强、总分趋同后,可诊断性比可比较性更值钱。 人工智能炼丹君 整理 | 2026-08-20 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月20日
25 阅读
0 评论
0 点赞
2026-08-19
AIGC 每日速读|2026-08-19|阿里像素空间T2I反超潜空间Z-Image-Pixel
今日 AIGC 论文速览 今日共 10 篇 · 图片生成与编辑 4 篇 · 视频生成与加速 3 篇 · 音视频生成 2 篇 · 统一修复与智能体路由 2 篇 重点论文标题列表 Z-Image-Pixel(阿里 Token Hub·港科大·南京大学·UC San Diego):像素空间T2I首个能打的配方 SQuad(Qualcomm AI Research):注意力FLOPs降67倍且VBench不掉 Qwen-Video-Edit(Reve·UT Austin):帧排成一张大图就能改视频 PixRestore(港理工 视觉计算实验室·OPPO 研究院):50M参数无VAE一步修复 EqF(UC San Diego·Harvard):去掉噪声条件换来闭环采样 今日论文速览 1. Z-Image-Pixel:像素空间T2I首个能打的配方 An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models | 阿里 Token Hub·港科大·南京大学·UC San Diego | arXiv:2608.16887 前序问题:文生图这几年几乎被潜空间扩散垄断,原因很实在:VAE 先把 1024×1024 压成几十倍小的潜表示,注意力算力才降到可承受的范围。但这笔交易的代价一直存在——VAE 是有损压缩,高频细节、小面积结构、文字边缘都会在编解码往返中被磨掉,而且 VAE 本身还得单独训练、单独维护,成了管线里一个没人愿意碰的黑盒。像素空间扩散能绕开这一切,直接在原始像素上做去噪,此前也不断有人尝试,但研究几乎全停留在小规模或类别条件的玩具设定里。真正的问题从来不是「像素空间能不能生成图」,而是「在大规模文生图这个真实战场上,像素空间到底怎么训才能追上潜空间」——这个配方一直是空白。 本文贡献:这篇给出了那份缺失的配方。作者先做了一个关键的负面观察并把它坐实:直接在像素空间做大规模预训练,收敛速度显著慢于潜空间——这不是调参不到位,而是像素空间预训练的固有劣势。既然如此,就不要硬碰硬。他们提出 latent-to-pixel 策略:先在潜空间高效地把生成先验学到手,再在后训练阶段迁移到像素空间。真正的贡献密度在于对这次「迁移」做了系统性的设计空间扫描,逐项确定了五个关键选择——权重初始化怎么做、数据配比怎么调、预测目标选什么、解码器架构如何设计、噪声调度如何安排。最终固化出一套可复现的实践配方,并放出 Z-Image-Pixel 模型。这是一篇典型的「把方向从可行推到可用」的工程实证工作。 Qualitative samples over training iterations. The latent space model consistently demonstrates faster image structure learning and superior final image quality in pre-training progress. 实验效果:按该配方训出的像素空间模型,在质量上匹配或超过对应的潜空间同行,同时端到端推理速度提升 3.18 至 4.75 倍——去掉 VAE 编解码环节的收益在这里被兑现成了实打实的吞吐。收敛性对比图显示,纯像素空间预训练在 GenEval 上到 150K 步仍停在 0.54 附近,而潜空间 50K 步就已达到 0.73 并趋于饱和,两条曲线的差距直观解释了为什么必须先借潜空间起步。 Evaluation curves over training steps. The model trained in the latent space consistently achieve superior results (measured by GenEval~geneval and DPG~dpg) and faster convergence compared to those trained in the pixel space. 批判点评:这类经验性研究的价值往往被低估。它没有提出新架构、新损失,但把一个「大家都觉得应该可行、却没人跑通」的方向变成了可落地的配方,而且诚实地把负面结果——像素空间直接预训练更慢——放在了论证链条的开头,这比藏起来只报好消息的做法可信得多。3.18 到 4.75 倍这个加速区间也给得克制,说明作者知道加速比依赖分辨率和采样步数配置。不过要清醒看待几点。第一,latent-to-pixel 意味着它并没有真正摆脱 VAE,只是把 VAE 从推理期挪到了训练期——你仍然需要一个训好的潜空间模型作为起点,声称的「无 VAE」只在部署侧成立,训练侧的依赖链其实变长了。第二,「匹配或超过潜空间同行」这个表述里的「匹配」占多大比重、在哪些指标上真正超过,摘要没有拆开,而 GenEval/DPG 这类指标对细节保真其实不敏感——恰恰是像素空间最该发力的地方缺少针对性证据。第三,五个设计维度的扫描是在什么规模下做的没有说明,小规模上得出的最优选择在更大模型上是否还成立,是这类经验配方的通病。第四,作者团队来自阿里 Token Hub,模型命名 Z-Image-Pixel 暗示其属于 Z-Image 系列,是否会开放权重和完整训练细节,决定了这份配方的实际社区价值——配方类论文如果不放代码,复现门槛会高得离谱。 2. SQuad:注意力FLOPs降67倍且VBench不掉 SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation | Qualcomm AI Research | arXiv:2608.16585 前序问题:视频 DiT 的算力几乎全被自注意力吃掉,而它的成本随 latent token 数 n 呈 O(n²) 增长。视频的 token 数天生就大——Wan 2.2 5B 在 81 帧 704×1280 下 n 就到 18480——于是这一项直接主导了运行时与显存,成为分辨率和时长的硬天花板。学界的常规解法是把满 softmax 的 QK^T 换成更便宜的核:线性注意力 O(n) 或低秩近似 O(nk)。这些替身确实便宜,但几乎从没真正恢复原始注意力的表达力,留下一道顽固的质量鸿沟。问题的本质是效率与表达力之间的取舍被推到了极端——要么二次成本,要么掉点。 本文贡献:SQuad 选了取舍曲线上一个被忽略的中间点:O(n√n)。做法是把注意力拆成两段——先在局部窗口内做精细注意力,再以窗口为单位做全局注意力,两段复合出 n√n 的复杂度,天然平衡效率与表达力。更务实的是训练路径:从零训一个自己的视频 DiT 成本高到不现实,所以他们直接把预训练的满 softmax DiT 蒸馏成 SQuad-Attention 版本,分两阶段进行——先做 Flow-Matching 有监督微调对齐行为,再用改进的分布匹配蒸馏 DMD2,后者额外让采样本身也变少步。也就是说这套方法同时压了单步成本和总步数两个乘数。 % attention. Left: full softmax Self-Attention at $\mathcal{O}(n^2)$ complexity. Right: factorizes it into a local pass within $\mathcal{O}(\sqrt{n})$ windows followed by a global pass across the windows, giving a full receptive field at $\mathcal{O}(n\sqrt{n})$ complexity with a true softmax throughout.% 实验效果:在 Wan 2.2 5B 文生视频上,SQuad 的 VBench 达到 83.20,二次复杂度教师为 83.08——质量基本持平甚至略优。同时每步每块的注意力 FLOPs 降低约 67 倍,注意力延迟同步大幅下降。FLOPs 缩放曲线在三个模型规模上都做了验证:Wan 2.2 5B(n=18480)从 4.2 降到 0.063 TFLOPs/block 即 67 倍,Wan 2.1 1.3B(n=32760)为 90 倍,Wan 2.1 14B 为 88 倍,且实测点与理论 O(n√n) 曲线吻合良好——说明这个复杂度改善不是纸面推导,且在 1.3B 到 14B 的规模区间内稳定成立。 Wan 2.2 5B 批判点评:这是今天这批里工程收益最锋利的一篇。67 倍注意力 FLOPs 削减配合 VBench 不掉分,而且理论复杂度和实测曲线对得上,说服力比单纯报几个基准数字强得多。局部加全局的两段结构也不新奇——Swin 那一脉早有类似思路——但把它作为蒸馏目标而不是从头训练的架构,这个选择很关键:它让方法能直接嫁接到已有的强基座上,这才是工业界真正用得上的形态。不过 67 倍需要精确解读:这是「每步每块注意力」这一层的削减,不等于端到端加速 67 倍。DiT 里还有 FFN、cross-attention、归一化和 VAE 解码,注意力占比再高也不是 100%,Amdahl 定律在这里毫不留情——摘要给的注意力延迟改善才是更接近真相的数字,而端到端墙钟时间完全没披露,这是最该补的一格。其次值得肯定的是 FLOPs 缩放在 1.3B/5B/14B 三个规模上都验证了(分别为 90×/67×/88×),削减倍率没有随规模崩塌,这比只测单一规模有说服力;但质量侧的 VBench 只在 5B 上报了一个数,14B 上蒸馏后是否同样不掉分并没有交代——FLOPs 省得下来不等于质量守得住,这两件事需要分别举证。第三,VBench 对长程时序一致性和复杂运动的分辨力有限,而局部窗口注意力最可能损伤的恰恰是跨远帧的关联,只报 VBench 总分难以排除这类退化。最后 DMD2 蒸馏本身会带来多样性收缩的已知副作用,论文把它与注意力替换打包在一起评估,两者各自的贡献和代价被混在了一个数字里。 3. Qwen-Video-Edit:帧排成一张大图就能改视频 Qwen-Video-Edit: Instruction-Based Video Editing by Repurposing an Image Editing Model | Reve·UT Austin | arXiv:2608.14790 前序问题:指令式视频编辑的主流做法是拿视频预训练的生成基座开刀:找一个视频 DiT,让它同时条件于源视频和编辑指令,然后花很大代价适配。这条路的成本结构很不友好——视频基座本身训练昂贵,适配又要构造视频编辑三元组数据,而高质量视频编辑数据的稀缺程度远超图像。于是整个方向被卡在「数据不够、算力不够」的双重瓶颈里,而同期图像编辑模型早已相当强大。一个自然但少有人认真验证的问题是:能不能不要视频基座,直接让图像编辑模型去改视频? 本文贡献:作者证明这条捷径真的走得通,而且用一串「零训练观察」把设计逻辑铺得很干净。核心操作是把 Wan 2.1 视频 VAE 的 latent 帧当成一张大虚拟图像的若干 tile 平铺,然后对每个 tile 复用图像编辑器原有的位置编码——也就是说,从模型视角看这压根不是视频,就是一张它早就熟悉的拼贴图。两个 latent 空间之间用一对轻量输入输出投影桥接,且这对投影从编辑器自己的 patchify/unpatchify 层热启动,使得初始化时一段静态视频被嵌入的方式与一张图像完全一致。整体在公开的 Ditto-1M 编辑三元组上微调,再可选地用 Wan 2.2 跑几步去噪作为时序增强器。支撑这套设计的观察链很有说服力:原装图像编辑器已经能编辑以联络表形式呈现的视频;它不在乎 token 来自一次联合编码还是逐帧编码后在 latent 空间缝合;它甚至能零样本编辑真实视频 latent 到明显可辨识的程度——微调要补的只剩保真度那一段。 Overview. Video latent frames are embedded as tiles of a virtual image grid and edited by the image editing transformer; only the two projections (warm-started from the editor's own patchify/unpatchify layers) and the transformer weights (LoRA or full) are trained. 实验效果:从 Qwen-Image-Edit 出发,无需任何视频生成预训练即可完成指令式视频编辑。流程图显示除 In-Proj 与 Out-Proj 两个轻量投影和 DiT 本体外,Wan 2.1 VAE 编解码与 Wan 2.2 增强器全程冻结,可训练部分被压到极小。定性结果覆盖全局风格迁移与局部主体替换等任务,人物换成机器人这类大幅编辑仍保持了动作与场景的连贯。 批判点评:这篇最漂亮的地方不是结果而是论证方式:那条零训练观察链把「为什么这样可行」讲成了一个可验证的递进过程,而不是先做完再编故事。把视频摊成联络表这个操作听起来近乎取巧,但作者恰恰用它揭示了一个有意思的事实——强图像编辑模型内部已经隐含了相当程度的跨帧一致性能力,只是从没被这样调用过。投影层从 patchify 热启动的设计也很讲究,保证了初始化即合理。但取巧的代价必须点明。第一,把帧铺成 tile 意味着帧间关系只能靠二维位置编码隐式表达,模型没有任何显式的时间轴概念,短片段可能侥幸过关,帧数一多、运动一快,这种隐式关联大概率崩塌——而 tile 数量还直接受图像编辑器分辨率上限约束,这是个硬天花板,摘要没说能处理多少帧。第二,需要 Wan 2.2 做「可选时序增强」这件事本身就是自证:如果时序一致性真的够好,为什么还要额外几步去噪来补?这个「可选」组件在多少比例的案例里其实是必需的,是关键信息。第三,训练数据是公开的 Ditto-1M,编辑类型分布决定了能力边界,超出分布的指令表现如何未知。第四,全文只报了定性结果和「结果表明」,没有与专门视频编辑模型的定量对比——考虑到这是一份 report 而非完整论文,可以理解,但也意味着现在还无法判断它离 SOTA 有多远。 4. PixRestore:50M参数无VAE一步修复 PixRestore: Unified Image Restoration via Pixel Diffusion Transformer | 港理工 视觉计算实验室·OPPO 研究院 | arXiv:2608.16793 前序问题:统一图像修复想用一个模型处理各种退化——模糊、噪声、低分辨率、压缩失真等——从低质图恢复高质内容。近来主流做法是挪用大型预训练文生图潜扩散模型,借它的容量和生成先验。但这条路有两处结构性别扭。一是潜扩散里的 VAE 会丢掉对修复最敏感的细节——修复任务的评判标准恰恰是细节保真,而 VAE 的有损压缩正好打在痛点上。二是文生图先验是开放式合成的,它倾向于「编」出看起来合理但与原图内容不符的东西,在修复语境下这就是伪影。换句话说,借来的能力和任务的要求存在方向性冲突。 本文贡献:PixRestore 索性不借了:一个无 VAE 的像素空间 DiT,扩散骨干完全从零训练,不依赖任何文生图预训练。它直接在 patch 化的像素上做 flow matching,既保住细粒度细节,又把 token 序列长度控制在可处理范围。为适配不同退化类型,模型学会用低质与高质图的 DINO 特征相似度来预测各层特征的可靠性:可靠层的特征被融合为稠密条件注入,不可靠层则接受更强的高质特征监督以促使其学会去除退化——这是个挺聪明的自适应机制,让同一套参数能对不同退化做出不同的内部路由。训练用大规模多场景多退化语料,最后再用基于 DINO 的对抗目标把它微调成一步生成器。 Overview of PixRestore. A frozen vision encoder extracts multi-layer features from the LQ image, and an adaptive layer router predicts per-layer weights to fuse them into a single conditioning feature. The LQ image and the noisy state $x_t$ are patchified, then processed by $N$ DiT blocks, and finally decoded into the HQ output. 实验效果:仅约 50M 参数,在公开基准与真实世界测试集上取得有竞争力的结果,且推理为一步生成,效率优势明显。框架图显示 LQ 图像经 Vision Encoder 提取多层特征后由 Adaptive Layer Router 产生逐层权重,门控加权求和为 Fused Feature,再通过 Pixel DiT 的 cross-attention 注入——整条路径无 VAE 参与。 PixRestore achieves the best overall performance in terms of restoration quality, model size, and inference speed. Top-left: radar charts comparing PSNR, LPIPS, and degradation removal performance across eight degradation types. Top-right: GFLOPs versus inference latency, where the bubble size denotes the number of parameters. Bottom: visual comparisons on eight restoration tasks. With only about 50M parameters and single-step inference, PixRestore achieves the best overall restoration quality while being the most efficient among diffusion-based methods. 批判点评:50M 参数加一步推理这个组合在修复领域相当有竞争力,尤其对照那些动辄搬 SD 全量权重的方案,参数量差了两个数量级。用 DINO 特征相似度来判定层可靠性是这篇最有想法的设计:它把「哪些层可信」从人工先验变成了数据驱动的预测,而且 DINO 特征对退化的敏感度确实适合做这个裁判。从零训练而非微调 T2I 的选择也自洽——既然认定 T2I 先验方向不对,就不该半信半疑地用。但几处需要留意。第一,从零训练意味着放弃了大模型先验带来的语义理解能力,在极端退化、需要「猜」出内容的场景下,50M 从零模型很可能力不从心——摘要只说「有竞争力」而非超越,这个措辞值得注意。第二,一步生成器是用对抗目标蒸出来的,GAN 训练的稳定性和模式覆盖问题不会因为换成 DINO 判别器就消失,对分布外退化的鲁棒性存疑。第三,「大规模多场景多退化语料」是自建的,覆盖哪些退化、按什么比例混合,直接决定了泛化边界,而这恰恰是统一修复模型最容易过拟合评测集的地方。第四,团队来自港理工与 OPPO,考虑到 50M 和一步推理的组合,这个模型的真实目标场景大概是手机端 ISP 后处理,那么就该给出移动端实测延迟——公开基准上的 GFLOPs 说明不了端侧的真实表现。 5. EqF:去掉噪声条件换来闭环采样 Equilibrium Forcing: Adaptive Video Generation Without Noise Conditioning | UC San Diego·Harvard | arXiv:2608.14706 前序问题:基于扩散和 flow matching 的自回归视频生成,有两个被当作理所当然的设定:训练目标是刚性的,采样调度是静态的。模型在训练时被告知当前噪声水平是多少,推理时则按一张预先排好的时间表逐步去噪。这套组合的后果是推理过程完全无法根据数据本身做调整——不管当前这一帧生成得好还是烂,采样器都按同一张表往下走。对自回归视频生成来说这尤其致命,因为误差会沿时间轴累积,而一个不会看反馈的采样器没有任何自我纠正的机会。 本文贡献:EqF 的切入点相当反直觉:把噪声水平条件整个去掉。作者提出一个简化框架,让视频去噪生成模型不再接收噪声水平作为输入,从而把「学习去噪场」和「如何采样」这两件事彻底解耦。这个解耦是关键——一旦模型不再绑定于特定噪声水平,推理时就可以自由设计算法,包括闭环运行:根据当前样本反馈动态调整后续采样行为,而不是照表执行。作者还给出了较为深入的分析,解释移除噪声条件为何能让模型获得数据相关的推理性质,并进而超过标准的噪声条件方法。图 1 把这件事讲得很清楚:训练得到的均衡传输去噪场乘上一个推理期的 attractor warp η,共同诱导出最终的采样地形——去噪场与采样调度在数学形式上被分成了两个可独立操作的因子。 Equilibrium Forcing Overview. is trained with a simple unmodulated equilibrium denoising objective (left), which can be shaped at inference time through the $\eta$ warp (middle). The sampling landscape here is shaped to be an attractor, with the magnitude decreasing as the sample descends and converges (right). 实验效果:在有挑战性的自回归视频生成基准上提升了视频质量与一致性。固定算力缩放实验显示,EqF 配合 NAG 采样在 100 步时 FVD 已降至约 74,250 步时进一步降到 60 以下,而标准 flow matching 从 50 步到 250 步始终在 102 至 122 区间徘徊几乎不随算力改善——说明闭环采样确实把额外算力换成了质量,而静态调度做不到这一点。 批判点评:这篇的价值在于挑战了一个几乎没人质疑过的默认设定。噪声水平条件从 DDPM 起就是标配,大家默认它是必需的,EqF 反过来论证它其实是一种约束——因为它把去噪场和采样调度绑死了,而解绑后能换来推理期自适应。图 1 那个「去噪场 × attractor warp = 采样地形」的分解也把抽象主张落成了可理解的几何图像。固定算力缩放曲线是全文最有力的证据:FM 的曲线几乎水平,意味着多给算力也白给,而 EqF 能持续下降,这个对比比任何单点 FVD 数字都更能说明问题。但要保持警惕。第一,摘要通篇没有具体的基线名称、数据集名称和绝对指标,只说「有挑战性的基准」和「超过标准方法」,这种表述在视频生成领域的可比性极低——FVD 对分辨率、帧数、特征提取器都极度敏感,脱离配置的数字无法横向对照。第二,最好的曲线来自 EqF+NAG 组合,而 NAG 是额外的采样技巧,那么增益中有多少来自「去掉噪声条件」这个核心主张、多少来自 NAG,图里 EqM 系列的存在暗示做了消融,但摘要没给结论。第三,闭环采样意味着推理时要评估反馈信号,这必然带来额外计算,而「固定算力」的口径是按采样步数还是按实际 FLOPs 对齐,直接影响结论成立与否。第四,去掉噪声条件对训练稳定性和收敛速度的影响未提,这类架构级简化往往在别处付出代价。第五,方法在视频上验证,是否迁移到图像生成没说——如果这个洞察真的普适,图像上应该更容易验证,没做反而值得琢磨。 6. ConceptEdit:1200万编辑对与稠密监督 Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision | 上海交通大学·蚂蚁集团 | arXiv:2608.16812 前序问题:现有图像编辑框架基本沿用文生图扩散模型的训练范式,但把这套范式挪到编辑任务上会暴露两处内在错配。第一是对编辑概念的粒度关注不足——文生图关心的是「画出什么」,编辑关心的是「精确改动什么而不动其余」,后者需要远为细致的概念划分,而现有数据集的标签粒度远远不够。第二是监督信号过于稀疏导致训练低效:一对图像通常只承载一个编辑操作,模型每看一对样本只学到一件事,样本效率极低。这两个问题叠加,使得编辑模型的能力增长严重受制于数据的组织方式而非模型容量。 本文贡献:两条线同时发力。数据侧建立了一套超过 1000 个细粒度编辑概念的分层分类体系,并基于改进的合成框架构建 ConceptEdit-12M,一千二百万高质量编辑对。这里的关键设计是「库驱动」——先有概念库再据此合成,从而有效纠正了生成数据常见的分布坍缩问题,同时保住数据保真度;这是合成数据工作最容易翻车的地方,作者显然意识到了。训练侧提出稠密监督策略:把多个互不干扰的编辑概念合成到单对图像里,让一次前向承载多个学习信号,从而同时提升训练效率与最终性能。此外还发布 ConceptEdit-Bench,一个细粒度评测套件,用于诊断模型在大量真实场景下的能力分布。四阶段流程图显示,概念库构建后由 VLM 生成指令与 VQA 检查清单,经 Flux.2 / Qwen-Image-Edit / Nano Banana2 等多模型执行编辑,最后由 VLM 结合思维链做通过、重写或拒绝的三态判决。 Overview of the improved synthesis framework. Stage 1: Library Construction leveraging LLM world knowledge. Stage 2: Semantic Matching and Instruction Generation including VQA checklists. Stage 3: Image Synthesis using various editing models. Stage 4: Instance Specific Verification using VQA. 实验效果:训练结果显著超越先前工作,验证了稠密监督策略的有效性。配套的 ConceptEdit-Bench 支持按概念维度做细粒度诊断,而非只给一个整体分数。 (a) Edit Concept Scaling. Left: The previous paradigm is restricted by coarse categories and limited diversity. Right: Our approach scales up to 1,000+ fine-grained concepts to ensure a balanced and rich distribution. (b) Dense Supervision. Left: Conventional training relies on single edit pairs with sparse supervision signals. Right: Our composite edit strategy provides dense supervision, enhancing training efficiency. 批判点评:这是一篇典型的「数据即方法」论文,而且把数据工程做得比多数同类扎实。1000+ 概念的分层体系加 1200 万编辑对,规模上足以改变下游模型的能力上限;四阶段管线里那个 VQA 检查清单 + 思维链判决的设计尤其值得学——它把「这次编辑成功了吗」拆成若干可验证的具体问题(文字是否清晰、眼睑是否变形、脸型是否保持),而不是笼统打分,这才是合成数据质量能立住的原因。稠密监督的思路也很直接有效:既然一对图只学一件事太浪费,那就塞进多个互不干扰的概念,本质是在提升每单位算力的信息密度。但要打几个问号。第一,全部数据由 Flux.2、Qwen-Image-Edit、Nano Banana2 等现成模型生成,这意味着 ConceptEdit-12M 的能力天花板被这些教师模型锁定——学生能学到的编辑质量原则上不会超过教师,「显著超越先前工作」更可能是超越了那些数据更少的工作,而非超越数据生产者本身。第二,「互不干扰」的判定标准是什么没有说明,编辑概念之间的干扰往往是隐性的(改表情可能牵动脸型),判定不严会引入标签噪声,而这种噪声在稠密监督下会被放大。第三,评测基准由数据生产方自己发布,与训练数据共享概念体系和合成管线,同分布优势难以排除——ConceptEdit-Bench 上的领先有多少能迁移到真实用户指令上是个悬念。第四,摘要只说「显著超越」,没有任何具体数字或基线名称,这在一篇以规模为核心卖点的论文里偏弱。第五,12M 数据的合成算力成本未披露,而这直接决定了这条路径是否可被社区复现。 7. SyncSparse:稀疏化不能牺牲音画同步 Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention | 上海交通大学·阿里 Token Hub·阿里云 | arXiv:2608.15522 前序问题:音视频联合生成模型能在统一扩散过程里同时合成同步的画面与声音,但推理开销一直很高——长视频 token 序列要在每个去噪步反复算注意力。视频生成领域已经积累了不少加速手段:低比特量化、注意力稀疏化、特征缓存。麻烦在于这些方法都是为纯视频模型设计的,直接搬到音视频模型上会忽略音频与视频两个分支之间的交互,进而破坏音画同步——而同步性恰恰是音视频生成的核心价值,画面再清晰、声音再干净,只要唇形和语音对不上,整个结果就废了。这是一个典型的「加速方法对模态盲视」的问题。 本文贡献:作者的关键观察是:双向音视频交叉注意力揭示了两个分支之间的结构化交互模式,高响应往往集中在少数与声音相关的视觉与时间位置上。也就是说,同步性并非均匀分布在所有 token 上,而是由一小撮关键 token 承载。据此提出受保护的稀疏注意力策略——对同步关键的 token 保留高保真的完整计算,只对冗余的注意力部分做稀疏化。整套框架是同步感知的:通过在加速过程中显式考虑跨模态依赖,在提效的同时守住音画对齐。框架图显示五步流水线:双流输入、交叉注意力显著性计算、Top-k 音频 query 保护性选择、受保护稀疏注意力、以及同步感知指示器,后者用 Δ_sync = max(Δ_v, Δ_a, λ_pΔ_p, λ_sΔ_s) 决定当前时间步是复用缓存还是重新计算。 Overview of the proposed synchronization-aware acceleration framework. Cross-modal interactions between audio and video branches are used to guide protected sparse attention and cache reuse. 实验效果:在提升推理效率的同时保持了视频质量、音频质量与音画同步三项指标。缓存策略图显示去噪时间步被自适应地划分为 Cached、Reused (Skip) 与 Recompute (Update) 三类,仅在同步信号变化剧烈时才触发重算。 Qualitative comparison of dense inference, unprotected acceleration, and our protected acceleration. The protected computation path better preserves salient visual structures and reduces local artifacts under acceleration. 批判点评:这篇的问题意识比方法本身更值得称道:它指出了一个正在发生但少有人明说的隐患——加速方法的迁移往往是模态盲视的,在纯视频上验证过的稀疏化和缓存策略被直接用到音视频模型上,而评测指标里如果没有同步性这一项,退化会完全隐形。「同步性集中在少数 token 上」这个观察也很自然地导出了保护式稀疏化,逻辑闭环。Δ_sync 取四路信号最大值的设计偏保守但合理——宁可多算几步也不冒同步崩掉的风险。不过整份摘要在效果层面几乎是零信息量:只说「提升效率」「保持质量」,没有任何加速倍率、没有基线名称、没有具体指标数值,这在一篇以效率为核心卖点的论文里是硬伤——读者无法判断它是快了 1.5 倍还是 5 倍,而这个区间决定了方法有没有实用价值。其次,Top-k 保护的 k 如何选择、保护比例与加速比之间的权衡曲线长什么样,是这类方法最核心的超参问题,摘要完全没碰。第三,方法建立在「能拿到双向交叉注意力图」的前提上,这对某些架构(如把音频当额外 token 拼进同一序列做自注意力的设计)并不成立,适用范围有限制。第四,摘要文本里出现了多处 this http URL 的替换残留,说明投稿时的自动化处理出了问题,虽然不影响技术内容,但反映出打磨程度。第五,与 SQuad 那种把加速做成蒸馏目标的思路相比,这里仍是训练无关的推理期启发式,上限受限于原模型。 8. GenRouter:按需路由省95%执行成本 GenRouter: Unified Workflow Routing for Agentic Image Generation | 港科大(广州)·港中文·Google DeepMind | arXiv:2608.16721 前序问题:文生图模型已经基本解决了原始像素合成这个基础难题,社区注意力转向如何满足越来越复杂的用户请求。为此出现了各种智能体式图像生成工作流,给静态推理加上外部知识检索、迭代推理等高级能力。但这些工作流大多各自为政,采用固定的一刀切拓扑——不管请求是「画一只猫」还是「按照这三张参考图合成一个符合物理规律的复杂场景」,都走同一条重型管线。结果是严重的算力错配:简单查询被强行推过昂贵的流水线,成本和延迟全花在不需要的环节上。 本文贡献:GenRouter 是第一个统一的智能体图像生成工作流路由框架。第一步是 GenCanvas,把各种异构的智能体管线标准化为一组通用基础原语和可执行模板——rewrite、decompose、search、reason、skill、verify、refine、sketch 等,这一步的意义在于把「不同工作流」变成「同一空间里的不同组合」,否则路由无从谈起。在这个统一空间上,GenRouter 通过三个机制把异构 prompt 自适应地路由到最优工作流:需求画像分析请求特征,经验匹配复用历史轨迹,帕累托过滤在质量、成本、延迟等多目标间取舍。系统还能通过累积经验持续自我演化。框架图显示 prompt 先被编码为雷达图形式的 Task Signature,经 Trajectory Memory 与 Route Memory 双记忆匹配后,在帕累托平面上按质量-成本-延迟三轴筛出最终路由。 Overview of our proposed (Left) and (Right) . 实验效果:在多个基准上取得更优的视觉对齐,同时相比重型静态管线降低执行成本超过 95%、延迟降低 65%。系统还能通过累积经验实现零样本泛化能力的持续提升。 Qualitative comparison. Left side shows cost (scaled by $0.01$); right side shows latency. 批判点评:这篇抓住的痛点很真实:智能体式生成的成本失控问题在实际部署里比论文里严重得多,而「所有请求走同一条重型管线」几乎是当前所有 agentic 图像生成工作的默认形态。GenCanvas 那层标准化抽象是全文最有价值的部分——把异构管线归约到统一原语空间,路由才有了数学基础,这个工程判断是对的。帕累托过滤而非单目标优化也符合真实场景,因为质量、成本、延迟的权衡本来就该交给使用方而不是硬编码。95% 成本削减听起来夸张,但如果基线真是无差别走重型管线,这个数字反而说明了原方案有多浪费——它衡量的是「浪费被消除了多少」而非「效率被提升了多少」。也正因如此,这个数字高度依赖测试集里简单请求的占比:如果基准里大部分是简单 prompt,95% 几乎是自动达成的,而真实流量分布未必如此,论文应当给出按请求复杂度分层的成本曲线。第二,路由器本身也要跑推理——需求画像、经验匹配、帕累托过滤都不免费,这部分开销是否计入了「执行成本」的统计口径,直接影响结论的诚实度。第三,「自我演化」依赖经验累积,冷启动阶段的表现和收敛所需的请求量没有交代,而这决定了它在新部署环境里多久才能变得有用。第四,路由错误的代价不对称——把复杂请求误路由到轻量工作流会直接产出劣质结果,摘要说「更优的视觉对齐」,但没给误路由率,这才是用户实际会感知到的风险。 9. StructFlow:让噪声也带上空间结构 Spatially-Grounded Flow Matching: Structured Source Distributions for Image Generation | 马里兰大学·Netflix | arXiv:2608.15452 前序问题:当前 flow matching 模型学的是把源分布——独立同分布的高斯噪声——传输到自然图像的目标分布。但这个源分布完全不含任何空间结构的概念,而图像本质上是局部相关的:邻近像素强相关。作者的假设很有意思:正因为噪声是独立采样的,模型在训练时被隐式地鼓励去利用「噪声较小的邻居」作为上下文,从而部分绕开了真正学习图像局部结构这件事。换句话说,源分布的设计与图像域的归纳偏置是相互对抗的——我们给了模型一个走捷径的机会,它就不会好好学结构。 本文贡献:StructFlow 把空间局部性直接编码进源分布:让一个小区域内的像素共享一个公共噪声成分。这个改动很轻,但改变了传输路径的几何性质——路径变得与图像区域在几何上对齐,从而带来通用 flow matching 难以提供的三个性质:天然尊重边界的细粒度局部编辑、稳健的结构保持、以及图像之间平滑的语义插值。作者还证明这些好处能延伸到大型预训练模型上,通过一个轻量的后训练阶段即可植入,不必从零重训。噪声构造图清楚展示了机制:图像先被划分为超像素,每个超像素分配一个 anchor 分量,区域内部再叠加噪声,最终得到的相关噪声在去噪轨迹上使得结构从早期就开始显现,而标准 flow matching 的不相关噪声则要到很晚才浮现结构。 modelname Noise Construction. introduces locality in the source distribution sampling instead of i.i.d gaussian sampling in normal flow matching. % 实验效果:在多个数据集上、无条件、类别条件与文本条件三种设定下、使用不同架构验证有效。类别条件 ImageNet 256×256 上 FID 从 18.50 改善到 17.24、sFID 从 14.04 改善到 10.03;但无条件 FFHQ 256×256 上 Precision 从 0.250 提升到 0.350、ImgReward 从 0.500 提升到 0.720 的同时,FID 反而从 22.68 退到 25.80、Recall 从 0.200 掉到 0.160。结构保持实验显示,给定同一组超像素划分、更换随机种子时,生成结果的构图与主体轮廓保持一致而颜色、材质、身份等属性自由变化——说明超像素划分确实成了一个可控的结构句柄。 Comparison with baseline. Evaluated across a diverse set of metrics for robust assessment, performs on par with standard flow matching and outperforms it in some cases. 批判点评:这是今天这批里最优雅的一篇:改动只在源分布,不动架构、不动损失、不动采样器,却换来局部编辑、结构保持、语义插值三个下游能力,而且能通过轻量后训练植入已有大模型。那个「独立噪声让模型偷懒依赖低噪邻居」的假设也相当锐利,属于对训练动力学的真实洞察,而不是拍脑袋的启发式。结构保持图的说服力很强——固定超像素、换种子,构图不变而属性变化,这直接证明了源分布的结构确实被继承到了输出。不过要留意几处。第一,超像素划分本身成了新的输入依赖:生成时需要一份划分,无条件生成场景下这份划分从哪来?如果是随机生成的,那它的分布就成了新的隐式先验,可能引入难以察觉的偏置;如果要用户提供,那这就从「更好的生成」变成了「另一种条件生成」,可比性发生了变化。第二,让区域内共享噪声成分本质上降低了源分布的熵,理论上会压缩可生成的多样性——而这个担心在论文自己的数据里就被证实了:无条件 FFHQ 上 Recall 从基线 0.200 掉到 0.160、FID 从 22.68 退到 25.80、FID-DINO 从 232.4 退到 267.3,同时 Precision 从 0.250 冲到 0.350。这是一组非常典型的「保真度换多样性」权衡信号,说明 StructFlow 生成的样本更精致但覆盖面更窄。摘要只说「有效」,把这个方向性代价藏进了图里,读者若不看 baseline_comparison 这张图很容易被误导。类别条件 ImageNet 上表现则相反(FID、sFID、Recall 全面改善),说明这个代价与是否有强条件信号高度相关——条件越弱,熵损失越致命。第三,「轻量后训练即可植入大模型」这个结论只说了成立,没给成本量化和在哪个模型上验证,而这是该方法能否被采纳的关键。第四,超像素的粒度是一个新超参,粒度过粗会锁死构图、过细则退化为独立噪声,最优粒度是否依赖数据集和分辨率未讨论。第五,作者两人分属马里兰大学与 Netflix,工作在 Netflix 实习期间完成,考虑到 Netflix 的业务场景,这套方法在视频生成上的表现是个自然的下一步,但本文未涉及。 10. CineDub:免裁脸免分离的多人配音 CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects | 中科大·蚂蚁集团·莫纳什大学 | arXiv:2608.15734 前序问题:真实场景下的自动视频配音被两个互相矛盾的约束卡住。层级式方法依赖脆弱的多阶段预处理——人脸裁剪、说话人分离等——这些前置步骤严重限制了数据可扩展性和实际部署:任一环节出错,后面全崩。整体式方法直接在未裁剪视频上操作,避开了预处理,但代价是时序对齐薄弱,而且在多说话人场景下会出现说话人-话语归属的歧义:模型不知道这句话该由画面里哪个人说。于是配音这件事在「脆弱但精确」和「鲁棒但混乱」之间左右为难,而影视配音恰恰是多说话人、多轮对话的典型场景。 本文贡献:CineDub 是一个统一的扩散模型,能直接从未裁剪视频完成精确的多说话人对话配音,既不需要人脸裁剪也不需要说话人日志。核心是隐式耦合整体条件化范式:整体视觉表示与一种语义捆绑的转写格式被独立编码,却通过跨模态训练隐式耦合起来,从而解决说话人歧义并支持精确的多人多轮对话配音。基于整体视觉特征捕获的统一时序线索,作者进一步把 CineDub 扩展到语音与音效的联合生成,为此引入环境音到语言的课程学习以缓解子任务退化,并设计解耦的文本分支控制机制来解决同时生成时的跨提示词干扰。同时发布两个真实场景基准。框架图显示视觉侧分为 Dense Temporal(Synchformer)、Global Semantic(CLIP)与 Transcription(Gemma-T5)三支冻结编码器,转写格式用 / 标记切分不同说话人的语句,音频与转写元 token 分别经交叉注意力注入主干。 Overview of CineDub under the ICHC paradigm. The holistic visual condition $\mathbf{c}_v$ (left), extracted by SynchFormer (Sec.~sec:visual_condition), encodes both event-level audio-visual correspondences and fine-grained lip-sync alignment. To address the speaker assignment ambiguity in $\mathbf{c}_v$, the semantic-bundled transcription $\mathbf{c}_t$ (right) provides per-segment speaker-utterance grounding cues, implicitly coupling with $\mathbf{c}_v$ via multi-conditional training (Sec.~sec:text_condition). CineDub adopts a unified DiT backbone that supports both joint video-to-speech-and-audio generation and each subtask. $\mathbf{c}_t$ and $\mathbf{c}_a$ are routed through decoupled textual branches to prevent cross-prompt interference, with learnable meta-tokens replacing inactive branches during single-task inference (Sec.~sec:decoupled_attn). 实验效果:实现了从未裁剪视频直接进行多说话人多轮对话配音,并扩展到语音与音效的联合生成。同时释出 CineDub-Multi(多说话人对话配音)等两个真实场景基准。论文已被 ACM MM 2026 接收。 Visualization of SynchFormer self-attention maps (magenta: active speaker; white: inactive speaker). (a)~Single-speaker setting: attention concentrates on the lip region. (b)~Two-speaker setting: attention dynamically shifts to the active speaker across turns. (c)~Failure cases: attention drifts to a non-speaking face during overlapping speech or becomes ambiguous at shot boundaries. 批判点评:「不需要人脸裁剪和说话人日志」是这篇最实在的卖点。做过配音管线的人都知道,那些预处理步骤是主要的故障源和数据规模瓶颈,能去掉它们,工程价值立刻显现。用带 / 标记的语义捆绑转写格式来消解说话人归属歧义,是个巧妙的取舍——把「谁在说」这个视觉难题部分转移到了文本侧的结构化表示上,绕开了视觉说话人定位的老大难。三支冻结编码器分工也清晰:Synchformer 管密集时序、CLIP 管全局语义、Gemma-T5 管文本,各司其职且都不训练,成本可控。ACM MM 2026 接收提供了一定的同行评议背书。但几点需要审视。第一,转写格式承担了消歧的主要负担,意味着推理时需要一份带说话人切分标记的高质量转写——这份输入从哪来?如果需要人工标注或依赖 ASR 加日志,那么「不需要说话人日志」只是把它从视觉管线挪到了文本管线,端到端的依赖并没有真正消除,摘要在这一点上表述得偏乐观。第二,同时生成语音与音效带来的「跨提示词干扰」用解耦文本分支来解决,但音效与语音在时间上天然重叠(说话时门在响),这种物理层面的耦合能否靠表示层解耦干净,值得怀疑。第三,两个基准都由作者团队自建,与训练数据的分布关系未说明,同分布优势难以排除。第四,摘要没有任何定量结果——没有同步性指标、没有音质指标、没有与层级式方法的对比数字,一篇声称解决多说话人歧义的论文却不给说话人归属准确率,是明显的缺口。第五,环境音到语言的课程学习是为缓解子任务退化而引入的,说明联合生成确实存在能力互斥,那么相比两个独立模型分别生成再混音,联合方案的净收益有多大并不明确。 趋势观察 像素空间正在夺回 VAE 让出的地盘 — 今天有四篇论文从不同角度指向同一个结论:VAE 潜空间不是免费的午餐。阿里的 Z-Image-Pixel 给出了首个能与潜空间掰手腕的像素空间 T2I 训练配方,港理工的 PixRestore 干脆不要 VAE 从零训像素 DiT,PixelControl 指出潜空间压缩会削弱细结构控制信号。VAE 换来的是算力,代价是细节与保真度——当算力配方被打通后,这笔交易开始被重新审视。 注意力加速从「手工稀疏」走向「蒸馏出来的结构」 — Qualcomm 的 SQuad 不再手写稀疏模式,而是把满 softmax 教师蒸馏成 O(n√n) 的局部+全局两段注意力,在 Wan 2.2 5B 上 VBench 83.20 对 83.08 基本无损而注意力 FLOPs 降 67 倍。上交与阿里的 SyncSparse 则说明:稀疏化不能对模态盲视,音视频模型直接套用视频加速方法会破坏音画同步。 「不训新模型」成为一种正当的方法论 — Qwen-Video-Edit 直接把图像编辑模型当视频编辑器用(帧排成一张大图),KeyID 走训练无关路线,EqF 把噪声条件整个去掉换来推理期自适应,MLLM 语义纠偏在采样循环里插反馈。视频基座训练成本高企之后,研究重心明显从「造模型」转向「榨干已有模型的隐含能力」。 人工智能炼丹君 整理 | 2026-08-19 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月19日
22 阅读
0 评论
0 点赞
2026-08-18
AIGC 每日速读|2026-08-18|港科大数字人比LTX-2快33倍还能连说一分钟Omni…
今日 AIGC 论文速览 今日共 10 篇 · 实时流式数字人与音视频联合生成 1 篇 · MLLM 与 DiT 融合的视频生成架构 1 篇 · 视频生成推理加速 3 篇 · 个性化与可控图像生成 2 篇 · 生成式渲染与视频编辑 2 篇 · 图像编辑评测基准 1 篇 重点论文标题列表 Omni-LiveAvatar(港科大 iComAI Lab·Vivix Group):比LTX-2快33倍的分钟级流式数字人 BiVidGen(中科院·Microsoft Research·中山大学·浙大·西交·上海AI Lab):MLLM先写视觉token再交DiT渲染 SCOPE:免训练稀疏注意力提速1.99倍 ForgeWM:世界模型压到1步还听懂键鼠 CRAFT(SIGGRAPH Asia 2026):1万张参考图干掉200万配对数据 今日论文速览 1. Omni-LiveAvatar:比LTX-2快33倍的分钟级流式数字人 Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Video Avatar Generation | 港科大 iComAI Lab·Vivix Group | arXiv:2608.13602 前序问题:音视频联合生成模型是沉浸式数字人的底座,但现有模型几乎都依赖双向注意力加多步去噪,这两件事凑在一起决定了它只能生成很短的片段。双向注意力要求看到完整序列才能算,天生做不了流式;多步去噪又让单块延迟压不下来。于是「实时交互」和「长时长」这两个数字人最需要的属性,在当前架构下同时缺失——你要么生成几秒的高质量片段然后卡住,要么牺牲质量去换速度,而且一旦想连续说上一分钟,全局一致性(人物长相、音色、场景)就开始飘。 本文贡献:提出 Omni-LiveAvatar,第一个做到分钟级、实时、流式的音视频联合数字人生成框架,三个部件各解一个问题。一是渐进式自回归蒸馏管线,把一个大的双向音视频联合扩散模型转成少步自回归生成器,关键点是整个过程不需要额外的稳定化机制——同类工作常要靠各种辅助 trick 才能压住自回归的误差累积。二是同步的音视频长短期记忆,在有界显存预算下保住全局一致性,这是长时生成不漂的直接原因。三是分层滚动提示词规划策略,让语义可以连贯演进、提示词之间平滑切换,而不是每换一句话画面就跳一下。 Overview of Omni-LiveAvatar. The proposed progressive autoregressive distillation pipeline converts a large bidirectional audio-video diffusion model into a few-step causal generator without any auxiliary stabilization mechanism (top). At inference, the synchronized audio-video long-short-term memory preserves global consistency while retaining recent context within a bounded memory budget for minute-level streaming inference (middle), and the hierarchical rolling prompt planning organizes global and local prompts for smooth long-form semantic evolution (bottom). 实验效果:单张 NVIDIA H200 上,相对其教师模型 LTX-2 拿到 33 倍生成加速,且能实时产出分钟级、音视频同步的高质量数字人。质量维度上全面超过同期的加速类基线,具体覆盖视觉质量、音频质量、跨模态同步性和人物保真度四个方面。代码已开源。 Qualitative comparison of 5-second avatar generation. Omni-LiveAvatar generates realistic and temporally consistent avatars with visual quality comparable to Ovi and LTX-2, whereas OmniForcing exhibits noticeable realism degradation and Hallo-Live suffers from facial and hand artifacts as well as color drift. 批判点评:这篇的工程完成度是今天这批里最高的,33 倍加速加分钟级流式,两个指标同时拿下不容易,而且「不需要额外稳定化机制」这句如果站得住,实际价值比加速倍率本身更大——自回归视频生成的误差累积一直是靠各种补丁压住的,能去掉补丁说明蒸馏管线的设计确实抓住了主要矛盾。教师选 LTX-2 也是个务实选择,那是当前公开可用的强音视频联合模型之一。不过 33 倍这个数字要放在正确的语境里读:它是相对教师的加速比,而教师本身是多步双向模型,基数很慢,所以这个倍率更多说明「双向多步这条路在实时场景下浪费有多大」,而不等于绝对性能领先。真正该问的是绝对延迟——摘要只说「实时」,没给单块生成耗时和端到端首帧延迟,而数字人交互对这两个数字极其敏感,300 毫秒和 800 毫秒是完全不同的产品体验。分辨率和帧率也没披露,H200 是顶配卡,换到消费级或推理卡上还剩多少余量不清楚。另外「分钟级」和真正的开放式交互仍有距离:长短期记忆是有界预算,那就必然有遗忘边界,跑到第五分钟、第十分钟时人物一致性掉多少,论文只展示了分钟级。最后,音视频联合生成最难的其实是音画同步在长序列上的累积误差,摘要报了同步性优于基线,但没说这个优势是否随时长衰减。 2. BiVidGen:MLLM先写视觉token再交DiT渲染 Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation | 中科院·Microsoft Research·中山大学·浙大·西交·上海AI Lab | arXiv:2608.14043 前序问题:DiT 已经是高保真视频生成的主流范式,但它做高层语义规划的能力一直很弱——给一句复杂提示词,它能画得很好看,却常常没把因果关系、动作顺序、多物体交互理清楚。图像生成那边已经证明把 MLLM 和扩散骨干混起来有明显优势,可这套思路在视频上基本没被认真研究过。更关键的是,现有少数尝试几乎都把 MLLM 当成一个冻结的特征编码器用,取它的隐层表示喂给 DiT,而 MLLM 最核心的能力——自回归地「生成」内容——完全没被调用。这就等于请了个会规划的大脑,却只让它当传感器。 本文贡献:系统性地拆解「MLLM 该怎么和 DiT 融合做视频生成」这个问题,明确拆成三问:什么样的中间表示适合做 MLLM 与 DiT 之间的桥梁、MLLM 该如何产出这个表示、DiT 在扩散渲染时该如何吸收它。三个发现:其一,由 EMA-based tokenizer 产出的离散语义视觉 token 提供了既稳定又有表达力的接口;其二,自回归因果建模适合生成这些 token;其三,显式的视觉 token 条件化比改写提示词(prompt refinement)或隐空间桥接(latent bridging)都更有效。基于这三点提出 BiVidGen 这一混合架构,让 MLLM 真正承担语义规划、DiT 负责扩散渲染。 Overview. BiVidGen consists of three main components. First, an EMA-based vision tokenizer provides discrete visual representations. Then, an MLLM predicts semantic visual tokens. Finally, the DiT renders high-fidelity videos conditioned on these planned tokens. 实验效果:论文以系统性对照实验为主体,逐一验证三个设计维度上的选择,最终 BiVidGen 在语义规划相关的生成任务上优于把 MLLM 当冻结编码器的既有做法。三条发现分别对应中间表示形式、生成方式、条件注入方式的消融结论。 Qualitative Comparisons. MLLM+DiT yields better causal transitions, temporal consistency, and semantic alignment than the DiT-only baseline in these examples. 批判点评:这篇的价值主要在「把问题问清楚」而不是「刷了个 SOTA」。它把 MLLM-DiT 融合这个此前靠直觉拼装的设计空间,拆成三个正交维度逐一做对照,最后给出的三条结论——离散语义 token 做接口、自回归生成、显式 token 条件化——对后续做这个方向的人是实打实的省时间,尤其「显式 token 条件化优于 prompt refinement 和 latent bridging」这条,直接排除了两条看起来很自然但实际次优的路径。EMA tokenizer 提供稳定接口这个发现也有说服力,离散化在生成任务里通常被担心信息损失,这里反而因为稳定性赢了。但摘要在最关键的地方留了空白:没有任何具体数字,没说在哪些 benchmark 上、相对哪些基线提升多少,也没交代 MLLM 和 DiT 各自的规模、训练数据量和总训练成本。对一篇以「系统性研究」自我定位的工作,这些恰恰是判断结论泛化性的关键——三条结论是在某个特定尺寸组合下成立,还是随规模稳定?其次,引入自回归 MLLM 生成视觉 token 必然带来额外推理延迟,视频生成本来就慢,这个代价有多大、值不值得,论文没有权衡分析。最后一个更根本的隐忧:既然 MLLM 现在承担了语义规划,那它规划错的时候会怎样?DiT 是有能力纠正一个错误的视觉 token 序列,还是会忠实地把错误渲染出来?这个失败模式没有讨论,而它直接决定了这套架构在实际产品中的鲁棒性。 3. SCOPE:免训练稀疏注意力提速1.99倍 SCOPE: Subspace Clustering with Online Per-Head Top-K Estimation for Sparse Video Attention | arXiv:2608.12780 前序问题:DiT 在时空 token 上的自注意力是二次复杂度,视频一长、分辨率一高就成为主要瓶颈。现有免训练稀疏注意力方法普遍用块级或簇级的代理分数来构造稀疏掩码,问题是这种粗粒度代理会把 key 之间的细微差异抹平,在激进稀疏率下高贡献的 key 就被漏掉了。还有一个更隐蔽的失败模式:代理分数容易产生过度集中的 softmax 分布,导致 Top-p 策略对某些 query 簇只保留极少的 key。用一个固定的 Top-k 下限可以缓解,但不同注意力头、不同输入的稀疏容忍度本来就不一样,共享一个固定值必然有头被切得太狠。 本文贡献:提出 SCOPE,免训练稀疏注意力框架,把 3D-RoPE 对齐的 key 子空间聚类和在线逐头 Top-k 估计结合起来。具体做法是把过了 RoPE 的 key 按时间、高、宽三个子空间分别独立聚类,再通过查找表聚合对应的质心分数,为每个 query 簇得到逐 key 的代理分数——粒度从块/簇细化到单个 key。在既有的 Top-p 与固定 Top-k 混合选择策略之上,SCOPE 在线推导每个头专属的 Top-k 值:对每个头,按 query 簇大小加权平均其初始保留 key 数,只对那些初始保留数低于该均值的 query 簇补充选取额外 key。最终稀疏注意力在选中的原始 key/value 上计算。 Overview of SCOPE. Queries are clustered in the full feature space, while each post-RoPE key is represented by temporal, height and width subspace assignments. Query-centroid slices score the corresponding subspace centroids to form lookup tables, and indexed summation reconstructs a proxy logit for every key. Hybrid Top-$p$/fixed-Top-$k$ selection produces the initial key counts, from which SCOPE estimates an online per-head Top-$k$ value. Sparse attention is computed using the selected original $K$ and $V$. 实验效果:在六种模型-任务配置上,SCOPE 在保真度和延迟两个维度上都稳定优于现有免训练基线。720p HunyuanVideo 上端到端加速最高 1.99 倍,同时相对稠密注意力保持 28.46 dB PSNR。 Attention recall and PSNR under matched attention density. SCOPE consistently achieves higher attention recall and PSNR than competing sparse attention methods at the same retained density. 批判点评:这篇的两个改动都很对症。按 RoPE 的三个物理维度分别聚类,比在混合后的高维空间里做一次聚类更合理——时间、高、宽三个方向的相似性结构本来就不同,混在一起聚必然互相干扰,这个设计有明确的几何动机而不是调参调出来的。逐头在线估计 Top-k 也踩在了痛点上:稀疏注意力的工程实践里,「哪个头能切多狠」向来是最难统一的,用全局固定值本质上是在拿最脆弱的那个头的容忍度当上限,牺牲了其余头的加速空间。1.99 倍加速配 28.46 dB PSNR 是个体面的组合,六种配置的覆盖也说明不是单点调优。但要注意几个尺度问题。28.46 dB 是相对稠密注意力的重建保真度,这个量级在图像上属于「肉眼可辨差异」的边缘,视频上更麻烦的是误差会沿时间累积——单帧 PSNR 达标不代表时序闪烁可接受,而摘要没给任何时序一致性指标。1.99 倍是「最高」值且只在 720p HunyuanVideo 上,其余五个配置的加速比没披露,实际期望值应该往下调。更根本的是,SCOPE 自己引入了聚类和查找表两层额外开销,这部分成本随 token 数如何增长、在什么序列长度以下会反而变慢,论文没给出盈亏平衡点,而这直接决定它能否用在短视频或低分辨率场景。最后,逐头 Top-k 用「簇大小加权均值」作为阈值是个启发式,为什么均值是对的、换成分位数会怎样,缺少分析。 4. ForgeWM:世界模型压到1步还听懂键鼠 ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models | arXiv:2608.14022 前序问题:动作条件视频世界模型要同时满足低延迟因果生成和对游戏原生控制信号的可靠响应。因果蒸馏已经能做到一步或少步视频合成,但把它扩展到交互式世界模型很难,症结在于离散的键盘状态和连续的鼠标运动必须在因果训练和自回归 rollout 的全过程中,始终与被时间压缩过的隐空间 chunk 保持对齐。视频 VAE 在时间维做了压缩,一个隐 chunk 对应多帧,而用户的按键是逐帧发生的——这个错位在多步生成里还能靠冗余步数糊过去,压到一两步就直接暴露成「动作响应不准」。 本文贡献:提出 ForgeWM,一个渐进式框架,通过四个阶段把双向的动作条件视频生成器转成高效的少步世界模型:域适应、teacher-forced 因果训练、因果一致性蒸馏、以及与双向教师做 on-policy 分布匹配。产出的是「按预算特化」的学生模型,分别在 1、2、4 步的稳态去噪预算下工作。ForgeWM 还支持一种双路径部署协议,把延迟敏感的交互与可选的回放期精修结合起来——一步学生先出草稿保存,之后再重新加噪并精修这份草稿,等于把「交互时要快」和「回放时要好」两个矛盾需求拆到了不同时间点。 Overview of ForgeWM. (A) Frame-aligned keyboard and mouse controls condition latent chunks. (B) A shared base yields a bidirectional teacher and budget-specialized causal students through four-stage training. (C) Deployment separates low-latency interaction from optional Replay-Time Refinement (Figure~fig:replay-refinement). 实验效果:在配对的 Minecraft 轨迹上,ForgeWM 在成像质量、参考对齐的运动指标上领先所评估的各系统,学生模型可在 1、2、4 步预算下运行。 Qualitative comparison. Rollouts at frames 0, 25, 51, and 76. Rows show the reference and three models. Controls are annotated once on the reference: each overlay shows dominant WASD and accumulated mouse-look to the next frame; the final frame has no outgoing control overlay. Left/right: daytime forest stream/rainy riverbank at night. 批判点评:把「动作对齐」识别为少步世界模型的核心障碍,这个判断是准的,而且它指出的错位很具体——时间压缩的隐 chunk 与逐帧动作信号之间的粒度不匹配,这不是靠加数据能解决的结构问题。四阶段渐进管线(域适应→teacher-forced→一致性蒸馏→on-policy 分布匹配)的顺序也有内在逻辑:先让模型适应域,再在有监督信号下学因果,最后用 on-policy 修正暴露出的分布偏移。双路径部署是全篇最有产品意识的设计——交互时用一步出草稿保延迟,回放时再加噪精修提质量,直接承认了「同一个模型不必在所有时刻都做同样的权衡」,这个思路可以迁移到很多实时生成场景。但实验范围是明显的短板:只在 Minecraft 上验证。Minecraft 的视觉复杂度低、纹理规整、物理规则简单且完全确定,是世界模型最友好的测试场,在这里报 SOTA 与在真实感游戏或真实视频上的可用性之间有很大鸿沟。「领先所评估的各系统」这个表述也偏保守,说明对比范围可能有限,具体的 FID/FVD 数值和延迟数字摘要都没给。一步学生的绝对质量损失多少同样没交代——1、2、4 步三档特化模型之间的质量-延迟曲线是这篇最该给的图,缺了它就无法判断「压到一步」是真可用还是仅仅可跑。另外双路径协议要为每次交互保存草稿,显存和存储开销在长会话下如何增长,也没有讨论。 5. CRAFT:1万张参考图干掉200万配对数据 CRAFT: Constrained Reward via Attention Fine-Tuning for Subject Personalization without Composed Targets | SIGGRAPH Asia 2026 | arXiv:2608.14403 前序问题:主体驱动的图像个性化——生成新图像同时保持一个或多个参考主体的身份——是视觉内容创作的基础能力。当前主流做法是在几十万到几百万组「参考图-合成目标」配对样本上微调预训练的 MMDiT,而每组合成目标都是主体出现在新场景中的一张合成图。造这些目标需要一条昂贵的多阶段流水线:LLM 生成提示词、T2I 合成目标图、参考主体抠取、VLM 质量过滤、对应关系标注。除了贵,这条路还有个隐性代价——方法被紧紧绑在某个特定的目标合成器和某一套数据清洗策略上,换个合成器结论就不一定成立。 本文贡献:提出 CRAFT,一个单步 ReFL 框架,用 LoRA 适配器微调预训练的「参考感知」MMDiT,训练数据只需 1 万张参考图加主体 mask,完全不需要合成目标监督。核心是「看哪里」原则:注意力级奖励把噪声 token 与短语 token 的注意力对齐到正确的参考主体上,由此得到的逐主体注意力 mask 再去门控一个像素级身份奖励,从而让图像空间的监督与学到的注意力路由保持一致。这等于把监督信号从「像素该长什么样」换成了「注意力该看哪个主体」,后者可以从参考图本身直接构造。 Overall pipeline of CRAFT. The denoising prefix is rolled out without gradients up to the reward step $t^\ast$, where two forward passes are performed: the frozen backbone $f_\text{base}$ produces $\mathbf{v}_\text{base}$, while the LoRA-adapted model $f_\text{LoRA}$ produces $\mathbf{v}_\text{LoRA}$ together with the cross-modal attention sub-blocks $\mathbf{A}_{N2R_k}$, $\mathbf{A}_{N2P_k}$, and $\mathbf{A}_{P_k 2 R_k}$. Following the Where to look principle, $\mathcal{R}_\text{ref}$ and $\mathcal{R}_\text{cons}$ shape noise- and phrase-token attention toward each reference subject (sec:method:attn_rewards); the resulting per-subject mask $\mathbf{m}^\text{noise}_k$ then gates the pixel-level identity reward $\mathcal{R}_\text{id}$ on the VAE-decoded pre-image $\hat{\mathbf{I}}$ (sec:method:pixel). Auxiliary terms $\mathcal{R}_\text{CLIP-T}$, $\mathcal{R}_\text{AES}$, and a velocity-space regularizer $\mathcal{L}_\text{anchor}$ are added for prompt fidelity, aesthetics, and stability (sec:method:loss). A single backward pass updates only the LoRA parameters. 实验效果:应用在 FLUX.2-klein-9B 上,CRAFT 在 XVerseBench 上达到 SOTA,且只用 1 万条纯参考数据,而此前的通用方法需要 15 万到超过 200 万组合成目标配对。同一套配方迁移到其他参考感知骨干上也能稳定提升性能。已被 ACM SIGGRAPH Asia 2026 接收。 Qualitative comparison with state-of-the-art subject-driven personalization models. 批判点评:1 万对 200 万,两个数量级的数据量差距还能拿 SOTA,这是今天最有冲击力的数字,而且它的说服力不在倍数本身,而在于它质疑的东西:如果两百万组精心合成的配对数据能被一万张参考图替代,那说明此前的数据流水线在很大程度上是在用外部监督重新教模型一些它内部已经编码好的东西。把监督从像素空间挪到注意力空间是关键一步——「主体身份」这个概念在 MMDiT 里本来就是通过注意力路由实现的,直接在这一层加约束比绕一圈从像素反推更直接。用注意力 mask 去门控像素奖励也很巧,避免了两种监督各说各话。迁移到其他参考感知骨干仍有效,说明不是单一模型上的过拟合。SIGGRAPH Asia 的接收也是一层背书。不过前提条件要看清楚:它要求骨干必须是「参考感知」的 MMDiT,也就是说模型本身已经具备处理参考图的结构,CRAFT 是在这个基础上做对齐微调,而不是从零赋予个性化能力——所以严格说它省掉的是「对齐阶段」的数据,而非全部。评测只报了 XVerseBench 一个基准,主体个性化的评测口径分歧很大,单一 benchmark 上的 SOTA 需要更多交叉验证,尤其是多主体组合、罕见物体这些困难设定。注意力级奖励依赖短语 token 与主体的正确对应,当提示词里出现代词、隐含指代或多个同类物体时这个对应如何建立,摘要没说。最后 1 万张参考图仍需主体 mask 标注,这部分成本虽远低于合成目标流水线,但并非零。 6. XYZFlow:不靠蒸馏拿到7.2倍教师加速 XYZFlow: Scaling Multi-dimensional Shortcut Flows for Efficient Generative Modeling | ICML 2026 | arXiv:2608.12276 前序问题:高保真图像生成始终卡在速度与质量的取舍上。扩散模型视觉效果强,代价是昂贵的迭代采样。现有的高效方法主流是把预训练模型蒸馏成少步采样器,但蒸馏本身是个难做的过程,而且质量上限严重依赖教师模型——教师有的毛病学生躲不开,教师没有的能力学生也长不出来。这意味着加速路线被绑死在「先有一个好教师」这个前提上,而且每换一个基础模型就要重跑一遍蒸馏。 本文贡献:提出 XYZFlow,从流匹配的多维度缩放这个角度重新思考高效生成,而不是走蒸馏路线。核心主张是:相比单步映射,通过结构化的多维条件化可以让概率路径更可辨识、更易学习,从而提升表达力。论文把自回归建模看作一种隐式的流直化——上下文越丰富,轨迹的歧义就越小。XYZFlow 用两个正交维度实现这个想法:时间维缩放,即在完整去噪历史上做非马尔可夫条件化;空间维缩放,通过「下一捷径预测」(Next Shortcut Prediction)顺序生成图像块,把已生成块的去噪轨迹当作后续块的先验。 Next Shortcut Prediction in XYZFlow. (Top-Left) Flow diagram showing the generation sequence, where a blue curve represents progressively strengthening constraints. (Top-Right) Visualization of a non-uniform patch-based denoising process: the first image patch undergoes the most denoising steps, while subsequent patches are generated with fewer steps (“shortcuts”). This forms a long autoregressive sequence where the denoising flow from prior patches (green and blue arrows) guides the denoising of subsequent ones. 实验效果:达到 SOTA 性能,相对教师模型实现 7.2 至 8.5 倍加速,同时 FID 保持竞争力。其中 Next Shortcut Prediction 在质量-延迟权衡上优于单纯的模型放大或步数削减两种做法。已被 ICML 2026 接收(16 页 5 图)。 Randomly selected examples of generated images from XYZFlow. XYZFlow shows high-quality generative modeling abilities. 批判点评:「自回归建模是隐式的流直化」这个视角是这篇最有价值的部分。流匹配领域一直在琢磨怎么把概率路径拉直,主流手段是改路径设计或加正则;这篇指出提供更丰富的条件上下文本身就在减少轨迹歧义,等于把自回归和流直化两条此前平行的技术线接上了,这个洞察比 7.2 倍这个数字更耐读。时间和空间两个正交维度的划分也干净——非马尔可夫地用完整去噪历史,加上按块顺序生成用已完成块当先验,两者确实互不重叠,可以独立叠加。绕开蒸馏这一点尤其实在,摆脱了对教师质量的依赖,ICML 2026 的接收说明理论部分经过了同行检验。但代价需要说清楚:空间维的 Next Shortcut Prediction 是顺序生成图像块,这天然引入了块间的串行依赖,跟扩散模型全图并行去噪的优势正好相反。摘要报的 7.2-8.5 倍加速想必已经包含这部分开销,但在什么分辨率下测的、块数增加时加速比如何衰减,是判断可扩展性的关键,而这些没披露。「FID 保持竞争力」这个措辞比「达到 SOTA」弱,暗示纯质量指标上可能有小幅让步,具体差多少应该给出。时间维的非马尔可夫条件化要保存完整去噪历史,显存开销随步数线性增长,与少步生成的初衷存在张力。另外全文以图像生成为主,视频这种时空 token 量级大得多的场景下,块间串行的代价会被放大多少,是个开放问题。 7. RGBX-Next:把DiT改造成可控生成式渲染器 RGBX-Next: Towards Realistic Generative Rendering from G-Buffers | NVIDIA·UCSB·UCSD·MBZUAI | arXiv:2608.13929 前序问题:扩散模型在图像、视频和流式生成上效果已经很好,但和传统 3D 渲染相比,它对生成结果缺乏精确控制。传统渲染管线里你能精确指定几何、材质、光照,改一个参数就得到可预期的变化;扩散模型给的是「大致符合描述」,无法承担需要确定性控制的生产任务。反过来传统渲染又缺少生成模型的真实感先验,物理正确不等于看起来像照片。这两条路各有各的强项,一直没能真正打通。 本文贡献:主张一条可行路径是把生成模型当作以传统渲染的 G-buffer 为条件的「学习型渲染器」。提出 RGBX-Next,一个统一的前向与逆向渲染生成框架:既能从图像、视频、流中估计 G-buffer(逆向),也能从 G-buffer 渲染出真实的图像、视频、流(前向)。核心贡献是给出了一套把扩散 Transformer(DiT)模型微调成生成式前向渲染器与逆向渲染器的通用配方。作者承诺公开全部模型。 High-level overview of our paper. We first describe a simple version of image and video models in sec:initial-rgbx, followed by an improved version using our QK type embedding and clean input tokens techniques in sec:improved-rgbx. We estimate G-buffers from real video data with our model in sec:dataset, and train models with X-patchify in sec:xpatchify. We discuss conditioning dropout and lighting control in sec:dropout-blurring,sec:lighting. We introduce streaming extensions of our models in sec:streaming. 实验效果:所得模型在真实感生成式渲染与内在分解(intrinsic decomposition)两个方向上都达到高质量。论文强调其提出的设计原则将有利于后续可控生成式前向与逆向渲染的研究。团队来自 NVIDIA 与 UCSB 等,作者包含多位实时渲染与逆向渲染方向的资深研究者。 The overall design of our $1/N$ streaming models. For each chunk, the model receives $N$ current input frames and one stitching frame from the previous chunk, whose input and output are already known, then produces the $N$ new output frames through a diffusion process. Optional long-context tokens provide a clean reference frame for long-term memory. For simplicity, the figure illustrates the rgbtox case with albedo as xx. 批判点评:把 G-buffer 当作生成模型的条件接口,这个设计的聪明之处在于它直接复用了图形学几十年积累下来的中间表示。G-buffer(法线、深度、albedo、粗糙度这些)本来就是渲染管线里为了解耦几何与着色而设计的,它天然是结构化、可编辑、语义明确的——比文本提示词或隐向量都更适合做精确控制的入口。前向和逆向统一在一个框架里也很自然,两者本质是同一映射的两个方向,共享表示能互相提供约束。作者阵容是这篇的隐性背书:Marco Salvi、Jan Novák、Ravi Ramamoorthi、Ling-Qi Yan、Miloš Hašan 都是渲染和逆向渲染方向的资深研究者,NVIDIA 主导加上承诺开源模型,落地可能性比多数学术工作高。但摘要的表述相当克制,也确实缺东西:全篇没有一个量化指标,「高质量」「有利于后续研究」这类措辞在一篇声称做 SOTA 级渲染的工作里偏软,无法与 RGB↔X 等前作直接比较。「通用配方」的具体内容摘要没展开——微调哪些层、G-buffer 如何编码注入、训练数据从何而来(合成渲染数据的域间隙如何处理),这些恰恰是能否复现的关键。前向渲染方向还有个绕不开的问题:生成模型对 G-buffer 的响应是否单调可预期?如果微调 albedo 一个通道会引起画面其他部分的连带变化,那「精确控制」这个卖点就打折了,而摘要没有这类可控性验证。流式(streams)支持被反复提及但没有延迟数字,实时渲染场景下这是硬门槛。 8. InstructVVT:视频试衣扔掉mask和pose先验 InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors | 南京大学·中国移动九天 | arXiv:2608.14070 前序问题:视频虚拟试衣是个约束极强的编辑任务:既要精确替换目标人物的衣服,又要严格保住原视频的空间结构和时序动态。现有方法严重依赖手工的辅助空间先验(mask、pose 等)来实现编辑控制,可这些先验在无约束的真实视频里很容易失效——遮挡、快速运动、罕见姿态都会让 pose 估计或分割崩掉。更本质的问题是,这类先验把丰富的视觉上下文压缩成了不完整的结构信号,信息通道太窄。此外标准的重建目标也无法充分刻画试衣任务特有的人类偏好(衣服贴合是否自然、褶皱是否合理)。 本文贡献:提出 InstructVVT,基于 DiT 的指令驱动、参考引导的视频试衣框架,推理时完全不需要空间先验。核心是双层参考条件化:一方面由 MLLM(挂可训练 LoRA)经 Connector 推断语义编辑 token,用于目标消歧与结构保持——也就是搞清楚「要换谁的哪件衣服、哪些部分不能动」;另一方面用一条轻量条件化通路把参考服装的细粒度外观显式注入,与源视频 latent 一起拼成多模态 DiT 输入。训练分两阶段:Stage 1 监督微调,Stage 2 用 DiffusionNFT 做强化学习——策略 DiT 采样 K 个候选视频,由冻结的 MLLM 奖励模型打分,经 NFT 损失更新策略并以 EMA 回写,以此对齐标准重建目标无法刻画的试衣偏好(贴合是否自然、褶皱是否合理)。 Overview of our InstructVVT framework. In the supervised training, the source video, reference garment, and instruction are encoded by a frozen MLLM with trainable query tokens $Q_e$, LoRA adapters~lora, and an MLP connector to produce MLLM edit tokens $C_e$. We adopt two embedding layers with identical architecture but independent parameters to encode video cue tokens $X_t$ and reference garment tokens $C_g$, respectively. The MLLM edit tokens $C_e$, video cue tokens $X_t$ and reference garment tokens $C_g$ are injected into each DiT block through cross-attention. The post-training stage applies DiffusionNFT~diffusionnft: a frozen EMA policy samples $K$ videos, a tailored reward model based on MLLM assigns score-token rewards, and the NFT loss updates the trainable DiT. 实验效果:在无约束真实视频上不依赖推理期空间先验即可完成试衣编辑,同时保持源视频的空间结构与时序动态。定性对比覆盖 ViViD、CatV2TON、MagicTryOn、TripVVT、UniVideo 五个基线,在领口结构、腰带细节与裙摆轮廓的保真度上更接近目标服装。论文 23 页 10 图,Dingbao Shao 与 Song Wu 为共同一作,Zili Yi 为通讯作者。 Qualitative comparisons on ViViD-S. The examples show that InstructVVT transfers the reference garment while preserving the source video appearance and temporal structure, complementing the quantitative ViViD-S results in Table~tab:vivid_s. 批判点评:去掉推理期空间先验这个方向是对的,理由比「少一步预处理」更深:mask 和 pose 本质是把高维视觉信息压成低维结构信号的有损投影,在真实视频里既容易估错,又丢掉了大量对编辑有用的上下文。用 MLLM 推断语义编辑 token 做目标消歧,思路上与今天 BiVidGen 那篇同源——都是让 MLLM 承担「理解要改什么」的规划角色,而非只做特征编码器。第二阶段引入 DiffusionNFT 强化学习也踩在了实处:试衣好不好看是典型的「重建损失说不清、人一眼能判断」的任务,用 MLLM 当奖励模型去对齐这类偏好,比继续堆重建监督更对症,而且 NFT 这条路线比 DPO 类方法更适合扩散模型的训练形态。不过摘要通篇没有任何量化结果,没有 benchmark 名称、没有与 ViViD/TripVVT 等的对比数字,也没说清基座 DiT 是哪个、训练数据规模多大——对一篇 23 页的工作,摘要层面的信息密度偏低。「不需要推理期空间先验」这个措辞要留意「推理期」三个字:训练阶段是否仍用 mask/pose 做监督没有交代,若训练仍需要,省下的是部署成本而非数据成本。服装细节保真是视频试衣最难的部分,logo、纹理、褶皱在人物运动中的一致性只笼统说保持时序动态,缺少针对细粒度纹理漂移的量化证据。MLLM 既参与推理条件生成、又在训练时充当奖励模型,两处都是重计算,逐块处理长视频时开销会被放大,但没有效率数字。RL 阶段还有个隐忧:MLLM 奖励模型自身的偏好偏差会被策略学去,而摘要没有讨论奖励过优化(reward hacking)的防护。 9. Concept Guidance:跳过特定层就能连续调美感 Concept Guidance: Precise, Training-Free Latent Control for Text-to-Image Generation | GCPR 2026 Oral·慕尼黑大学 CompVis | arXiv:2608.14172 前序问题:文生图扩散模型有两个严重限制实用性的短板。一是标准模型缺少内在机制来做连续的、概念特定的引导——比如想精确控制「这张图有多好看」,你没有一个可以平滑调节的旋钮,只能改提示词然后重新抽卡。二是在需要高局部连贯性的任务上不可靠,典型就是生成文字和人手,这两样几乎是扩散模型的经典失败案例。现有的可控生成方案大多要额外训练、外部模型或梯度回传,成本高且不通用。 本文贡献:引入「概念级互信息」(concept-wise mutual information)这一新概念,并发现不同层之间存在很大的、依赖于概念的差异——这说明特定结构的生成是局部化在网络的不同部分的。基于这个洞察提出 Concept Guidance(CoG):先量化每一层对特定概念的影响,然后用「跳过概念相关层后生成的预测」的加权组合来引导去噪。整套方法开箱即用,不需要额外训练、外部模型、梯度或提示词工程。 Concept Guidance precisely approximates the target direction by combining per-layer skip predictions using concept-relevant layers ($\alpha,\beta,\gamma$). It computes individual skip-layer noise predictions ($\epsilon_{[\theta\setminus \alpha]}, \epsilon_{[\theta\setminus \beta]}, \epsilon_{[\theta\setminus \gamma]}$) and extrapolates over them to precisely estimate the target direction. 实验效果:在多种目标和主流模型上都取得性能提升,覆盖 PixArt-alpha、SD3、SD3.5 与 FLUX.1-dev。代码已开源。被 GCPR 2026 接收为 Oral 报告,论文 28 页含补充材料。 Uncurated Comparison of Classifier-Free Guidance (CFG) ho2022classifier_free_guidance, Naive Skip-Guidance as found in Stable Diffusion 3 huggingfaceSD3, Spatio-Temporal Skip Guidance hyung2025spatiotemporal and Concept Guidance for Aesthetics (FLUX.1-dev). 批判点评:「概念的生成是按层局部化的」这个发现本身就有独立价值,它给扩散模型的可解释性提供了一个可操作的抓手:不是笼统地说某些层管结构、某些层管风格,而是用概念级互信息把「哪一层对哪个概念负责」量化出来。基于此的 CoG 走了一条很轻的路——通过跳过概念相关层来构造对比预测,再加权组合去引导,完全不需要训练、外部模型或梯度,这在实践中意味着可以直接挂到任何现成模型上。在 PixArt-alpha、SD3、SD3.5、FLUX.1-dev 四个架构上都有效,说明层级概念局部化不是某个模型的偶然特性,这个跨架构验证做得比较扎实,Ommer 组(Stable Diffusion 原作团队)在这个方向的判断力也值得信任,GCPR Oral 加开源代码进一步加分。但方法本身的边界需要看清。「跳过层」是个粗粒度干预,一层往往同时参与多个概念的生成,跳过它拿到的对比信号必然混入了对其他概念的扰动——摘要提到美感和局部连贯性(文字、手)两类目标,但没说多个概念同时引导时会不会互相冲突,而实际使用中「既要好看又要手正确」才是常态。「性能提升」缺少具体数字和评测口径,美感这类主观目标尤其需要说明是用自动指标(如 aesthetic predictor)还是人工评测,两者结论经常不一致,而且用某个 aesthetic 模型打分再优化它容易陷入自我强化。跳过层还意味着每步要多跑若干次前向来构造对比预测,推理成本的增加倍数摘要没给,这对本来就慢的扩散采样是实际负担。每个概念都需要先做一轮层影响量化,这个前置校准的成本和是否需要按模型重做,也没交代。 10. CPI-Bench:首个纳入多图编辑的评测基准 CPI-Bench: A Comprehensive, Practical and Intelligent Benchmark for Real-World Image Editing | arXiv:2608.14546 前序问题:图像编辑模型进展飞快、应用铺得越来越广,把这些能力直接部署到真实场景的需求越来越急。但现有基准仍局限在简单的单图任务上,覆盖维度有限,而且区分不开不同模型的性能差异——大家分数都挤在一起,看不出谁真的更强。结果就是它们无法可靠评估模型在复杂多图编辑、高要求推理指令、以及实际部署设定下的表现,而这三项恰恰是真实业务里最常遇到的。 本文贡献:提出 CPI-Bench,面向真实世界图像编辑的综合、实用、智能基准,由三个核心子集构成。CPI-General-Bench 全面覆盖多样的编辑任务,并首次把多图编辑评估纳入进来;CPI-Practical-Bench 聚焦高频真实用户应用场景;CPI-Intelligent-Bench 专门评估高要求的推理型编辑能力。三个子集分别对应「覆盖广度」「实用贴近度」「推理深度」三个此前被忽略的维度。 The overview of CPI-Bench. CPI-Bench decomposed into three distinct dimensions: CPI-General-Bench for comprehensive editing performance, CPI-Practical-Bench for real-world deployment efficacy, and CPI-Intelligent-Bench for reasoning-based editing tasks. 实验效果:论文给出主流图像编辑模型在该基准上的评测结果,13 页基准报告。最有说服力的是与 Arena 人类偏好排名的一致性对比:CPI-Bench 的 Spearman 相关系数达 0.994、平均绝对误差 0.12,而 GEdit-Bench 仅 0.548(MAE 1.50)、ImgEdit-Bench 0.814(MAE 0.88)、REDEdit-Bench 0.976(MAE 0.25)。评测覆盖 GPT-Image-2、Seedream5 Pro、Nano Banana Pro、Qwen-Image 2.0 Pro、Seedream4.5、Qwen-Image-Edit-2511、FLUX.2-klein-9B/4B 等主流模型。 Left: Model ranking trends across benchmarks compared against the Arena Image Edit Leaderboard~lmarena2024leaderboard. CPI-Bench we proposed demonstrates the closest alignment with Arena. Right: Spearman correlation coefficients and Mean Absolute Error (MAE) with Arena rank. CPI-Bench outperforms other benchmarks, achieving the highest correlation and the lowest error margin. 批判点评:把多图编辑正式纳入基准是这篇最实在的贡献。真实用户的编辑需求里,「把这张图的人放到那张图的场景里」「参照这张图的风格改那张」这类跨图操作占比很高,而现有基准几乎全是单图进单图出,评测口径和真实用法之间存在结构性错位。三子集的切分逻辑也清楚——覆盖广度、实用场景、推理深度,分别对应三种不同的失败模式。更关键的是它给出了一个可验证的自证方式:用与 Arena 人类偏好排名的 Spearman 相关性来衡量基准自身的有效性。0.994 对 GEdit-Bench 的 0.548,这个差距说明现有部分基准的排序与人类判断几乎脱节,而「基准该不该被信任」本来就该用这种方式检验,这个方法论比基准本身更值得借鉴。不过要注意几个问题。与 Arena 对齐这件事是双刃剑——相关性做到 0.994 意味着它高度拟合了当前 Arena 的偏好分布,但 Arena 本身有其偏差(用户构成、提问分布、审美倾向),过度对齐等于把这些偏差一并继承,而且一个与现有人类榜单几乎重合的基准,额外信息量到底有多少是可以追问的。评测模型只有 8 个且集中在头部闭源与 FLUX 系列,样本量偏小时 Spearman 系数本身就不稳定,换一批模型是否还有 0.99 需要验证。评测指标的具体实现(用 VLM 打分还是人工标注、多图编辑正确性如何自动判定)摘要没交代,而这决定了基准能否被独立复现;13 页篇幅对一个三子集基准来说偏紧,样本规模、任务分布、标注一致性检验都未见披露。「Intelligent」子集尤其需要说明「高要求推理」的操作化定义,否则容易变成难题集合而非能力维度。机构信息缺失也值得留意,基准类工作的中立性与作者团队是否同时在造编辑模型有直接关系。作为今天唯一的评测工作,它排在末位,但指出的评测盲区和自证方法都有实际价值。 趋势观察 今天的加速不再是「砍步数」,而是重新决定每一步该看什么 — SCOPE、ForgeWM、Omni-LiveAvatar 是今天最值得对读的一组,三篇都在做加速,但切入的层次完全不同,合起来正好画出视频生成推理优化的三层地图。SCOPE 动的是注意力内部:它不改模型、不训练,只是质疑现有免训练稀疏注意力用「块级/簇级代理分数」筛 key 这件事——粗粒度代理会把 key 之间的细微差异抹平,高贡献的 key 在激进稀疏下就被漏掉了。它的做法是把过了 RoPE 的 key 按时间、高、宽三个子空间分别聚类,再用查找表聚合质心分数,让代理分数细到单个 key;同时把 Top-k 的下限从「全局固定值」改成「每个头在线估计」,因为不同注意力头的稀疏容忍度本来就不一样,共享一个值必然有头被切狠了。ForgeWM 动的是采样步数,把双向生成器蒸成 1/2/4 步的学生。Omni-LiveAvatar 动的是生成范式,把双向扩散整体换成自回归流式。三者的加速倍率也恰好逐层放大:SCOPE 端到端 1.99 倍,ForgeWM 压到 1 步,Omni-LiveAvatar 相对教师 LTX-2 拿到 33 倍。这说明一件事——单靠某一层的优化很快会触顶,真正的量级提升来自换范式,但换范式的代价是要重训,而 SCOPE 这类免训练方法的价值恰恰在于它能直接叠加到任何已有模型上。值得注意的是三篇的适用边界完全不重叠,理论上可以叠乘,但没有任何一篇验证了叠加后的保真度损失是否线性累积,这大概是这个方向下一步最该做的实验。 MLLM 在生成管线里的角色正在从「编码器」升级为「规划器」 — BiVidGen 与 InstructVVT 从两个尺度上指向同一个转变。过去把 MLLM 接进扩散模型,绝大多数做法是拿它当一个更聪明的文本编码器——冻住权重,取最后一层特征喂给 DiT,MLLM 的自回归生成能力完全没被用到。BiVidGen 系统地拆了三个问题:中间表示该是什么、MLLM 怎么产出它、DiT 怎么吸收它,结论是离散语义视觉 token(EMA tokenizer 产出)作为接口最稳定,自回归因果建模是生成这些 token 的有效方式,而显式的视觉 token 条件化比改写提示词或隐空间桥接都更有效。这三条结论合起来等于说:MLLM 应该真的去「生成」一个视觉计划,而不是被动地提供特征。InstructVVT 在视频试衣这个具体任务上做了同样的事——它砍掉了对 mask、pose 这类手工空间先验的依赖,改由 MLLM 推断语义编辑 token 来做目标消歧和结构保持。这个转变的意义在于,手工先验在真实无约束视频里本来就容易失效,而且把丰富的视觉上下文压成了不完整的结构信号;让 MLLM 直接理解「要改什么」,信息通道宽得多。不过要注意,两篇都还没回答一个关键问题:MLLM 规划出错时,DiT 有没有能力纠正,还是会把错误的语义计划忠实地渲染出来。这个失败模式的分析在两篇里都缺失。 监督信号在变便宜:从「配对目标」退到「参考图 + 注意力对齐」 — CRAFT 这篇的数字值得单独拎出来看:主体个性化的主流做法要 15 万到 200 万组「参考图-合成目标」配对数据,而每一组目标都得靠 LLM 生提示词、T2I 合成、主体抠取、VLM 质检、对应关系标注这条多阶段流水线造出来,成本高,而且方法会被死死绑在某一个目标合成器和某一套数据清洗策略上。CRAFT 只用 1 万张参考图加主体 mask,完全不要合成目标,就在 XVerseBench 上做到了 SOTA。它的思路是把监督从像素空间挪到注意力空间——用注意力级奖励把噪声 token 和短语 token 的注意力对准正确的参考主体,再用得到的逐主体注意力 mask 去门控像素级身份奖励。往大了看,这跟 Concept Guidance 是同一个方向的两种表达:CoG 发现不同层对不同概念的贡献差异很大,于是通过跳过概念相关层来做引导,同样不需要额外训练、外部模型或梯度。两篇合起来提示一个判断——扩散模型内部其实已经有相当结构化的、按概念/主体组织的表示,过去我们花大钱造配对数据,某种程度上是在用外部监督重新教模型一些它内部已经编码好的东西。如果这个判断成立,个性化和可控生成的数据成本还有明显的下降空间。 人工智能炼丹君 整理 | 2026-08-18 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月18日
13 阅读
0 评论
0 点赞
1
...
3
4
5
...
7
粤ICP备2021042327号