AIGC 每日速读|2026-08-24|快手可灵证明奖励劫持源于流形漂移ThermoDPO

人工智能炼丹君
2026-08-24 / 0 评论 / 40 阅读 / 正在检测是否收录...

今日 AIGC 论文速览

今日共 10 篇 · 奖励对齐与偏好优化 1 篇 · 推理加速 1 篇 · 音频驱动与语音生成 3 篇 · 数字人与 4D 生成 1 篇 · 新视角合成 1 篇 · 视频身份保持 1 篇 · 设计与版式生成 1 篇 · 生成评测 1 篇

重点论文标题列表

  • ThermoDPO(西湖大学、浙江大学、快手可灵团队):奖励劫持的根因是流形漂移
  • AViTS(上海交通大学、阿里云终端智能计算部、山东大学、吉林大学、西安交通大学(ECCV 2026)):选对token省下9倍算力
  • SingDance(快手可灵团队、香港科技大学、清华大学):训练没见过的唱跳被组合出来
  • K5 声音克隆(Kandinsky Lab(俄罗斯莫斯科)):加一层线性层换来声音克隆
  • VoiceDesigner(约翰霍普金斯大学、Adobe Research):用文字描述设计并改写音色


今日论文速览

1. ThermoDPO:奖励劫持的根因是流形漂移

Manifold Drift in Flow Preference Optimization: A Root Cause of Reward Hacking | 西湖大学、浙江大学、快手可灵团队 | arXiv:2608.20011

关键词:流形漂移,偏好优化,流匹配,奖励劫持,DPO,快手可灵

  • 前序问题:偏好优化(DPO 那一套)已经是对齐生成模型的标准做法,但把它搬到流匹配这种连续时间动力学上并不是换个损失函数那么简单。流匹配的训练目标是学一个把噪声搬运到数据分布的速度场,而奖励驱动的更新会直接修改这条搬运轨迹——问题是,没有任何机制约束修改后的轨迹终点仍然落在预训练数据流形上。实践中这表现为大家熟悉的「奖励劫持」:打分器给的分越来越高,生成的图却越来越不像正常图片。此前的讨论多停留在现象描述和经验缓解(加 KL 惩罚、早停、混拒绝采样),没人说清这究竟是调参问题还是结构问题。
  • 本文贡献:作者把这个失效模式命名为流形漂移(manifold drift),并给出了它的判据。理论侧证明了两件事:最优的流匹配确实能恢复终点数据分布;而一次偏好更新只要其诱导的终点位移带有非零法向分量,采样支撑集就会离开预训练流形——也就是说漂移是偏好更新的结构性后果,不是训练不充分。对策是 ThermoDPO:一个带温度控制的目标函数,把成对偏好优化锚定在被偏好的样本上。这个设计有个漂亮的性质——在不同温度区间下,它分别退化为拒绝采样微调(RFT)和 FlowDPO,也就是说它把这两种此前被当作不同方法的做法统一在一条温度轴上,同时控制一个基于重建的逐点代理量来间接约束流形距离。低温时偏好信号会被削弱,作者又补了一个加权变体 ThermoDPO-weighted 来补偿。
流形漂移的几何直觉:FlowDPO 与 ThermoDPO 的轨迹对比
Core intuition of ThermoDPO. Flow Matching (gray) transports noise to the pretrained data manifold. FlowDPO (green) may reach preferred regions through an off-manifold displacement, whereas ThermoDPO (red) adds a winner-side anchor intended to keep the redirected mass closer to the pretrained manifold. The formal statements and their assumptions are summarized in tab:notation_theory_map; the behavior is evaluated in the toy study (Fig.) and real-image study (Fig.).
  • 实验效果:玩具基准上 ThermoDPO-weighted 的 StrictScore 达到 0.899,对比 FlowDPO 的 0.629 和 FlowDPO+RFT 的 0.857。真实模型上,在 SD3.5-M、CFG=4.5 的设定下,OCR 指标提升 47.5%,四项指标平均提升 16.0%。人工成对评测的结果更能说明问题:在文字准确性上 ThermoDPO 对 FlowDPO 的胜率是 40.0% 对 16.7%,视觉质量上对 FlowDPO 是 36.7% 对 6.7%——注意三个对比中「平局」的比例都在 46%~93% 之间,说明改进是稳定的方向性提升而非把生成结果整体改头换面。
ThermoDPO 对四个基线的人工成对偏好胜率
Pairwise human evaluation of ThermoDPO-weighted against different baselines on text accuracy and visual quality over 30 prompts. Each stacked bar reports the percentage of prompts for which ThermoDPO-weighted is preferred, tied, or dispreferred relative to the corresponding baseline. ThermoDPO-weighted shows consistently stronger performance on visual quality while remaining competitive on text accuracy.
  • 批判点评:这篇的贡献重心明确在理论刻画,实证部分则偏薄。主结果跑在玩具基准上,真实模型只验证了 SD3.5-M 单个骨干、且核心提升集中在 OCR 这一个指标上(47.5% 相对提升听起来大,但文字渲染是 SD3.5 的已知短板,基线本身偏低)。四项指标平均 16.0% 的提升没有拆开给出每一项,读者无法判断是均匀改善还是被 OCR 一项拉高。人工评测的样本量看柱状图应为 30 对,规模偏小。另外把 RFT 和 FlowDPO 统一到温度轴上是个优雅的结论,但也意味着 ThermoDPO 在实践中多了一个需要调的超参,而论文对温度如何选择只给了区间性的定性讨论。视频生成——快手可灵最关心的场景——完全没有实验。

2. AViTS:选对token省下9倍算力

AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation | 上海交通大学、阿里云终端智能计算部、山东大学、吉林大学、西安交通大学(ECCV 2026) | arXiv:2608.17995

关键词:token选择,动态分辨率,DiT加速,时空重要性,ECCV 2026,阿里云

  • 前序问题:扩散 Transformer 的成本来自迭代采样。一个已知的省法是动态分辨率:早期时间步在低分辨率下去噪,后期再升到高分辨率,因为早期主要确定构图、不需要细节。但现有做法在分辨率切换点会把所有 latent token 一起升采样,这里有两重浪费——很多 token 对应的是背景或平坦区域,根本不需要高分辨率计算;而统一升采样还可能损害细节一致性。已有的部分升采样策略要么只看局部 latent 的结构线索,要么只用单步统计量,两者都难以同时刻画「token 与文本的语义相关性」和「token 表示在扩散步之间的动态变化」。
  • 本文贡献:AViTS 把「该给哪个 token 升分辨率」建模成一个时空重要性问题,两个信号分开算再融合。空间重要性来自 latent 与文本的注意力:把自注意力的 Query 与文本 Key 的注意力图沿头维度平均,得到每个 token 的空间分数,语义上与 prompt 更相关的 token 分数更高。时间重要性来自 token 级特征在扩散时间步之间的方差——变化剧烈说明这个位置还没收敛、仍在被主动塑形。两者融合后做重要性感知的选择性升采样:关键 token 优先精化分辨率,次要 token 延后处理,从而砍掉冗余的高分辨率计算。整个方法不需要重训模型。
AViTS 的三阶段选择性升采样与双重要性打分
Overview of AViTS and spatiotemporal importance estimation. (a) Three-stage dynamic-resolution sampling: Stage~1 low-res denoising with signal collection over the last $N_T$ steps, Stage~2 selective upsampling of top-$K$ tokens, and Stage~3 full-res refinement. (b) Temporal importance from token-wise step variance across the collected snapshots. (c) Spatial importance from aggregated latent--text cross-attention (averaged over heads/blocks and collection steps); fused scores guide prioritization.
  • 实验效果:FLUX 上最高 6.34 倍加速;Qwen-Image-Edit 和 FLUX.1-Kontext-dev 上接近 9 倍 FLOPs 削减;叠加蒸馏模型后达到 14.76 倍。作者强调该方法与蒸馏、量化、特征缓存三条主流加速路线正交,可以叠乘。图像编辑任务上的定性对比给出的是 5.24 倍加速档位(这一档下与 Ralu 的 4.55 倍、ToCa 的 3.59 倍、TaylorSeer 的 5.00 倍同台):三组编辑指令中 AViTS 的结果与原始 1.00 倍输出最接近,而同倍率的 TaylorSeer 出现了明显的材质与结构偏移(陶瓷羊的例子里羊的形态直接变了)。
图像编辑任务上同倍率加速方法的画质对比
Qualitative comparison on GEdit-Bench with Qwen-Image-Edit. AViTS achieves superior semantic preservation and visual quality at a higher acceleration ratio (5.24$\times$) compared to state-of-the-art baselines.
  • 批判点评:加速比的报法需要读者留心:摘要里的「近 9 倍」和「14.76 倍」是 FLOPs 削减,而定性图里用来跟同类方法比画质的是 5.24 倍这一档——FLOPs 削减与实际墙钟加速之间通常有不小的落差,尤其是这套方法引入了额外的注意力统计与 token 选择开销,论文摘要没有给出对应的实测延迟。另外空间重要性依赖 latent-text 注意力,这对文本条件较弱或无文本条件(如纯图像编辑的结构保持部分、无分类器引导关闭时)的场景是否还成立,需要更多验证。方法本身只作用于「动态分辨率采样」这个前提之上,如果模型本来不走 coarse-to-fine,收益无从谈起。

3. SingDance:训练没见过的唱跳被组合出来

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning | 快手可灵团队、香港科技大学、清华大学 | arXiv:2608.16220

关键词:唱跳视频,组合零样本,角色条件,音频注入,快手可灵

  • 前序问题:给定一张参考图、一段文本和一条音轨生成个性化舞蹈视频,需要模型把音乐映射到身体动作。但「边唱边跳」多了一个要求:画面里的人不仅要跟上节拍,嘴还得对上歌词。现有方法在这里正好分成两个互不搭界的阵营——音乐驱动的方法只管编舞,不管口型;语音驱动的方法则默认画面里的人就是发声者,从没考虑过「跳舞的人同时在唱这首歌」这种组合。而直接收集「唱跳」配对数据成本极高。
  • 本文贡献:SingDance 的核心设计是把「是否发声」抽象成一个语义角色:画面主体要么是 source(声音由他发出),要么是 listener(声音来自画外的另一个人)。这样一来,「对口型」就不再绑定在语音这个模态上,而变成一个可以被显式切换的条件。架构上用硬路由(hard-compact routing)从语音、音乐、角色三路条件里挑出与当前任务相关的部分,再通过逐帧的联合音频注入送进 DiT 块——关键是 source 和 listener 共享同一条语音通路,这保证了两种角色下的表征是可比的。训练用非对称监督:屏幕内说话的视频与精心筛选的画外对话回应视频负责建立角色控制,纯器乐和歌曲伴舞视频负责建立音乐驱动的身体动作。真正巧妙的是目标配置 Song/Source(发声者在唱歌)在训练中从未出现过——推理时把 source 角色指派给一首歌,就把分别学到的「发声」和「随歌跳舞」两种能力组合出来了,实现组合零样本。
SingDance 的角色感知音频条件注入架构
Training architecture of SingDance. The first video frame is separately encoded as a clean reference latent, while subsequent frames are temporally compressed and noised in latent space. Wav2Vec~2.0 and MuQ features, together with the vocal-role condition, are selected by hard-compact routing and supplied to frame-wise joint audio injection. The repeated block is schematic: joint audio injection is applied immediately after each of 10 selected blocks in the 30-block DiT backbone. The denoised latents are decoded into output frames. Snowflakes and flames denote frozen and trainable modules, respectively.
  • 实验效果:实验显示强的动作-节拍对齐与视觉保真度,口型同步与最强的语音驱动基线高度竞争,但生成时参数量显著更少。角色切换的效果在定性图里最直观:同一段视频在 Lip-on 和 Lip-off 两种设定下,人物的身体动作与背景几乎完全一致(帧号相同),差别只在嘴部——Lip-on 时嘴张开在发声,Lip-off 时嘴闭合,说明发声控制被干净地从身体运动中解耦出来,切换一个条件不会牵动其他部分。
同帧下发声控制的开关对照:身体动作不受影响
Qualitative paired vocal-role switching on two SingDance examples. Each Lip-on/Lip-off pair shares all role-independent inputs and inference settings; only the vocal role changes.
  • 批判点评:论文只有 9 页 5 图,实验体量偏小,且摘要中的结论多为定性表述(「强的对齐」「高度竞争」),缺少可对照的绝对数字——口型同步到底是 Sync-C 多少、跟哪个基线差多少,需要读正文才能确认。组合零样本是个漂亮的设定,但它成立的前提是「发声」与「音乐驱动运动」这两种能力在表征上足够独立;一旦歌曲的节奏与歌词的发音在时间上强耦合(比如快嘴 rap),这种解耦假设是否还站得住是个开放问题,而这恰恰是唱跳场景里最难的一类。另外角色只有 source/listener 两档,多人同框、轮唱、和声这类真实短视频里常见的情形不在建模范围内。

4. K5 声音克隆:加一层线性层换来声音克隆

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer | Kandinsky Lab(俄罗斯莫斯科) | arXiv:2608.15690

关键词:声音克隆,文生音视频,零初始化,T2AV,Kandinsky

  • 前序问题:文生音视频(T2AV)模型能从一段文字同时生成画面和配乐配音,但没有任何机制控制「说话的是谁」——你要一个特定音色,只能碰运气。给这类模型加声音克隆的常规思路是接一个说话人编码器、改架构、重训,代价不小,而且改动大了容易伤到已有的音视频生成能力。
  • 本文贡献:作者给出的是一个近乎最小的改法:在音频主干上加一个零初始化的线性层,短周期微调,推理时给一段短参考录音即可。零初始化是关键——增强后的模型在训练开始时就是原模型的一个功能副本,不会破坏已有能力,这个思路和 ControlNet 的零卷积同源。参考信息通过两路互补信号注入:一是把参考音频的扩散 latent 拼接(prepend)到音频流前面,提供细粒度的时序音色信息;二是用一个全局说话人嵌入去调制目标音频的 token,提供说话人层面的整体约束。方法在自家两个模型上验证:K5(5B)和 K5-lite(0.6B),底座是开源 Kandinsky 5.0 的 CrossDiT 架构——音频与视频两条流各自做自注意力,再在每个融合块内通过跨模态注意力交互,文本条件由两条流共享。
方法框架图
  • 实验效果:在 30 个说话人、674 条说话人-文本配对的基准上,对比五个强声音克隆 TTS 基线(含 XTTS-v2、IndexTTS2、NAVA 等),增强后的 5B 模型在三个独立验证网络(ECAPA-TDNN、WavLM-SV、Resemblyzer)上都取得最高的说话人编码器余弦相似度 SECS,且相对每一个基线都具备统计显著性。架构上还有个意外收获:因为音频路径可以独立评估,推理时能只跑音频、跳过整个音视频扩散循环,带来约 30 倍加速,而声音克隆行为不受影响。
  • 批判点评:评测口径偏窄是最明显的问题:主指标只有说话人相似度 SECS 一项,而声音克隆的质量至少还要看可懂度(WER)和自然度(MOS)——只优化相似度很容易换来音质或发音的退化,论文摘要里没有给出这两项与基线的对照。基准规模也不大(30 个说话人),且没有说明是否覆盖跨语言、口音、非常规音色这些真正考验泛化的情形。30 倍加速的说法需要正确理解:它是「只跑音频路径 vs 跑完整音视频循环」的对比,本质上是省掉了视频生成,而不是音频生成本身变快了——对于真正需要音视频一起出的场景,这个加速并不存在。另外整套方法绑定在自家 Kandinsky 5.0 底座上,对其他 T2AV 架构的可迁移性未验证。

5. VoiceDesigner:用文字描述设计并改写音色

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation | 约翰霍普金斯大学、Adobe Research | arXiv:2608.13613

关键词:文生音色,语音编辑,统一扩散,数据增强,Adobe

  • 前序问题:文生音色(TTV)让人可以用一段文字描述直接合成对应的嗓音,这在配音、游戏角色、有声书里价值很高。但现有系统卡在两处:一是音色多样性不足,尤其是虚构角色(怪物、机器人、卡通形象)这类现实中不存在的嗓音,模型基本合成不出来——因为训练数据里就没有;二是缺乏鲁棒且灵活的编辑能力,比如按参考音克隆、或者只改情绪和语气而保持音色。
  • 本文贡献:两条线同时下手。数据侧做了一个混合流水线:用数字信号处理手段(变调、共振峰变换、时域拉伸这类)配合语音生成模型,人工构造出覆盖真实人声与虚构角色的多样音色数据集——本质上是用增强绕开「虚构嗓音没有真实录音」这个死结。模型侧提出 VoiceDesigner,一个统一处理生成与编辑的扩散 Transformer。架构上四路输入各配一个 Local-DiT 前端:参考音频与目标音频走 VAE 编码器,指令走语言模型,转写文本走 tokenizer,四路 token 拼接后过共享的 DiT 块栈。DiT 块内部用 RMS-Norm 加 Scale/Gate 的调制结构(自注意力和前馈各一组),条件通过调制系数注入。另配一个时长预测器先定长度,再由 DiT 从噪声 latent 出发去噪、VAE 解码出波形。这样生成(无参考音)与编辑(有参考音)就是同一套权重下的不同输入配置。
VoiceDesigner 的四路条件统一 DiT 架构
An overview of framework design of VoiceDesigner.
  • 实验效果:主客观评测显示,VoiceDesigner 在与音色描述和编辑指令的对齐度(prompt alignment)上优于当前最好的 TTV 模型,同时在感知质量与音色可用性上保持竞争力。架构消融给出的证据比较扎实:作者按条件注入位置分 Early / Early-Mid / Late-Mid / Late 四档对比三代架构,最终版 VD-DiT-v3 在声音克隆相似度 SIM-o 上于所有四档都稳定最高(约 0.58),而基线 CapSpeech-NAR 在 Early 档的 WER 高达 0.76、Early-Mid 档 0.20,v3 则把 WER 压在 0.04 附近——说明架构改进的收益主要来自把条件注入做得更鲁棒,而非单纯堆容量。
三代架构在四档条件注入位置上的消融对比
Ablation study on the model architecture.
  • 批判点评:「优于 SOTA 的 prompt 对齐、竞争力的感知质量」这个表述值得警惕:竞争力通常意味着没有更好。也就是说这套方法换来的是描述控制力,代价可能是音质并未提升。虚构音色靠 DSP 增强构造是个务实的工程解,但增强出来的样本与真实录音在统计上必然有差异——模型学到的「怪物嗓音」有多大程度是在拟合变调伪影而非真正的音色概念,论文没有正面回答,而这直接决定了它在真实创作中够不够用。消融图里 SIM-o 最高约 0.58 这个绝对水平在声音克隆任务里并不算高(专门做克隆的系统通常更高),说明统一模型在克隆这一子任务上确实付了代价。另外情绪、语气这类编辑属性的评测只提到 Style-Acc 一个指标,粒度较粗。

6. AvatarDynamizer:静态数字人补上衣服褶皱

AvatarDynamizer: From Static to Dynamic Human Avatars via Generative Dynamic Textures | 马普信息学研究所、VIA Research Center、EPFL | arXiv:2608.19900

关键词:4D数字人,动态纹理,3D高斯,视频扩散先验,马普所

  • 前序问题:全身数字人要跨过恐怖谷,表面动态是关键——衣服的褶皱、布料的甩动,这些细节缺失时人眼立刻觉得假。但现有两条路各有硬伤:通用方法能从单张图、单目视频或文本提示重建静态 3D 数字人,可它们的动画是骨骼驱动的,衣服跟着骨头刚性变形,没有真实的表面动态;专用方法(为单个人训一套)渲染质量和动态都好,代价是每个人都要一套昂贵的多视角采集。近期的通用动态方法则难以把表面动态嵌进表示里,结果要么多视角不一致,要么动态表现力不足。
  • 本文贡献:核心想法是把「数字人的表面动态」转成「纹理生成问题」,从而可以直接借用预训练视频扩散模型的先验。具体做法:设计一个纹理空间的表面动态嵌入,用编码器-解码器把姿态相关的动态编码进动态纹理图(dynamic texture map)——纹理图是二维的,天然与视频扩散模型的输入格式兼容;解码时再把纹理解成 3D 高斯,由高斯渲染器出图,多视角一致性因此得到保证。整条流水线的输入端很宽:多视角图、单目图、单目视频、文本提示、随机采样、3D 扫描都能作为静态数字人来源,经身份拟合得到身份纹理,再与用户指定动作产生的运动纹理一起送进动态纹理生成器,最后由通用高斯解码器渲染出自由视角结果。由于现有数据集在规模、序列长度或动作多样性上都不够,作者还自采了一个大规模多视角长序列数据集。
AvatarDynamizer 的三段式流程:编解码、生成器训练与动态化推理
Overview. Given a static human avatar reconstructed from multimodal inputs, e.g. multi-view images, we first perform identity fitting to obtain its coarse shape and identity texture. Our Dynamic Texture Generator predicts dynamic texture maps conditioned on identity and novel pose. Then, our Generalized Gaussian Decoder recovers Gaussian splats for faithful and view-consistent renderings.
  • 实验效果:实验表明该方法能给静态数字人赋予可信的表面动态,在视觉保真度上优于同类通用方法,尤其在动态训练数据有限时优势更明显。定性对比图给出的证据比较清楚:以 LHM 和 MV 两种静态数字人来源为起点,逐行对比 Static Avatar、+GAS、+VAP 与 +Ours——前三者在胸前印花和裤腿区域(图中红框)都出现了纹理糊掉或褶皱缺失,本方法(绿框)则保留了印花细节并给出了随姿态变化的布料褶皱,与 GT 行的表现最接近。
两种静态数字人来源下的逐行方法对比
Qualitative Comparison on DynaHuman. Given a static avatar reconstructed from a monocular image using LHM or from multi-view images (MV), we compare our method with state-of-the-art generalizable surface dynamics methods. Our AvatarDynamizer produces faithful wrinkles while preserving both 3D geometry and identity consistency.
  • 批判点评:把动态压进纹理空间是个聪明的降维,但它同时划定了能力边界:纹理是贴在几何表面上的,因此这套方法能表达「表面看起来在动」,却难以表达真正需要几何位移的动态——宽松裙摆的大幅甩动、外套的开合、长发的飘动,这些超出纹理可表达范围的情形论文没有讨论。「优于同类通用方法」的对照对象是通用方法,而质量天花板仍是专用方法(per-subject 训练),两者的差距有多大摘要没有交代。另外方法依赖自采的大规模多视角数据集才训得起来,这与「通用、低成本」的初衷之间存在张力——数据成本从推理侧转移到了训练侧,对复现者不算友好。

7. GenRec:该重建的别幻觉该幻觉的别糊

GenRec: Knowing Where to Reconstruct and Where to Generate | 苏黎世联邦理工、Google、Microsoft、KAIST | arXiv:2608.17832

关键词:新视角合成,流匹配,观测掩码,重建与生成分区,ETH

  • 前序问题:从稀疏输入图做生成式新视角合成,本质上是两个性质完全不同的任务混在一起:在某个源视图里可见的像素有唯一正确的值(只受视角相关的着色调制),而落在遮挡区或超出拍摄范围的像素则允许一整个分布的合理补全。现有方法用一个统一的损失同时处理这两种情形,结果是几何保真与创造性幻觉的界限被抹平——即便通过 warp 的点云或投影深度把场景几何注入进去,可见区域该被精确重建的地方也会被生成先验带糊。
  • 本文贡献:GenRec 的做法是把这个分区直接写进架构、监督和梯度流三处。首先由源相机加一个单目深度估计器导出观测掩码(observation mask),明确标出哪些像素是「被看到过的」。主干是一个多视角流匹配模型,同时对 RGB 和场景坐标图(scene-coordinate map)在所有目标视图上联合去噪——两个模态各有编码器,通过跨视角注意力与跨模态注意力交互,解码侧接 LoRA。然后是一个像素空间的精化阶段(重建分支),用稀疏 3D 交叉注意力与自注意力,专门在已观测像素上恢复被 latent 压缩丢掉的高频细节,且不扰动未观测区域的生成先验。关键在于同一个掩码还用来门控监督信号——回归损失被限制在观测区域内,不会污染生成先验;反过来生成损失也不会去干扰该被精确重建的部分。
GenRec 的双模态流匹配主干与重建精化分支
Overview of GenRec. Given posed input views and target poses, monocular depth and forward warping produce per-target observation masks and warped renders. These condition a (I) multi-view flow matching backbone, which jointly denoises RGB and scene-coordinate latents through cross-view and cross-modal attention. A (II) reconstruction branch then refines only the observed pixels via sparse 3D attention guided by the predicted scene coordinates, while the observation mask gates gradients so the generative prior is preserved in unobserved regions.
  • 实验效果:在 RealEstate10K、DL3DV-10K、Mip-NeRF 360 三个数据集上,单视图外推与双视图插值两种设定下,GenRec 在观测区域取得最好的重建保真度,同时在未观测区域的感知质量上超过纯生成式基线——也就是说没有用一头的退化去换另一头。定性对比中与 Gen3C 的差别很明显:Gen3C 的结果在家具边缘、地面纹理上出现明显的糊化与结构漂移(教室场景的桌椅、客厅场景的家具轮廓都有溶解感),GenRec 则保持了清晰的边界与合理的几何。论文还特意把重建指标分观测/未观测区域分别汇报,而非只给全图平均——这个报法比现有工作更诚实。
GenRec 与 Gen3C 在五个场景上的新视角合成对比
Comparative qualitative results. Single-view extrapolation against our strongest baseline, Gen3C. Each row shows the input view, ground-truth target, GenRec, and Gen3C.
  • 批判点评:整套方案的正确性建立在观测掩码的准确性上,而掩码来自单目深度估计器——深度估计在无纹理区、反射面、细结构上的失效是众所周知的,一旦掩码把「其实没看清」的像素标成已观测,回归损失就会强行去拟合一个错误的目标,这类失效模式论文没有展开分析。方法把两条支路、两个模态、两套损失叠在一起,复杂度不低(流匹配主干 + 稀疏 3D 注意力精化 + LoRA),推理开销与训练成本相对单一模型的对照没有交代。评测集中在室内场景为主的三个数据集上,大尺度室外、动态物体等情形未涉及。

8. KeyID:免训练把身份注入到关键帧

KeyID: Decoupled Drafting and Keyframe Editing for Identity-Preserving Video Generation | 广东工业大学(ACM MM 2026) | arXiv:2608.16154

关键词:身份保持,视频生成,免训练,关键帧编辑,ACM MM 2026

  • 前序问题:身份保持视频生成(IPVG)要求合成的视频既忠于参考主体的长相,又贴合文本提示。现有方法两头受限:一类靠微调,调参成本高;一类只在输入层做增强,能力有限。共同的困难是在复杂、长序列动作中维持刚性的身份一致——人一动起来,脸就开始漂。更本质的矛盾是「提示遵循」与「身份保真」之间存在容量冲突:模型的表达能力被两个目标同时争夺,密集的逐帧身份监督会压制动作的自由度。
  • 本文贡献:KeyID 是一个免训练框架,思路是把视频动态的合成与身份的注入彻底解耦成两步。第一步 Reference-Aware Video Generation:先用大语言模型把全局提示扩写成带细节的增强提示,经 T2I 出首帧、ImgEdit 编辑、再由 I2V 展开成视频草稿(并有 Prompt Relay 机制传递时序提示)——注意这个草稿是身份无关(identity-agnostic)的,只对齐多个参考的粗略属性,因此动作可以放开生成。第二步 Identity-Preserved Keyframe Editing:对草稿做分组帧采样挑出关键帧,只在这些稀疏关键帧上做身份修正,再通过运动插值把修正传播到中间帧。从密集的帧级监督换成稀疏的关键帧级精化,容量冲突就被绕开了。模块化设计还带来一个好处:扩展到多主体参考和复杂连续动作不需要额外训练。
KeyID 的两阶段解耦流程:草稿生成与关键帧身份修正
Overview of KeyID. (a) Reference-Aware Video Generation. A global prompt, optional temporal prompts, and a face reference are fused by GPT-5 into an enhanced prompt, from which a first frame is generated and optionally edited with non-human objects. The edited frame and the global prompt, along with optional temporal prompts, drive I2V to produce a video draft. (b) Identity Preserved Keyframe Editing. Keyframe windows are uniformly sampled in groups along the video draft, optimal keyframes are selected in keyframe identity refinement, and motion interpolation produces the final temporally coherent video with preserved identity and prompt adherence.
  • 实验效果:自动与人工评测均优于此前工作,并在 ACM Multimedia 2026 IPVG 大挑战赛 Track 2(Sequential Action)中拿到亚军。定性对比里与 Concat-ID、Stand-In 的差距集中在长序列动作上:跑步、足球、医院三组场景中,两个基线在人物快速移动时脸部出现明显变形与身份漂移(足球场景里 Stand-In 的人物在远景中几乎不可辨识),KeyID 则在整段动作里保持了一致的面部特征,同时动作幅度与场景细节(跑道、球场、走廊)都没有被压制。
三组长序列动作下与 Concat-ID、Stand-In 的身份一致性对比
Qualitative comparison. Four evenly sampled frames are shown for each video. KeyID better preserves identity consistency and prompt adherence across complex actions.
  • 批判点评:免训练是真实优势,但这套流水线的代价是把复杂度转移到了推理链上——LLM 扩写、T2I、ImgEdit、I2V、关键帧编辑、运动插值,六个环节串联,每一环的失败都会传导下去,且整体延迟必然远高于单模型端到端方案,论文没有给出推理成本的量化。稀疏关键帧修正加运动插值的组合在动作平滑时应该工作良好,但在快速非线性运动、遮挡后重现这类情形下,插值能否维持身份一致性是个疑问——而这恰恰是 Track 2「连续动作」最难的部分。竞赛拿的是亚军而非冠军,说明方法仍有明显差距。评测依托竞赛官方基准,跨基准的泛化性未验证。

9. Mise-en-Scène:版式不用预测而是自己长出来

Mise-en-Scène: Implicit Layout Emergence in Diffusion Transformers for Human-AI Design Co-Creation | Canva Research(ECCV Human-AI Co-Creation Workshop 最佳论文) | arXiv:2608.19000

关键词:版式生成,平面设计,隐式布局,LoRA,Canva

  • 前序问题:从用户给定的素材自动做平面设计,要同时满足两件互相拉扯的事:整体构图协调,以及每个素材被精确保留(logo 不能变形、文字不能糊)。现有做法是先用语言模型预测显式的边界框坐标,再把素材贴进去。这种「先规划再合成」的分离带来两个后果:布局与视觉呈现脱钩,生成的构图往往僵硬、缩放失当;而且产物是一张扁平的图,设计师没法继续改。
  • 本文贡献:作者换了个问法:布局能不能在一个预训练的图像编辑扩散 Transformer 内部隐式地涌现出来?两阶段实现。第一阶段用一个经过 knockout 筛选的小 LoRA 适配预训练 DiT,让它直接起草一份完整设计——元素的排布与渲染出的画布是联合涌现的,而不是先定坐标再填充。输入侧文本简述过文本编码器,背景图与各个元素分别过冻结的 VAE,所有 token 拼接后进 DiT 块栈。草稿里的文字和 logo 会有可见的失真,但位置关系是对的。第二阶段是确定性的 match-and-place:借一个 VLM grounder 逐个定位草稿中的元素位置,再把原始高分辨率素材搬到对应位置——这一步保证了素材的像素级保真,且产物是可编辑的分层设计而非扁平图,设计师能接着改。作者特别强调,对预训练 Transformer 做最小适配就够了,不需要多元素生成任务里常见的那套专门的条件注入机制。
Mise-en-Scène 的两阶段流程:隐式版式起草与确定性素材归位
Mise-en-Sc`ene. The method runs in two stages. In Stage~1 (simplified layout generation), a text brief, a background canvas, and the visual elements are mapped by frozen encoders into a joint token sequence and processed by a flow-matching Diffusion Transformer adapted only through a knockout-selected LoRA, which produces a layout-aware draft design. Because the draft comes from stochastic sampling, it still contains rendering artifacts such as distorted text and warped logos. In Stage~2 (deterministic match-and-place), a VLM grounder locates each original element in the draft independently, and the original high-resolution layers are alpha-composited at the grounded boxes to yield the final design, which keeps the emergent layout while restoring exact, pixel-faithful, editable assets.
  • 实验效果:在大规模 PrismLayersPlus 基准上,Mise-en-Scène 生成的设计在感知质量上最接近真值,且大幅领先 LLM 版式规划器与专用版式 Transformer 两类方法;match-and-place 阶段把剩余的保真度差距也补到了接近真值合成图的水平。消融数据佐证了第二阶段的必要性:直接对扩散草稿而非 match-and-place 合成结果打分,会让 Qwen3-VL 上的美学保真度差距 |ΔGT| 从 0.046 恶化到 0.248。定性对比中与 FlexDM、LaDeCo 的差别很直观——两个基线普遍把元素缩得过小或叠在一起(FlexDM 尤其明显,文字常糊成一团),本方法的排布则接近 GT 的构图逻辑。
十组设计任务上与 FlexDM、LaDeCo 及真值的对比
Qualitative comparison on the PrismLayersPlus test set. Each row shows, from left to right, the input design elements provided without spatial context, followed by the composites from FlexDM, LaDeCo, our Mise-en-Sc`ene, and the ground truth. Every method is rendered from its own predicted layout; our column is the match-and-place output. Our designs follow the ground-truth arrangement most closely; see text for a per-row discussion.
  • 批判点评:第二阶段能保证素材保真,但它同时暴露了第一阶段的局限:草稿里文字和 logo 是失真的(框架图里明确标注了 text distortion、brand/logo distortion、detail inconsistency 三类问题),也就是说 DiT 学到的其实是「大致该放哪」而非真正理解了排版规则,match-and-place 是必要的补丁而非可选增强——一旦草稿里某个元素的位置判断错了,第二阶段只会把原始素材精确地搬到一个错误的位置上。评测的主指标是与真值的感知接近度,这个口径隐含假设了 PrismLayersPlus 的真值就是好设计,但平面设计本身允许多解,「接近真值」和「设计得好」并不等价,而论文没有人工设计师的偏好评测。另外基准单一,元素数量、语种、画布比例的覆盖范围未交代。

10. BeyondMasks:删掉物体也要删掉它的影子

BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal | Bilkent 大学、Koç 大学、Hacettepe 大学(ECCV 2026) | arXiv:2608.20107

关键词:视频物体移除,因果一致性,评测基准,VLM评测,ECCV 2026

  • 前序问题:生成式视频模型让物体移除的视觉真实度大幅提升,但评测协议还停在「掩码区域像素保真度」上,本质上把移除当成了局部修补。现实场景里移除一个物体是一次因果干预:抹掉物体本身之外,它引起的物理效应——影子、反光、光照变化、半透明遮挡、以及运动留下的痕迹——也必须一并消除。而这些效应恰恰落在掩码之外,现有指标完全看不到。现有基准要么没有对齐的干净参考,要么局限于简化的合成设定,无法系统评估因果一致性。
  • 本文贡献:BeyondMasks 是一个配对基准:提供时序对齐的合成与真实视频对,每对都带干净背景参考。构造方式是反向的——先有干净背景,再插入物体与其应有的效应,从而天然拿到对齐的「移除前/移除后」真值:合成侧用 Veo 3 生成背景视频再插入物体与效应(90 条),真实侧用三脚架实拍背景再通过受控编辑引入目标物体(90 条)。数据覆盖光度、几何、体积、动态四类交互,标注上刻意只给「物体本体」的二值掩码而不标注次生效应,逼模型自己去推理该消除什么。作者还整理了次生效应的分类体系并给出各类样本数(影子 127、反光 61、半透明 46、水汽 20、光源 38、随意痕迹 37)。配套提出 CORE,一个基于视觉语言模型的结构化评测协议,同时度量物体消失程度与次生效应一致性,与人类判断的吻合度高于现有指标。
BeyondMasks 的配对数据构造与次生效应分类体系
Overview of the BeyondMasks construction pipeline. Top: Paired intervention-based generation, where an object-present video is derived from a clean background video, ensuring temporal alignment. Bottom: Representative categories of object-induced causal after-effects, including illumination, reflection, volumetric, and dynamic interaction effects.
  • 实验效果:对当前最好的方法做基准测试后暴露出系统性失效:掩码区域保真度很高,但次生效应普遍没被移除——视觉上的合理性与因果上的正确性之间存在明确的鸿沟。定性结果把这个鸿沟量化得很清楚:三组场景(结冰湖面的倒影、木板上的杯子阴影、路面上的瓶子与其投影)里,ProPainter 与 Minimax 的 LPIPS 分数与最好的方法几乎持平(0.065~0.098 区间,差异极小),但 CORE 的两项打分差距明显——ProPainter 的 CORE-AES 只有 1~2 分,Rose 能到 4~5 分;肉眼看图也能确认前两者留下了明显的残影与阴影残迹。也就是说 LPIPS 这类指标对次生效应几乎不敏感,换个指标才能把差距照出来。
LPIPS 几乎无差别而 CORE 打分拉开差距
Pixel metrics fail to capture causal correctness. Although LPIPS scores are similar across methods, their ability to remove object-induced effects (e.g. shadows or reflections) differs substantially. CORE separates these failure modes by evaluating object removal (CORE-OS) and elimination of causal after-effects (CORE-AES). $\downarrow$ better for LPIPS; $\uparrow$ better for CORE scores.
  • 批判点评:180 条视频(合成 90 + 真实 90)的规模对一个基准来说偏小,各效应类别的样本数更少(水汽只有 20 条),据此得出的类别级结论统计强度有限。合成侧用 Veo 3 生成背景再插入物体,这引入了一层生成模型自身的偏置——被评测的方法与构造数据的模型属于同一技术谱系,是否存在系统性的相互适配值得警惕。CORE 依赖 VLM 打分,而 VLM 对影子、反光这类细微物理线索的敏感度本身就是个未知量,论文虽报告了与人类判断的吻合度更高,但「更高」的基线是本就不敏感的 LPIPS,这个对照并不严格;用 VLM 评测生成结果也天然继承了 VLM 的失效模式。作为纯评测工作,它指出了问题却没有给出改进移除方法的方向。

趋势观察

  1. 奖励对齐的失效终于被写成了数学 — 过去一年大家都在抱怨「奖励劫持」:模型学会了讨好打分器,图却越来越怪。今天快手可灵与西湖大学合作的 ThermoDPO 第一次把这件事在流匹配框架里形式化了——他们定义了「流形漂移」(manifold drift)这个概念,并证明只要偏好更新引起的终点位移带有非零法向分量,采样结果就必然离开预训练数据流形。换句话说,奖励劫持不是调参没调好,而是把 DPO 直接搬到连续时间动力学上时的结构性后果。这个视角的价值在于它把一个玄学问题变成了可度量的量:论文用「重建距离」作为流形距离的代理,于是「有没有漂移」可以被直接监控,而不是等到生成结果看起来不对才回头查。今天另一篇 BeyondMasks 走的是同一条路的另一半——它说视频物体移除的评测一直在算掩码区域的像素误差,可现实中删掉一个物体还要删掉它的影子、反光和水汽,这些恰恰落在掩码之外。两篇论文一个从理论、一个从评测,指向同一件事:生成模型的对齐问题正在从「效果好不好」进入「我们究竟在优化什么」的阶段。
  2. 加速的粒度从「步」下探到「token」 — 扩散模型加速的主流路线过去是减步数(蒸馏)、缓存特征(TeaCache 一类)、或者降精度(量化)。上交与阿里云的 AViTS 在今天给出了一个正交的第四条:动态分辨率采样时,不要把所有 latent token 一起升采样。它用「latent 与文本的注意力」度量空间重要性、用「token 特征跨时间步的变化量」度量时间重要性,融合后只对关键 token 优先做分辨率精化,其余延后。在 Qwen-Image-Edit 和 FLUX.1-Kontext-dev 上拿到接近 9 倍 FLOPs 削减,叠加蒸馏模型后到 14.76 倍。值得注意的是作者明确强调这条路与蒸馏、量化、特征缓存正交——这意味着推理加速正在从「选一条路线」变成「几条路线叠乘」,而叠乘的前提是每条路线作用在不同的冗余维度上。AViTS 挖的是空间分辨率这一维,此前基本没人系统做过。
  3. 音频侧的改造正在变得越来越「轻」 — 今天有三篇论文都在音频生成上,但共同点不是模型更大,而是改动更小。Kandinsky Lab 的做法最极端:给一个文生音视频模型加声音克隆能力,只需在音频主干上加一个零初始化的线性层,短周期微调即可,且因为零初始化,增强后的模型起点就是原模型的功能副本,不破坏已有能力。副产品是推理时可以只跑音频路径而跳过视频路径,拿到约 30 倍加速。快手可灵的 SingDance 也是类似哲学——它没有为「唱跳」这个新任务收集数据(Song/Source 这个目标配置在训练时从未出现过),而是把发声主体建模成一个语义角色(source 或 listener),让训练时分别学到的「发声」与「随歌跳舞」两种能力在推理时组合起来。这种「靠结构设计换数据」的思路在数据获取越来越贵的今天格外有价值。

人工智能炼丹君 整理 | 2026-08-24


更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」

每日更新 · 论文精选 · 深度解读 · 技术脉络

微信搜索 人工智能炼丹君 或扫描下方二维码关注

扫码关注「人工智能炼丹君」

0

评论 (0)

取消
粤ICP备2021042327号