AIGC 每日速读|2026-08-26|京东开源世界模型边走边生720p视听EchoWM

人工智能炼丹君
2026-08-26 / 0 评论 / 21 阅读 / 正在检测是否收录...

今日 AIGC 论文速览

今日共 10 篇 · 交互式世界模型 1 篇 · 视频生成与编辑统一 2 篇 · 3D 渲染修复与新视角合成 2 篇 · 生成理解一体化 1 篇 · 图像编辑与强化学习 1 篇 · 数字人压缩 1 篇 · 生成评测与审计 2 篇

重点论文标题列表

  • EchoWM(京东 Joy Future Academy、港科大、北大、清华、港大、中科大、复旦、北航、斯坦福大学):导航即生成的720p视听世界模型
  • EditStream(Adobe Research、罗切斯特大学):六任务一模型的少步流式视频编辑
  • FixAnything(卡内基梅隆大学 (CMU)):一个视频先验修四种3D表示
  • Loopy(天津大学、香港理工大学、腾讯):锚定层位置编码把时间轴掰成圆
  • Object-Uni(中科院自动化所、国科大、清华大学、蚂蚁集团):物体位姿当显式变量贯通理解生成


今日论文速览

1. EchoWM:导航即生成的720p视听世界模型

EchoWM: Open and Enterable Omnimodal World Models | 京东 Joy Future Academy、港科大、北大、清华、港大、中科大、复旦、北航、斯坦福大学 | arXiv:2608.23189

关键词:世界模型,全模态生成,相机意图,6-DoF轨迹控制,音视频同步,自回归后训练,京东

  • 前序问题:现有的世界模型基本都停在「视频生成器 + 一个控制信号」的形态上,有三处结构性缺口。第一是模态不全:绝大多数只出画面,声音要么完全没有,要么靠后期单独配一条音轨,长时程下环境声、音乐、语音与画面的同步无从保证。第二是控制接口碎片化:第一人称场景(相机就是观察者)和第三人称场景(相机与角色各动一套)通常需要各训一个视角专用控制器,两套接口在数据、训练和推理上都无法复用,用户切换视角等于换一个模型。第三是运动幅度不可比:不同来源的数据(游戏录屏、第一人称采集、影视素材)标注的相机运动尺度天差地别,直接混训会让模型学到一个平均化、无物理尺度的运动先验,用户按同样的键在不同场景里位移距离完全不一致。这些问题合起来的后果是:模型能生成好看的片段,但不能被「进入」和持续操作。
  • 本文贡献:EchoWM 把交互统一组织在「相机意图」这一个抽象上——第一人称下相机意图就是观察者运动,第三人称下相机与角色的动力学耦合直接从数据里学出来,不再为每种视角单独设计控制器,两类交互共享同一个接口。离散按键命令和连续位姿都被映射到同一个带公制尺度的相对 6-DoF 轨迹表示上,再做数据集级校准,使异构数据源之间的运动幅度保持一致,这是让「按同样的键走同样远」成立的前提。生成侧是联合音视频骨干:视频流与音频流各有自注意力,轨迹只在交叉注意力之前注入视频流(音频流不做轨迹注入),再经 AV 交叉注意力耦合,从而在一个前向里同时产出 720p 视频与环境声/音乐/语音。轨迹注入用的是相对 UCPE 分支(QKV 投影 + ray-local UCPE + 零初始化输出投影),零初始化保证接入时不破坏预训练骨干。训练分四阶段渐进:AV 持续预训练 → 冻结骨干只训动作 → 联合微调 → 自回归后训练(teacher forcing + SGF + 因果续写),最后一阶段是长时程能力的来源;多轮推理时用尾窗条件化下一轮,实现可持续导航。代码与模型已在 jd-opensource/JoyAI-Echo 开源。
EchoWM 的六段式总览:从相机意图接口到多轮自回归推理
Overview of EchoWM. Media context, structured text, and user controls share a unified camera-intent interface. Discrete controls or metric poses are converted into globally calibrated relative 6-DoF trajectories and serialized as an event stream. A relative UCPE branch injects this trajectory into video self-attention before audio--visual cross-attention, while the audio stream receives no direct trajectory condition. Four progressive training stages yield synchronized audio--visual generation and support multi-turn inference through synchronized tail-window conditioning.
  • 实验效果:在公开世界模型基准上,EchoWM 同时取得了强轨迹跟随与高视觉质量,第一人称与第三人称交互都支持,且长时程生成中环境声与语音保持同步。固定全局平移尺度带来的收益在与 LingBot-World-v2 的成对对比里最直观:两者接收完全相同的参考观测与导航条件,当相机朝前景角色或场景结构推近时,LingBot-World-v2 的主体表观尺度变化过大、位移响应难以预测——补光灯场景直接从人像冲到相机机身特写,游戏门框场景推近到结构解体,烛光工坊场景越过工作台变成齿轮特写,越野场景则冲过摩托只剩落日空景;EchoWM 在同样的轨迹上呈现的是渐进、可预期的尺度变化,主体始终留在画面里。这条定性证据与论文的公制尺度、速度响应消融互为补充:固定全局平移尺度让不同片段之间「请求的位移幅度」可比,推近行为因此变得可控。推理侧的赛车导航序列也显示,同一条弯道在连续推进中赛道几何、栅栏与草地纹理保持稳定。
与 LingBot-World-v2 的尺度与位移响应控制对比
Qualitative scale-control comparison. LingBot-World-v2 and EchoWM receive matched reference observations and navigation conditions. When the camera approaches a foreground character or scene structure, LingBot-World-v2 exhibits larger changes in apparent subject scale and less predictable displacement response, whereas EchoWM preserves a more gradual scale change across the trajectory. This qualitative comparison complements the metric-scale and speed-response ablations: a fixed global translation scale keeps requested displacement amplitudes comparable across clips and makes approach behavior more controllable.
  • 批判点评:最需要打折扣的是「open」这个词的适用范围——论文声称开源,但摘要与图表里没有交代模型参数量、训练数据总时长,也没给出可复现的训练配方细节,公开的更可能是推理权重而非完整训练链路。轨迹跟随的量化结果只以「strong」概括,缺少与 Genie 类闭源系统的直接数字对比,而后者恰恰是读者最想知道的参照。音频侧的评估同样偏薄:说「保持同步」,但没有报告音画同步的客观指标(如 AV-Sync offset 分布),环境声/音乐/语音三类音频各自的质量也没有拆开评。第三人称下「相机-角色耦合从数据里学」是个漂亮的设计,但代价是可控性变弱——用户无法像显式相机装配那样精确指定构图,论文没有讨论这个权衡。此外 LingBot-World-v2 是唯一的定性基线,且这组对比只针对尺度/位移响应这一个维度,画面里基线失控得相当彻底(推近直接越过主体),让人怀疑两者是否在同等推理预算下运行,论文没有给出步数与分辨率的对齐说明;真正需要的长时程身份一致性、音画同步等维度都没有配对应的定性证据。最后,作者列表横跨 8 家单位、共同一作 5 人,这类大团队技术报告的工程细节往往难以被外部独立复现。

2. EditStream:六任务一模型的少步流式视频编辑

EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing | Adobe Research、罗切斯特大学 | arXiv:2608.21424

关键词:统一视频编辑,自回归少步生成,速度矩匹配VMM,自回归unrolling,KV-cache,交互式创作,Adobe

  • 前序问题:交互式视频创作在工程上一直被两层割裂卡住。第一层是任务割裂:文生视频、图生视频、视频转视频、编辑传播、参考图引导编辑、相机位姿变更这六件事,各家通常各训一个模型或各挂一套适配器,创作工具里要串起来意味着维护六套权重与六套推理路径。第二层是速度割裂:高质量的扩散视频模型要几十步采样,根本进不了交互式工作流;而把它蒸馏成少步自回归模型时,已知的 Self-Forcing 类做法会带来一串顽疾——过饱和、运动退化(画面几乎静止)、时序不稳定,以及训练流程本身很复杂。运动退化尤其致命:交互式编辑的用户改的往往就是运动,如果蒸馏后的模型只会输出近似静止的画面,统一带来的便利就毫无意义了。
  • 本文贡献:EditStream 的第一步是把六种任务折进单个 DiT:通过通道拼接把 mask token、条件视频 VAE token 与输出视频 VAE token 拼在一起,用一个 Conv3D 把新增通道并进原有通道(C_new = C_old + C_cond),不同任务只是这套拼接模式的不同配置——文生视频只留输出分支,编辑传播额外接条件视频,参考图引导编辑再拼一路参考帧,显式相机控制则加入学习到的降采样 mask。第二步是两阶段蒸馏,核心是 Velocity Moment Matching:与 Self-Forcing 在教师轨迹上做整段视频级 DMD 匹配不同,VMM 在「学生自己走到的中间状态」上采样一次局部转移,用教师速度与辅助网络速度的残差(v_T − v_A)作为监督信号,逐块(block-wise)沿因果 KV-cache 展开;首块单独做 VMM 更新,后续块通过 unrolling loss mask 只在展开步上更新。这样做的直觉是:学生的误差分布只有在学生自己的状态上才能被正确纠正,而在教师轨迹上匹配等于永远在纠正一个不会遇到的分布。
Self-Forcing 展开与 VMM-Forcing 展开(本文)的对照
Overview of VMM-forcing unrolling. During training, we fully unroll streaming inference: the causal student generates each temporal block from noise with the target few-step schedule, commits the denoised block to the KV cache as history, and proceeds to the next block. At a sampled local transition for each selected block/rollout, we query the bidirectional teacher and auxiliary model at the student-induced states, and supervise the student by matching the teacher--auxiliary residual velocity moments under the same autoregressive context. The student-generated first-block condition is also fed into the teacher and auxiliary model.
  • 实验效果:从文生视频对比图可以直接读出蒸馏质量的差距。Self-forcing 版本在四组场景里几乎全部退化成静止:三只金毛四帧内姿态几乎不变、狼群原地踏步、龙灯只有轻微摆动、沙漠中两人搬椅子的动作停在同一姿态。VMM-forcing 版本则有真实的位移与形变——金毛从雪堆里跑出并跨出画面、狼群沿小径实际前进、龙灯完成翻卷、沙漠场景里沙子被扬起并落下。首帧编辑 + HOI(手物交互)消融显示,不加 HOI 训练时锅盖编辑在后续帧丢失、遮阳帽戴不到头上;加了之后锅盖被手放到锅上、帽子正确落到头顶并随手部动作保持贴合。论文将这些归因于 VMM 与 unrolling 共同缓解了过饱和、运动退化与时序不稳定三类问题。
文生视频上 Self-forcing 与 VMM-forcing 的运动质量对比
Qualitative Text-to-Video (T2V) results on frequent user prompts. We compare the Self-forcing conversion and the proposed VMM-forcing pipeline. VMM-forcing produces richer motion dynamics and scene evolution while maintaining texture realism and temporal coherence, whereas Self-forcing often yields over-sharpened, plastic-like appearances and reduced temporal diversity.
  • 批判点评:这是一篇 report 而非常规论文,量化结果的呈现相当克制——摘要里没有给出任何具体的 FVD/VBench 数字,也没有报告蒸馏后的步数与实测帧率,而「fast, few-step」和「efficient streaming」正是它的核心卖点,缺少数字就很难判断它离真正的交互式实时还有多远。六项任务统一后,每项任务相对各自的专用 SOTA 是否有质量损失也未见系统对比,统一的代价没有被量化。VMM 引入了一个辅助网络 A,训练成本相对 Self-Forcing 增加多少、辅助网络如何初始化与更新,摘要层面没有交代。定性图上还有一个诚实的观察:VMM-forcing 的金毛在第三、四帧出现了明显的运动模糊与主体截断,说明追求运动幅度的同时清晰度是有让步的,论文没有讨论这个权衡。最后,Adobe 内部数据与训练栈的依赖较重(数据一节单列),外部复现难度不小。

3. FixAnything:一个视频先验修四种3D表示

FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors | 卡内基梅隆大学 (CMU) | arXiv:2608.23549

关键词:渲染伪影修复,视频生成先验,3DGS,NeRF,几何感知DPO,视频到视频翻译,ECCV 2026

  • 前序问题:3DGS、NeRF、网格甚至点云在输入视角稀疏、或目标视角离输入较远时都会渲染出伪影,这是三维重建落地的通用痛点。已有工作确实在用扩散生成先验来修,但几乎都是「一种表示一套方案」:给 3DGS 修伪影的模型改用到 NeRF 上要重设计架构,点云的稀疏空洞和网格的几何错误又是另外两类退化模式。结果是工程上要维护多条专用修复管线,每条都要单独设计架构并大规模重训。更深一层的问题是,多数修复方法逐帧独立处理,修出来的结果虽然单帧好看,但跨帧不一致,无法反过来喂给下游重建——这就失去了「修复」最重要的用途。
  • 本文贡献:FixAnything 的关键洞察很朴素:即使是噪声很大的渲染序列,也仍然保留了相机运动与粗略场景结构,因此清理伪影可以被直接表述成「视频到视频翻译」,从而复用预训练视频生成模型隐含的多视角先验,只需极少改动与轻量微调。落地是两阶段。Stage I 监督微调:输入退化视频经冻结的 VAE 编码器得到条件 latent,与噪声、以及一张标记「哪些像素是干净的」的二值 mask 一起送入冻结的 DiT,只训练 LoRA,再由冻结 VAE 解码器出目标视频。这张 binary mask 是可控性的来源——它让模型把输出锚定在高质量输入(例如训练视角)上,只精修其余部分,而不是把整段视频重画一遍。Stage II 几何感知偏好优化:用同一条输入视频跑多个随机种子的 rollout,把每次输出送进 structure-from-motion 恢复相机位姿,与 GT 位姿比较,位姿误差大的判为负样本、误差小的判为正样本,用 DPO 更新 LoRA。换言之,它把「几何一致性」这个原本难以微分的目标转成了可直接优化的偏好信号,而不是再加一堆手工正则。
FixAnything 的两阶段训练:监督微调与几何感知偏好优化
  • 实验效果:跨四种不同的 3D 表示,FixAnything 都用轻量微调稳定提升了渲染质量,证明单个通用视频先验可以替代多条专用精修管线。最直观的是点云与稀疏输入的修复结果:游乐场攀爬架序列中,输入的中间三帧几乎只剩黑底上的散点(点云稀疏到看不出结构),输出恢复出完整的金属管架、地面绿漆与远景树木,与 GT 高度接近;亭子序列里输入帧被大面积黑洞和撕裂纹理占据,输出补出了完整的木构屋檐、栏杆、石阶与背景树林,逆光帧的光晕也被合理重建。mask 感知条件的消融显示,不加 mask 时干净的训练视角也会被模型重画而丢失细节。框架的简洁性还带来一个附加好处:将来出现更强的视频模型可以直接换上,不需要重新设计架构。
点云与稀疏视角输入的修复结果(Input / Output / GT 三行对照)
FixAnything generalizes across input representations. The same model cleans up sparse COLMAP point clouds (top) and meshes (bottom), producing photorealistic output despite minimal visual input except for the clean first and last views.
  • 批判点评:摘要通篇用「consistently improves」描述结果,没有给出任何 PSNR/LPIPS 的具体数字,也没说明四种表示各自提升了多少,这在一篇已被 ECCV 2026 接收的论文里显得异常保守,读者无法判断增益是显著还是边际。用 SfM 恢复的位姿精度当 DPO 奖励是个聪明设计,但 SfM 本身在纹理稀疏或强逆光场景就会失败,此时奖励信号的可靠性存疑,论文没有讨论这个失效模式。定性结果里输出与 GT 存在明显的「生成味」——亭子序列中输出的树木纹理和光晕分布与 GT 并不一致,说明模型在补全时引入了幻觉内容;对于测绘、数字孪生这类要求忠实度的场景,这种「好看但不忠实」的修复是风险而非收益,而位姿一致性奖励只约束几何、约束不到外观真实性。此外全部实验用的都是同一个预训练视频骨干,「通用性」的结论究竟来自方法还是来自这个特定骨干的能力,缺少交叉验证。

4. Loopy:锚定层位置编码把时间轴掰成圆

Loopy: Seamless Video Loop Generation via Anchored Looping Shift of Positional Embedding | 天津大学、香港理工大学、腾讯 | arXiv:2608.23090

关键词:循环视频生成,RoPE位置编码,分层时序控制,锚定层,免训练,RGBA视频,ACM TOG

  • 前序问题:循环视频在网页动效、游戏素材和社交媒体里需求很实在,但现有做法质量普遍不行,根因在于大家都绕过了一个基础问题:视频生成模型究竟如何感知时间顺序,这种感知又如何决定首尾能否接得上。常见的两条路各有硬伤——直接在提示词里写「scene looping seamlessly」,模型基本不理解,生成出来的首尾差异巨大(鲨鱼从侧身游到正面怼镜头,根本接不上);用首尾帧到视频(FLF2V)把首帧复制给尾帧作为参考,虽然强制首尾一致了,但模型为了同时满足两端约束会把中间的运动压得几乎静止,得到的是「能循环但不动」的伪循环。两条路都没有触及 DiT 内部时序表示这一层。
  • 本文贡献:论文首次揭示:DiT 内不同注意力层的位置编码对时序顺序的控制强度差异很大,其中最强的那一层可以视为「锚点」。他们把这个锚定层设为循环视频的参考点,为其余层提供强上下文先验。基于此提出锚定位置编码偏移策略——按每层实际的时序控制效应给出层特定的偏移长度,把 DiT 对时间的感知从「一条直线」变成「一个圆」。实现上极简:在每个 DiT block 的自注意力里,Q/K 除了原始 RoPE R_{t,h,w},再并行算一份偏移后的 RoPE,偏移量为 (t − δ_l) mod T',其中 δ_l 是第 l 层的时间偏移,两者按层组合后再进 attention 与交叉注意力+FFN。整个过程不改权重、不需重训,是纯推理期干预,因此可以直接挂在 Wan2.1/2.2、HunyuanVideo 1.5 等现成基座上,并同时支持 RGB 与 RGBA 视频,还能叠加身份控制与风格迁移这类 AIGC 能力。
锚定层的发现:逐层位置控制强度与在不同层做偏移的效果
Comparison of Wan2.2 14B and HunyuanVideo 1.5 outputs when shifting RoPE at the layers with the first- and second-largest $\alpha_l$, relative to the original generated videos.
  • 实验效果:逐层分析图给出了机制的直接证据:Wan2.2 14B 的 α_l 曲线在第 0 层达到峰值约 0.31、第 1 层约 0.22,之后迅速衰减到 0.05~0.15 区间;HunyuanVideo 1.5 的峰值落在第 2 层(约 0.31)与第 6 层(约 0.21)。在 α_l 最高的层做偏移会破坏内容(墨滴场景出现整帧粉紫色偏色与结构错乱),在次高层偏移则能保持内容正确并实现循环,这正是「按层给不同偏移量」这一设计的来源。定性对比中,T2V 基线生成的鲨鱼首尾姿态完全不同、无法循环;FLF2V 虽首尾一致但四帧几乎静止;Loopy 既保持首尾可接,中间又有真实的尾部摆动与身体位移。论文报告循环视频的时序一致性与视觉保真度都有显著提升,用户研究在运动连贯性等维度上给出更高评分,模型已在项目主页发布。
与 Wan2.2 的 T2V、FLF2V 两种模式对比循环质量
Comparison with Wan2.2 in text-to-video (T2V) and first-last-frame-to-video (FLF2V) modes. FLF2V and our method use the same prompt. Although the prompt explicitly requests a looping scene, T2V fails to produce a seamless loop, while FLF2V degenerates to a nearly static video. Neither mode generates a looping video with vivid motion.
  • 批判点评:最实际的限制是这套策略与基座强绑定:α_l 的峰值层因模型而异(Wan2.2 在第 0/1 层、HunyuanVideo 1.5 在第 2/6 层),换一个基座就要重新做逐层扫描来定位锚点和标定每层偏移量 δ_l,论文没有给出自动化的标定流程,这在工程上是一笔隐性成本。δ_l 的具体取法只描述为「按每层时序控制效应」,缺少可复用的公式或搜索预算说明。效果侧全部以「significantly improves」和用户研究箱线图呈现,没有报告循环质量的客观指标(例如首尾帧感知距离),而这恰恰是最容易量化的一项。另外从 α_l 曲线看,中后层存在若干局部尖峰(Wan2.2 在 20~30 层、HunyuanVideo 在 30~40 层附近),论文只利用了全局最强的一两层,这些次级峰是否也参与时序控制、忽略它们是否留下了改进空间,没有讨论。最后,能循环的内容类型边界不清——鲨鱼游动、墨滴扩散这类准周期运动天然适合循环,而有明确起止语义的动作(如开门、倒水)能否成立,未见说明。

5. Object-Uni:物体位姿当显式变量贯通理解生成

Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation | 中科院自动化所、国科大、清华大学、蚂蚁集团 | arXiv:2608.22757

关键词:统一多模态模型,物体位姿,视角化朝向抽象,可控生成,新视角合成,UniSpatial-80K,蚂蚁集团

  • 前序问题:统一理解与生成的模型这两年进展很快,但有一项能力始终缺位:理解并操纵物体实例的空间状态。现有模型能用自然语言把物体描述得很好(「一把红色的椅子在桌子旁边」),却做不到两件事——精确表示连续的物体位姿,以及在指定目标视角下生成几何一致的图像。根子上的原因是位姿在现有工作里的地位错了:要么被当成一个待预测的标签(理解侧的输出),要么被当成一个外部控制信号(生成侧的输入),两侧各用一套表示、互不相通。而多模态大语言模型天然处理离散 token,连续的旋转矩阵/四元数很难直接塞进语言空间并保持可推理性,这是把位姿变成「理解与生成共享变量」的主要技术障碍。
  • 本文贡献:Object-Uni 把物体级空间智能重新表述成一个统一问题,把位姿感知、空间推理、位姿条件生成、物体级新视角合成四件事连起来,并把物体位姿当作理解与生成共享的显式几何变量。为了让 MLLM 能真正用上位姿,他们提出视角化朝向抽象:把朝向映射为结构化的视角描述(便于语言模型推理),同时保留连续的几何监督(不丢精度)。架构上,理解分支里输入图像经视觉编码器、文本经 tokenizer、物体裁剪图额外经 DINO 编码器进入冻结的 MLLM,MoE 中激活一组可训练 expert,输出侧除常规 NTP loss 外加一路 orient head 承担 orientation loss;生成分支复用同一 MLLM(此处 expert 冻结),用可学习 query 经 connector 送入可训练的 Diffusion Transformer,与图像 latent、目标位姿 latent 一同去噪。此外构建了物体级空间基准 UniSpatial-80K,并用「物体 token 锚定的位姿锚」把每个实例与其位姿状态绑定,避免多物体场景下位姿串位。
Object-Uni 总览:理解与生成共享同一 MLLM 与同一位姿变量
Overview of Object-Uni. Our model unifies object-centric spatial understanding and orientation-controllable generation. The dotted modules denote object-centric novel view synthesis.
  • 实验效果:实验显示物体级位姿理解与位姿可控生成都有提升,把统一模型从「描述物体」推进到「操纵空间状态」。定性对比中,单物体位姿控制上 Object-Uni 能在保持参考物体外观身份的同时把收割机、叉车、板车、越野摩托转到目标视角,而对照的 SceneDesigner 虽然也换了视角但常常改掉物体本身(收割机换成另一款红色机型、叉车变成挖掘机、板车上多出一个南瓜)。多物体场景下差距更明显:书本、相机、沙发、鞋子四组里 Object-Uni 保持了实例数量与相对布置(两本书叠放、两台相机并排、鞋子一双朝向一致),SceneDesigner 则出现物体简化、颜色改变与朝向不一致。
单物体与多物体位姿可控生成的对比(ref / ours / SceneDesigner)
Evaluation of pose-controllable generation in single- and multi-object scenarios. The reference image in the first row serves as the source for the input text and 9D pose annotations. Object-Uni shows better text alignment and pose consistency under diverse pose conditions.
  • 批判点评:「视角化朝向抽象」在把连续朝向离散成结构化视角描述时必然有精度损失,论文没有报告这个抽象带来的角度误差上界,而它直接决定了这套表示能支撑多细的位姿控制——如果分辨率只到「高角度视角/侧视」这一级,就谈不上真正的连续位姿操纵。效果全部以「improves」概括,摘要层面没有一个具体数字(角度误差、位姿准确率、生成一致性指标均缺),UniSpatial-80K 上与其他统一模型的横向对比也未见。基准由作者自建、模型也在其上训练与评测,存在自证循环的风险,缺少在第三方物体位姿数据集上的迁移验证。架构上依赖冻结 MLLM + MoE expert + DINO 编码器 + 可训练 DiT 四个部件,训练与推理开销显著高于纯 MLLM 方案,论文未给出代价核算。定性对比只选了 SceneDesigner 一个基线,说服力有限。最后,从生成结果看 Object-Uni 输出的图像在背景与光照上与参考图差异较大(收割机的麦田、摩托的赛道都被重画),说明「保持物体身份」是靠牺牲场景一致性换来的。

6. Next-Scale NVS:下一尺度自回归单次出多视角人脸

Photorealistic Novel View Synthesis of Human Faces using Next-Scale Transformers | 洛桑联邦理工 (EPFL)、Meta | arXiv:2608.23410

关键词:新视角合成,下一尺度自回归,多尺度VQVAE,跨视角一致性,GS-LRM,合成数据训练,Meta

  • 前序问题:人物的照片级新视角合成在高分辨率、多目标相机的设定下仍然很难:既要保住身份,又要保住细微的外观细节(皮肤纹理、发丝、衣物褶皱),还要让多个视角之间几何自洽。主流做法是扩散模型,但它有两处结构性代价。一是必须依赖大规模 2D 预训练才能有可用的先验,这决定了它对数据量的胃口。二是多视角一般靠逐视角独立采样再想办法约束一致性,跨视角自洽是「事后补」而非「内生」,分辨率越高、目标相机越多,不一致就越明显。对于真人数据难以大规模合法采集的人脸场景,「必须靠海量任务数据才能收敛」本身就是一个卡点。
  • 本文贡献:作者不走扩散,而是把下一尺度自回归(next-scale autoregressive)范式适配到以人为中心的视角合成上,使其支持更高分辨率、多视角输出与更强的跨视角一致性,且全部在单次前向里完成。管线是:N 张 512×512 输入图经多尺度 VQVAE 编码器得到逐尺度 token(i_1 为 N×1×32、i_2 为 N×4×32、i_3 为 N×9×32,依次加密),与 CLIP 特征、目标相机外参 (R_1,T_1)…(R_M,T_M) 组成的全局条件一同经 word embedding 进入 Causal Next-Scale Transformer,自回归产出 M 组目标视角的逐尺度 token r_1/r_2/r_3,再由多尺度 VQVAE 解码器一次性解出 M 张 512×512 视角;训练时目标视角走 teacher forcing。这个范式的关键红利是训练数据经济性:不需要 2D 预训练,且低分辨率、通用的预训练可以直接复用,只在最后几个训练阶段才用到全尺寸的任务专用图像,因此用一个更小但更真实的数据集就能收敛。他们在覆盖多样身份与服饰的合成人脸数据集上训练,并把输出接到已有的 GS-LRM 上做像素对齐的 3D 高斯提升,最终得到人脸的 3D 模型。
下一尺度自回归的人脸多视角合成管线
Our architecture: input images are encoded into multi-scale features by the VQ-VAE encoder and used as inputs for the transformer. They are also embedded into a global conditioning along with the camera-pose RT matrix, used both in the AdaLN layers and the SOS tokens. The transformer outputs one scale at a time for every output view simultaneously, up to the final scale. The output features are decoded by the VQ-VAE decoder to produce the final RGB images, which can be lifted to 3D gaussians by an off-the-shelf GS-LRM model. During training, previous scales are teacher-forced, while during inference the model is auto-regressive. The architecture is the same for all our models, with the only difference being the number of input and output views.
  • 实验效果:模型输出锐利且真实的视角图,并可选择同时合成多个新视角以提升视角间的一致性。论文报告在人物主体上感知保真度与跨视角连贯性均有增益,说明下一尺度自回归可以作为可扩展、多输出的人物视角合成骨干。与 FaceLift 的六视角对照能看出差距落在身份保持上:FaceLift 把发色提亮成偏灰金、发型改成盖头式,侧脸轮廓被压扁、后脑呈现出与真值完全不同的整齐发块,肤色整体偏白;本文方法在六个视角上的脸型、下颌线、肤色与颈部阴影都贴近真值,仅在后脑一列把稀疏的头发画得略密。与 GS-LRM 串联后,从多视角人脸输入可得到准确且照片级的三维人脸模型,完成了「多视角生成 → 3D 高斯提升 → 渲染」的闭环。多尺度 VQVAE 的微调与不同 patch 划分方式的消融(256/512 分辨率、normal 与 diff patchify)表明适配到 512 分辨率时 VQVAE 微调是必要的。
同一身份六个新视角上 GT、本文方法与 FaceLift 的对照
  • 批判点评:最大的问题是训练数据全部为合成人脸,论文自己也强调「a smaller but more realistic training dataset」,但合成到真实的域差距未见量化评估,模型在真实拍摄人脸上的表现是空白,而这才是实际用途所在。量化结果同样只以「we observe gains」表述,没有 PSNR/LPIPS/身份相似度的具体数字,也没和 FaceLift、Splatter-Image 这些明确出现在其定性对比目录里的基线给出表格化比较。分辨率停在 512×512,对影视级人脸资产而言偏低,而下一尺度自回归的 token 数随尺度平方增长,往 1024 走的代价论文没有交代。第一作者的贡献声明为「在 Meta Reality Labs 实习期间完成」,且 LaTeX 源里仍留有多处 TODO FINAL: Replace with your institution list 未清理的模板注释,说明这是一版尚未定稿的投稿,结论宜谨慎引用。此外整套流程依赖外部 GS-LRM 做 3D 提升,端到端的几何误差如何在两个模型之间分摊也没有分析。

7. Lever-Edit:不用编辑奖励也能做编辑在线RL

Can We Perform Online RL for Image Editing without Editing Rewards? | 北京大学 | arXiv:2608.22780

关键词:图像编辑,在线强化学习,T2I奖励迁移,反事实目标描述,奖励对齐caption,北京大学

  • 前序问题:用强化学习直接优化图像编辑的人类偏好,前提是有可用的编辑专用奖励模型,而这一块恰恰很薄——训练编辑奖励需要昂贵的三元组监督(原图、指令、编辑结果),还要按任务做复杂的标定。反观文生图(T2I)这一侧,奖励生态已经相当成熟且多样:语义对齐、美学、真实性、字形形状等各类视觉偏好都有现成模型。把这套生态迁移到编辑上,能大幅拓宽 RL 可优化的偏好维度。但迁移有一个本质错配:编辑指令描述的是「相对变化」(把狗变成大理石雕像),而 T2I 奖励要求的是「自包含的目标描述」(一只大理石雕像的狗,立在基座上)。而且通用视觉语言模型给出的 caption 虽然语义正确,却可能与被冻结的奖励模型不兼容——奖励模型对措辞、句式有自己的偏好,语义对但表述不对,打出来的分就是噪声。
  • 本文贡献:作者先论证标准的图像编辑维度是可以映射到 T2I 奖励空间的:图像质量可以直接迁移;提示遵循可以通过「对期望视觉状态的描述」来对齐;参考一致性则可以通过把需保留的源内容编码进描述里做粗粒度语义转换。在此基础上提出 Lever-Edit 两阶段框架。Stage 1 是 T2I query 对齐:训练一个奖励对齐的 captioner,它接收系统提示与编辑指令(各有可学习的 embedding 权重),经 VLM 解码出「反事实目标描述」——即编辑成功后画面应该是什么样的自包含描述;训练时 VLM 冻结、只学 reward-aligned query embedding,用聚合的多个 T2I 奖励作为信号,让 captioner 学会说奖励模型「听得懂」的话。Stage 2 是奖励对齐微调:把 captioner 冻结,只用迁移来的 T2I 奖励优化编辑策略本身(此时编辑骨干解冻、query embedding 冻结)。两阶段的冻结/解冻是交替的,这个设计避免了 captioner 与策略互相追逐导致的奖励崩塌。
Lever-Edit 的两阶段 T2I 奖励迁移流程
Overall two-stage T2I reward transfer pipeline in Lever-Edit.
  • 实验效果:实验显示 Lever-Edit 在编辑对齐度与源内容保持上都能与基于编辑奖励微调的方法竞争,同时明显优于几种直观的迁移基线。定性对比按提示遵循、美学、一致性、自然度四组维度组织,八个编辑任务里可以看到:不做对齐(w/o Alignment)时「把狗变成大理石雕像」只是把狗漂白、「换成极简白背景」直接把人像退化成线稿;Lever Pure Edit 与 Lever Pure VLM 各有偏差(前者美学不足,后者出现主体改变,如冲浪板换成桨板时人物姿态被重画);Lever Offline SOTA 在自然度上仍有塑料感;完整的 Lever-Edit 在四组维度上综合最好——大理石雕像有正确的石材质感与基座、红色跑车放到建筑前方且透视正确、热气球加入天空且尺度合理、白色背景替换保留了人物细节。
八项编辑任务上五种变体与完整 Lever-Edit 的定性对比
Qualitative analysis of different methods. Lever-Edit successfully edits the images with strong prompt following and high aesthetics, while maintaining both semantic and source consistency with naturalness. Zoom in for better visualizations.
  • 批判点评:「competitive against editing-reward-based fine-tuning」这个表述值得留意——它说明本方法并未超越用真正编辑奖励训练的上界,价值在于省掉三元组标注成本,而不是效果更好;如果编辑奖励模型未来变得容易获得,这条路径的必要性会下降。摘要没有给出任何数字(编辑对齐、源保持的具体指标与基线差距均缺),也没说明用了哪几个 T2I 奖励模型及其聚合权重,而这直接决定结果可复现性。方法引入的 captioner 是新的失效点:反事实目标描述如果写错(把「移除」理解成「替换」),策略就会被系统性地引向错误方向,论文未讨论 caption 错误率及其对训练的影响。「参考一致性靠粗粒度语义转换」是全流程最薄弱的一环——T2I 奖励天生不看源图,无法真正惩罚身份改变,从定性图里也能看到 Lever Pure VLM 出现主体被重画的情况;这类结构性缺陷不是靠 captioner 能补齐的。另外两阶段交替冻结的训练配方对超参可能较敏感,稳定性未见报告。

8. SACHA:2.23MB存下动态高斯头像

SACHA: Semantic-Aware Compression for 3D Gaussian Head Avatars | 香港城市大学、阿里巴巴达摩院 | arXiv:2608.23133

关键词:3D高斯头像,语义感知密度控制,外观-运动解耦压缩,率失真优化,头部先验参数,阿里达摩院

  • 前序问题:可驱动的 3D 高斯头像渲染质量高、控制灵活,但高斯基元数量庞大,存储和传输成本都很重,这是它进入视频会议、VR 社交、移动端这些实际场景的主要障碍。现有的高斯头像方法有两处共同盲区。第一,忽视了头部不同语义区域的视觉显著性差异——眼睛、嘴唇这些高频且被注意力集中的区域和后脑、脖颈这类低频区域,如果按同样的密度分配高斯基元,就是把预算浪费在看不出差别的地方。第二,几乎没人做训练完成后的头像序列压缩:一段动态头像在时间维度上高度冗余(外观基本不变、只有表情和姿态在动),但主流做法仍然逐帧存储完整的高斯参数。
  • 本文贡献:SACHA 把两件事合起来做。语义感知密度控制在训练阶段按头部区域自适应分配高斯基元,做区域自适应的稠密化与剪枝,把预算集中到显著区域;配套的语义感知标准高斯训练管线负责产出这个紧凑的标准(canonical)表示。外观-运动解耦压缩针对序列冗余:编码端对每一帧先用头部先验模型提取形状 β、表情 ψ_t、姿态 θ_t 三组头部先验参数,单独编成参数码流;高斯本体则拆成绑定索引 {b_i} 与标准高斯 {g_i},各经坐标排序后编成索引码流与高斯码流。解码端拿到三路码流后,由头部先验模型驱动「头部先验引导的形变」,把标准高斯变形到当前帧。关键在于:外观(标准高斯 + 绑定索引)只需传一次,运动只传头部先验参数——参数量比逐帧全量高斯小几个数量级,这就是时间冗余被吃掉的地方。
SACHA 的外观-运动解耦编解码框架
Overview of the proposed appearance-motion decomposed compression framework for 3D Gaussian head avatars.
  • 实验效果:率失真性能优于现有的高斯头像表示与压缩方法,同时保持高质量的新视角与新表情渲染。单被试(Subject 264)的主观对比给出了很具体的数字:SACHA 只用 2.23 MB 就达到 PSNR 29.9984 dB,而 G-PCC 需要 10.50 MB 才拿到 29.9856 dB(约 4.7 倍体积换来几乎相同的质量);TGA 用 20.69 MB 只有 28.7186 dB,SACHA 在体积小约 9 倍的同时质量还更高。质量更高的两个基线代价极大——SVG-Head 84.12 MB / 31.2910 dB、TexAvatars 69.67 MB / 31.0862 dB,都比 SACHA 大 30 倍以上。HEVC 在 21.49 MB 下只有 21.49 dB 级别的可见退化(脸部结构明显扭曲)。新视角合成的 RD 曲线(PSNR/SSIM/LPIPS 三张图,横轴为对数尺度的 MB)显示 SACHA 的绿色曲线整体位于 1.5~3 MB 区间,而全部基线分布在 10~105 MB。
Subject 264 上与七种方法的主观质量与码率对比
Subjective comparisons with G-PCC, HEVC, CompactSTG, GA, SVG-Head, TexAvatars, and TGA on subjects 074 and 264 from the NeRSemble dataset.
  • 批判点评:从 RD 曲线看结论要更克制一些:SACHA 在自己的码率区间内 PSNR 大致在 28.8 dB 附近,明显低于 SVG-Head 的约 29.95 dB 与 TexAvatars 的约 29.85 dB,也就是说它换来极小体积的代价是质量上限被压低了——单被试上 29.9984 dB 的漂亮数字并不代表平均水平。LPIPS 一栏尤其值得注意:SVG-Head 约 0.045、TexAvatars 约 0.048,而 SACHA 约 0.11~0.12,感知质量差距比 PSNR 体现的更大,对于强调面部细节的应用未必可接受。方法整体强依赖头部先验模型(形状/表情/姿态参数化),先验拟合失败的情况(夸张表情、被遮挡、佩戴眼镜或头发遮挡面部)会直接让形变解码出错,论文没有报告这类失效。语义分区如何获得、分区错误的鲁棒性也未见交代。此外全部实验只在头部这一类目标上,方法名里的语义感知密度控制是否能推广到全身或一般物体,缺少验证。

9. DefaultShift:加速后颜色默认最多漂移0.303

DefaultShift: Auditing Semantic Default Shift in Accelerated Text-to-Image Models | 悉尼大学 | arXiv:2608.21784

关键词:少步加速模型,语义默认漂移,成对审计,VLM评估,离线校准,分布偏移,推理加速代价

  • 前序问题:少步文生图模型正在大规模替换慢速生成器,但加速可能悄悄改变那些提示里没有指定的属性的分布——每一张输出看起来都合理、也都与提示对齐,可整体分布已经变了。作者把这类分布称为语义默认(semantic defaults),把替换导致的变化称为语义默认漂移。问题在于现有评测完全测不出它:质量指标只看单图好坏,偏好指标只看人更喜欢哪张,多样性指标只看整体是否单调,三者都不检验「替换模型是否保留了参考模型的语义默认」。后果是实践中的隐性风险——用少步模型批量生成训练数据时,颜色、背景、光照、视角的默认分布已经偏移,下游模型会继承这个偏差,而流水线里没有任何一环会报警。
  • 本文贡献:DefaultShift 是一套成对审计流程。上半部分 Default Shift-Audit 分三段:成对采样阶段,对同一提示(如「a photo of a helicopter」)分别用参考模型 T(多步扩散)和加速替换模型 S 各生成一批图;语义默认阶段,用 VLM 评估器按封闭语义词表(颜色、背景、光照、视角等,每类若干离散取值)给每张图打标,得到两个直方图;漂移审计阶段,用 TV 距离等指标算概率质量的移动,并做教师自举校正(TV_adj = TV(T,S) − η_T)以剔除参考模型自身的采样噪声,再经 q=32 筛查、q=64 确认两级预算与 cell-level bootstrap,输出按配方排序的结果和方向性签名(偏暖还是偏灰)。下半部分 Default Shift-Select 是离线校准:给定参考直方图模板与 CLIP 质量下限,从 M=128 的候选池里做分布匹配(min TV),挑出 N=32 张既满足质量门槛、又让语义分布贴近参考模型的图。方法把「解释性排序」与「确证性的 cross-fit 推断」分开,避免用同一批数据既选又证。
DefaultShift 的审计与校准双流程
Overview of DefaultShift. The audit generates matched samples from a declared reference and accelerated replacement, maps each image to a closed semantic vocabulary, and compares their conditional distributions. Cell-level discrepancies are aggregated for recipe ranking and directional analysis. DefaultShift-Select uses reference statistics and a quality-filtered replacement pool to construct a distribution-matched offline subset.
  • 实验效果:在 14 组参考/替换配对上,调整后的颜色差异从 0.054 到 0.303,且方向随加速配方而异。统一 q=64 审计的排序里 NitroFusion-4 最严重(约 0.30),Turbo 约 0.25、DMD2 约 0.23、NitroFusion-1 约 0.23、FLUX-schnell 约 0.20,而 LCM 与 Lightning 最轻(约 0.05)。多属性画像显示颜色是最大的漂移源(0.20~0.30),背景 0.06~0.12、光照 0.05~0.09、视角仅 0.01~0.03。方向性指纹图给出定性结论:DMD2、Turbo、Lightning、LCM 都朝「暖色质量增加」方向移动(DMD2 的 Δ暖色质量约 +0.16 最显著),FLUX 则相反,朝灰色方向漂移(Δ暖色质量约 −0.07)。1000 张图的人工审计复现了同样的排序。DefaultShift-Select 在 Turbo、DMD2、FLUX 上把人工测得的漂移降低了 10.3% 到 35.1%,且没有实质的质量损失;在均衡评测下,经校准的数据相比未校准的替换数据恢复了 4.3 个准确率点和 7.5 个最差组点。
14 组加速配方的颜色漂移排序、多属性画像与方向指纹
Acceleration recipes differ in magnitude, attribute, and direction. a The unified $q=64$ audit covers all 14 replacement pairs. Lines are 95% object-cluster intervals. b Color dominates the four-attribute profile, while viewpoint shifts are small. c Replacement-minus-reference changes in gray and warm mass reveal opposing recipe fingerprints.
  • 批判点评:整套审计建立在 VLM 评估器加封闭语义词表之上,两处都会引入偏差:VLM 自身对颜色、光照的判断有系统性倾向,论文虽给出了人类与 VLM 的混淆矩阵,但那只覆盖「clear case」,模糊样本上的一致性未知;封闭词表则把连续属性强行离散化,词表粒度直接决定测出多大的 TV 距离,换一套词表数值不可比。「颜色差异 0.054 到 0.303」是 TV 距离而非人眼可感差异,缺少感知尺度上的锚定,读者很难判断 0.2 究竟意味着轻微偏暖还是明显变色。DefaultShift-Select 只是事后筛选,本质是丢弃不合分布的样本来贴近参考分布,代价是有效产出下降(128 选 32,即弃掉 75%),这个吞吐损失论文没有和「干脆用慢速模型」做成本对比。审计限定在提示未指定的属性上,但「未指定」的边界本身依赖提示写法,作者用的是「a photo of a {object}」这类极简模板,真实业务里的长提示会指定更多属性,结论的外推性有限。最后,下游 4.3/7.5 点的增益只在其自建的均衡评测设定下成立,任务范围较窄。

10. FIRM-Video:先核查再打分的8B视频奖励模型

FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling | 上海交通大学、腾讯优图实验室、同济大学 | arXiv:2608.21839

关键词:视频奖励模型,清单驱动,先核查再打分,指令遵循,世界一致性,感知质量,腾讯优图

  • 前序问题:可靠的奖励模型是文生视频评测与对齐的基础,但评测准确性与推理效率之间的权衡,把压力全压回了训练监督的质量上。现有做法分两类,各有各的毛病。一类是固定评分细则的整体式评判:一个提示进来,模型按几条固定维度直接给总分,检查必然不完整——提示里明确要求的细节(红色狐狸、镜头右摇、雪地森林)不会被逐条核对。另一类是开放式推理:让模型自由生成一段分析再打分,问题是理由与分数经常不一致(unfaithful justification),而且多个维度的归因彼此纠缠(entangled attribution),分低了到底是因为没跟指令、还是因为画面糊,说不清。归因不清的奖励用来做 RLHF 或 Best-of-N,优化方向就是模糊的。
  • 本文贡献:FIRM-Video 提出统一的清单驱动数据构造框架,核心是「先核查再打分」原则:构造维度专属清单 → 逐条对着时序视觉证据核验 → 只聚合被验证过的判断。三个维度各有各的清单构造方式。指令遵循(IF)把提示拆成带权重的原子需求(「红狐是否在场」「狐狸是否跃过木头」「场景是否下雪」「镜头是否右摇」),逐条验证满足与否,按权重加权求和得 1~5 分。世界一致性(WC)构造经提示校准的、针对具体目标的检查项,锚定在可见实体与动作上(「狐狸身份是否稳定」「解剖结构是否合理」「落地是否符合物理」),只对检测到违反的项计分。感知质量(PQ)用一套通用视觉缺陷分类(清晰度、模糊、色彩稳定性、闪烁、压缩伪影、局部畸变)做缺陷验证。三路验证过的判据与分数再被转成自然语言分析,用于端到端奖励建模的理由综合。数据上构造了 FIRM-Video-90K(29,348 个视频、3,012 个提示、3 个维度、88,044 条维度专属实例),并发布 FIRM-Video-Bench(250 个视频、750 条点式人工标注)。
FIRM-Video 的清单驱动数据构造与奖励模型训练框架
Overview of the FIRM-Video data construction framework and reward model training. Given a prompt and its generated video, FIRM-Video applies a unified check-before-score pipeline to construct fine-grained supervision for instruction following, world coherence, and perceptual quality. The resulting dimension-specific analyses and scores form FIRM-Video-90K, which is then used to train the FIRM-Video-8B reward model.
  • 实验效果:基于 Qwen3-VL 的 FIRM-Video-8B 在 FIRM-Video-Bench 上取得最优的总体 MAE,同时在三个视频生成器上的 Best-of-8 采样中稳定给出最高的 VBench Total、Quality 与 Semantic 分数。teaser 的案例很有说服力:一段工业车间里工人挥锤的视频存在三处问题(手柄颜色不对——提示要求纯黑却是浅棕、手柄形变、手柄畸形),人工标注给出 IF 3 / WC 2 / PQ 5;GPT-5 给 4/5/5、Qwen3-VL-8B 给 5/5/5,都严重高估了世界一致性;只有 FIRM-Video-8B 给出 3/2/5,与人工完全一致。模型输出的理由也指向了正确位置(「锤柄是浅棕而非指定的纯黑」「严重的解剖形变与锤柄融合」)。
FIRM-Video-8B 与 GPT-5、Qwen3-VL-8B 在同一案例上的人类一致性对比
Qualitative evaluation case of FIRM-Video-8B, illustrating its improved alignment with human judgments.
  • 批判点评:清单本身是用 LLM 从提示里自动拆出来的,这就把可靠性问题往上游推了一层——如果原子需求拆错或漏拆(比如把「镜头右摇」漏掉),下游再严格的核验也补不回来,论文没有报告清单构造的召回率与准确率。权重同样如此:IF 分数是原子需求的加权和,权重怎么定、对结果多敏感,摘要层面没有交代。核验环节仍然由 MLLM 执行,「对着时序视觉证据核查」只是把一次大判断拆成多次小判断,单次判断的错误率并未消除,只是被平均了;对细粒度物理违例(手柄形变这类)MLLM 的检测能力本身就是瓶颈。FIRM-Video-Bench 由作者构建、模型也在同源数据上训练,报「最优 MAE」存在数据分布同源的优势,跨基准(如 VideoScore、VBench-Reward)的迁移结果缺失。Best-of-8 只测了三个生成器,且未说明是哪三个、覆盖是否有代表性。另外三个维度分别打分虽然解开了归因纠缠,但如何聚合成单一奖励用于 RL 训练,论文未给出方案,这一步没有解决的话,可靠归因的价值就还停留在评测阶段。

趋势观察

  1. 世界模型的竞争焦点从「画面好不好」转向「进得去、走得动、听得见」 — 今天最值得注意的信号是京东 Joy Future Academy 开源了 EchoWM,它把三件此前分开做的事塞进了一个模型:连续导航响应、720p 视频生成、以及环境音/音乐/语音的同步生成。过去一年世界模型的论文大多在比 FVD 和画面保真度,控制接口则各家各造——第一人称用一套相机控制器,第三人称再单独训一个角色控制器。EchoWM 的做法是把「相机意图」抽象成唯一接口:第一人称下它就是观察者运动,第三人称下相机与角色的耦合关系直接从数据里学,不额外设计视角专用控制器。离散按键和连续位姿统一映射到带公制尺度的相对 6-DoF 轨迹,再做数据集级校准,让不同来源的数据保持一致的运动幅度。这套设计的价值在于它承认了一个现实:世界模型最终要交到用户手上被「玩」,而不是被离线打分。同一天他们还放出了姊妹工作 JoyAI-Echo-1.5(arXiv:2608.23383),专攻跨镜头记忆的长视频叙事,两篇合起来是一次完整的系统级发布。值得留意的是「音频」这一路终于被当成一等公民而非后期配音——长时程下环境声与语音能否保持同步,正在成为区分「视频生成器」和「世界模型」的一条硬指标。
  2. 少步蒸馏正在从「加速技巧」长成「交互能力的前提条件」 — Adobe 的 EditStream 把这个转变说得很清楚:它先用灵活的任务条件把文生视频、图生视频、视频转视频、编辑传播、参考图引导编辑、相机位姿变更六件事统一到一个 DiT 里,然后才做少步自回归蒸馏——因为不做蒸馏,这个统一模型就没法用于交互式创作。他们提出的 Velocity Moment Matching 值得关注:不是在教师的采样轨迹上做匹配,而是在学生自己走到的中间状态上匹配条件速度矩,再叠加自回归 unrolling 让学生暴露在自己的预测误差里。从 T2V 的对比图能直接读出差异——Self-forcing 版本几乎是把首帧复制了四遍(狗和狼都原地不动、龙灯几乎静止),VMM-forcing 才有真实的位移和形变。这条线索和 Loopy 是呼应的:Loopy 发现 DiT 内不同注意力层的位置编码对时序顺序的控制力差异极大,最强的那层可以当锚点,按层给不同的偏移量就能把「直线」时间感知掰成「圆」,从而无需训练地生成无缝循环。两篇一起看,说明视频 DiT 的时序机制还有相当多可被显式操纵的结构,不必事事回到重训。
  3. 评测这一侧开始追问「加速和对齐到底悄悄改掉了什么」 — DefaultShift 提了一个此前几乎没人测的问题:少步模型替换慢速模型时,那些提示里没指定的属性(颜色、背景、光照、视角)的分布会不会被悄悄改掉?他们把这个现象命名为语义默认漂移,并给出成对审计流程。结果相当刺眼——14 组参考/替换配对里,调整后的颜色差异从 0.054 到 0.303,且方向因加速配方而异:DMD2、Turbo、Lightning 整体偏暖,FLUX-schnell 反而偏灰。1000 张图的人工审计复现了同样的排序。这提示一个容易被忽略的成本:蒸馏的代价不止是画质,还有分布层面的偏移,而现有的质量/偏好/多样性指标都测不出来。FIRM-Video 则从奖励模型一侧收紧标准,用「先核查再打分」替代整体式打分——先把提示拆成带权重的原子需求,逐条对着时序视觉证据核验,只聚合被验证过的判断。它的 teaser 很有说服力:同一段有明显手柄形变的视频,GPT-5 给 4/5/5、Qwen3-VL-8B 给 5/5/5,人工标注是 3/2/5,只有 FIRM-Video-8B 对上了。当生成能力持续走高,能否可靠地「说出哪里错了」正在成为比刷分更稀缺的能力。

人工智能炼丹君 整理 | 2026-08-26


更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」

每日更新 · 论文精选 · 深度解读 · 技术脉络

微信搜索 人工智能炼丹君 或扫描下方二维码关注

扫码关注「人工智能炼丹君」

0

评论 (0)

取消
粤ICP备2021042327号