AIGC 每日速读|2026-09-03|Runway让界面直接生成而不再写代码-Solaris

人工智能炼丹君
2026-09-03 / 0 评论 / 5 阅读 / 正在检测是否收录...

今日 AIGC 论文速览

今日共 10 篇

重点论文标题列表

  • Solaris(Runway):界面逐帧生成而不再写代码
  • H3-World(腾讯 + 新加坡国立大学 + 香港理工大学):0.199%参数让33B模型可控
  • ZimaBlue(Joy Future Academy):12万小时视频抬成功率78%
  • PixSGR(电子科技大学):粗尺度注意力指路稀疏精修
  • Lapis(上海交通大学(教育部人工智能重点实验室 + 致远学院)):一步扩散把1080P深度提速7.6倍


今日论文速览

1. Solaris:界面逐帧生成而不再写代码

Solaris: Towards Interfaces That Are Generated, Not Coded | Runway | arXiv:2609.00776

关键词:界面世界模型,自回归帧生成,鼠标交互条件化,少步蒸馏,语言模型分工,Runway,Solaris

  • 前序问题:数字界面到今天为止都必须经过一层中间表示才能存在:你得先用代码把每个按钮长什么样、点下去会发生什么、状态怎么迁移,全部提前写清楚。这意味着界面的表现力被两件事同时限制住——一是所有可能的状态必须事先枚举,二是任何视觉细节都得能被代码这种符号系统表达出来。后者的损失并不抽象:论文自己做了一组重建实验,让多模态语言模型看一张界面截图再用代码把它复现出来,结果是随着视觉复杂度上升,重建保真度持续下降,而且这个趋势在不同能力的模型上都成立。也就是说这不是模型不够强的问题,而是「把视觉界面翻译成中间表示」这个动作本身就在丢信息。于是问题被重新提出来:能不能跳过代码,让界面的外观和行为都由一个生成模型在交互过程中直接产生?难点在于这要求模型在用户连续操作下保持视觉连贯,还得跑到交互可用的速度,而自回归视频生成通常两头都不满足。
  • 本文贡献:Solaris 的做法是把界面当成一个可交互的世界来建模,具体拆成三件事。第一,它把鼠标交互直接作为条件信号喂进模型,自回归地合成交互之后应该出现的视觉状态——注意这里的关键是闭环:每一帧生成出来之后,用户下一次操作的对象就是这一帧,所以模型必须自己承担状态维护。第二,为了在长时间连续交互下既跑得快又不崩,它把自回归帧生成、少步蒸馏、以及在模型自己输出上继续训练三者结合起来,后者是对抗自回归漂移的关键——只在真实数据上训练的模型会在自己产生的分布上迅速失稳。第三,也是架构上最值得注意的判断:它没让视觉模型独自承担一切,而是配一个语言模型专门解释用户意图、维护高层状态、并规定某次交互应该对生成环境产生什么影响,把「高层推理」和「视觉渲染」明确分开。这样界面的外观和行为都是动态生成的,不需要提前编程,因此可以支持开放式的交互——用户可以做设计者没预想过的操作。
Solaris 三层闭环:用户操作、世界模型、语言模型
How Solaris runs. Solaris is organized as three levels. The user acts on the frame with mouse and keyboard, the language model holds the state of the session and specifies what each action should mean, and the world model executes that intent, generating both the appearance and the behavior of the result.[-0.05cm]
  • 实验效果:论文的主证据是一场规模不小的人类偏好盲测:250 名参与者、7500 次响应,把 Solaris 生成的交互与语言模型写代码产出的界面两两对比。在「哪个结果更好地遵循了给定指令」这一问上,Solaris 拿到 62%、无偏好 13%、代码方案 25%;在「哪个在场景里表现得更自然」这一问上,Solaris 拿到 72%、无偏好 7%、代码方案 21%。两个问题的差距形态不同是有信息量的——后者赢得更多,说明生成式界面的优势主要不在把指令执行得多准,而在产生的交互与环境保持连贯。另一组重建保真度实验则从反面支撑动机:跨多个多模态语言模型,界面视觉复杂度越高,用代码重建的保真度越低。
250 人 7500 次盲测:Solaris 对 LLM 写代码界面的偏好率
Interface world models produce more natural interactions. Participants preferred Solaris over coded interfaces both for following the requested interaction and, by an even larger margin, for behaving naturally within the scene, highlighting the ability of interface world models to generate interactions that remain coherent with the environment.[-0.3cm]
  • 批判点评:把界面纳入世界模型的射程,这个问题的提法本身比方法更有价值。它指出的那处不适一直存在却少有人正面处理:界面必须提前枚举状态,而真实交互是开放的。用重建保真度实验来量化「经过代码这层中间表示要付多少代价」,也是个干净的论证方式——它把「代码表达力不足」从一句直觉变成了一条随复杂度下降的曲线。语言模型管状态和意图、视觉模型只管渲染这个分工,同样比让单个视觉模型硬扛更可信。但要清楚这篇的证据边界在哪里。首先,两组盲测的对照都是 LLM 写代码的界面,而不是人手写的成熟产品,所以 62%、72% 这两个数字回答的是「生成还是让 LLM 写代码」,完全没有回答「生成还是工程师写代码」。其次,论文图注自己写明这些数字在研究团队批准前是占位状态,引用时应当保守。第三,界面这个域对错误的容忍度极低——一个按钮偶尔画错位置在视频生成里是瑕疵,在界面里就是功能失效,而论文给的是聚合偏好率,没有给出「关键交互失败率」这类更接近可用性的指标。第四,语言模型与世界模型的分工在延迟上是有代价的,实时性论文用「交互速度」概括,缺少明确的帧率与端到端时延数字。这些不影响它作为方向性工作的价值,但离「界面可以不写代码了」还隔着一段工程距离。

2. H3-World:0.199%参数让33B模型可控

H3-World: Turning Language Understanding into World Control | 腾讯 + 新加坡国立大学 + 香港理工大学 | arXiv:2609.01560

关键词:交互世界模型,语言即控制接口,时间注意力路由,LoRA轻量适配,MiniMax-H3,腾讯,H3-World

  • 前序问题:把大视频生成器改造成可交互世界模型,主流做法是加一个专门的动作模块:设计动作编码器、动作嵌入空间,甚至改网络结构,然后用大量带动作标签的数据去训。这条路的代价是双重的——既要重新学一套动作到视觉的映射,又容易破坏预训练模型本来的生成质量。但论文注意到一件事:随着视频生成器变强,它们其实已经能零样本响应自然语言里的控制意图了,MiniMax-H3 就能靠自然语言指令控制角色行为和镜头运动。问题是这种语言接口太粗——你说「角色向左横移,镜头缓慢右摇」,模型大致能做,但它不知道这个动作该发生在第几帧到第几帧,也不知道多个连续动作之间的边界在哪里,指令的影响会在时间轴上互相泄漏。所以真正的问题不是「怎么给模型加动作能力」,而是「怎么把已经存在的粗糙语言控制,变成时间上精确、动作之间不串味的世界控制」,并且不能引入专用动作模块、不能付大规模重训的代价。
  • 本文贡献:H3-World 的三步都围绕「复用而非新建」。第一步是动作表示:它不发明动作嵌入,而是把每个动作写成角色指令与镜头指令的结构化组合(比如角色「向后走并向左横移」、镜头「缓慢右摇并上抬」),这样动作天然落在预训练模型已经理解的语言空间里。第二步是时间对齐:把这些动作提示独立编码后,与静态语义条件、初始观测、视频 latent 一起打包成一条序列,每个动作跨度与它对应的视频 latent 帧段绑定。第三步是关键设计——时间注意力路由,通过掩码把每条指令的作用范围限制在它意图生效的时间区间内,同时保持视频 latent 之间的双向注意力,这就直接压住了动作之间的控制泄漏。适配用 LoRA 加在 H3 自注意力的 QKV 与输出投影上,走单出口路由:每个动作跨度只连到它匹配的视频 latent。整个改造的代价是 8000 条游戏样本、10000 步 LoRA 优化、0.199% 可训练参数。
H3-World 三步改造:打包序列、适配 H3 块、自注意力内 LoRA
Overview of H3-World. (a) Latent-aligned action prompts are independently encoded and packed with the static semantic condition, initial observation, and video latents. (b) MiniMax-H3 processes the packed sequence through single-stream self-attention. (c) LoRA adapts the attention projections under single-egress routing, which connects each action span directly to its matched video latent and retains bidirectional attention among video latents.
  • 实验效果:在这么轻的适配预算下,H3-World 实现了有效的角色与镜头控制,同时保住了原模型的生成质量——这一点很重要,因为加专用动作模块的方案常常在获得可控性的同时损失画质。论文给的定性证据分两类:一是对照录制控制的复现,把真实录制视频与 H3-World 从同一初始观测和同一动作序列生成的结果上下对照,检验它是否跟得上真实操作;二是受控动作干预,固定初始观测、随机种子和采样配置只改动作指令,结果产生了明显不同的角色运动与镜头运动,包括幅度更大的快速摇镜。它还能泛化到训练时没见过的场景,说明复用预训练语义表示这一判断是站得住的。
固定初始观测与随机种子,只改动作指令的受控对比
Controlled action comparison. The initial observation, seed, and sampling configuration are fixed across rows. Changing the action produces distinct character and camera motion, including stronger fast pans.
  • 批判点评:这篇最有价值的地方是它选择相信预训练模型已有的能力。当所有人都在给视频模型加动作模块时,它先去问「模型是不是已经会了,只是接口太糙」,答案是会——那么工作量就从「教会」变成了「校准」,代价从大规模重训降到 0.199% 参数。时间注意力路由是这个思路里最实的一块:控制泄漏是语言接口的固有缺陷,用掩码把每条指令钉在它的时间区间上,比用更多数据去「教」模型区分先后要直接得多。而且它保留了视频 latent 之间的双向注意力,没有为了时序精度牺牲生成一致性。但这条路径的边界也很清楚。第一,它的可控性天花板被基座模型的语言理解压着——H3 听不懂的动作,路由和 LoRA 都补不出来,所以这套方法能走多远高度依赖基座,换个语言控制能力弱的模型可能直接失效。第二,动作被写成「角色指令 + 镜头指令」的结构化组合,这个词汇表是人定的,面对需要精细连续量的控制(力度、速度、精确位移)时,语言的分辨率本身就不够。第三,摘要层面缺少量化的可控性指标和与其他交互世界模型的横向对比,仅有定性对照,「有效控制」的强度难以判断。第四,8000 条游戏样本这个量级说明验证还停留在游戏域,而游戏场景的动作空间比真实世界规整得多。

3. ZimaBlue:12万小时视频抬成功率78%

ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training | Joy Future Academy | arXiv:2609.00188

关键词:世界动作模型,具身视频预训练,Slow-Fast双系统,统一动作表示,扩散步蒸馏,机器人操作,ZimaBlue

  • 前序问题:机器人操作有一个绕不过去的扩展性矛盾:要泛化就需要广泛的物理经验,但带动作标签的机器人轨迹采集昂贵,且天然缺乏多样性——一个实验室能覆盖的场景、物体、任务组合太有限。与此同时,第一人称视频是一种量级完全不同的具身经验来源,里面有物体交互、接触动力学、工具使用、长程行为,跨越各种环境。矛盾点在于这些视频没有动作标签,无法直接监督控制策略。所以核心问题是:怎么把这种丰富但无动作的经验,转化成真正可用的机器人控制能力。这里还叠加了一个部署侧的硬约束:生成式世界模型天生慢,而闭环控制要求高频动作输出,一个能预测未来视频的大模型如果只能跑几赫兹,在真机上就没有意义。所以方法不仅要解决数据转化,还得同时解决实时性,两者往往互相拉扯——模型越大越懂物理,也越跑不动。
  • 本文贡献:ZimaBlue 的答案分成训练课程和推理架构两半。训练是三阶段的数据金字塔:阶段一在大规模人类与机器人第一人称视频上做因果化具身视频预训练,只学通用视觉动力学,完全不需要动作监督;阶段二引入多种本体的机器人动作,用统一动作表示把学到的视觉动力学接地到跨本体控制上,这一步是「无动作经验」转化为「可执行控制」的枢纽;阶段三针对目标机器人与目标基准做特化以便部署。推理侧是异步 Slow-Fast 双系统:Slow 分支是一个 5B 的 DiT,吃观测、机器人状态、语言指令加带噪视频与动作 token,联合预测未来视频 latent 与对应动作(后者只作为视频-动作对齐的辅助监督),并导出逐层视频 K/V 缓存;Fast 分支是 0.5B DiT,吃更新后的观测与状态,把 Slow 的视频 K/V 注入自注意力,产出用于高频闭环的细粒度动作。两条分支频率不同,Slow 慢跑提供可泛化的时空表示,Fast 快跑保证控制率,中间还用扩散步蒸馏与编译进一步压延迟。
ZimaBlue 的 Slow-Fast 双系统架构
Slow-Fast dual-system architecture. The Slow DiT processes observations, robot state, language instruction, along with noisy video and action tokens, to jointly predict future video latents and their corresponding actions (serves only as auxiliary supervision for video-action alignment). Concurrently, the Fast DiT ingests the updated observation and state, conditioned on the Slow DiT's video K/V caches, to generate fine-grained final actions for high-frequency closed-loop control.
  • 实验效果:最能说明问题的是那条数据扩展曲线:真机零样本评测下,从「只用目标机器人自己的数据」扩展到 12 万小时以上的具身视频,成功率从 36.1% 提到 77.8%。这个 2 倍以上的提升几乎全部来自不带动作标签的视频,直接回答了「无动作经验值不值得用」这个问题。实时性方面,Slow-Fast 异步架构让 Fast 分支在单张 NVIDIA RTX 4090 上做到 30 Hz 动作预测——注意这是消费级卡,不是数据中心配置,对真机部署的意义比在 A100 上跑通更大。论文还提供了 RoboTwin、RoboCasa、LIBERO-Plus 等仿真基准的分任务结果,以及真机扰动条件(视觉偏移、物体重定位等)下的案例评测。
三阶段数据金字塔:从广泛视觉多样性到部署本体
Data pyramid. Three-stage training progresses from broad visual diversity to deployment-specific embodiment. romannumeral 1 (Pre-training) learns general visual dynamics from diverse video sources without action supervision. romannumeral 2 (Mid-training) introduces robot actions from multiple embodiments, grounding visual dynamics in cross-embodiment control. romannumeral 3 (Post-training) specializes the model on target embodiments and benchmarks for deployment.
  • 批判点评:这篇把「用无动作视频扩机器人能力」从一个人人认同的方向变成了一条可以摆出来的曲线,36.1%→77.8% 这个数字的说服力在于它是真机零样本,不是仿真里刷出来的。三阶段课程的分工也清晰:预训练学动力学、中训练接地到动作、后训练特化部署,每一步要什么数据、解决什么问题都对得上。Slow-Fast 用 K/V 缓存做跨分支信息传递是个漂亮的工程解——不是简单地把大模型蒸馏成小模型,而是让小模型直接读大模型的中间表示,在单卡 4090 上拿到 30 Hz 是有实际部署价值的。但需要注意几点。第一,36.1%→77.8% 的对照是自身消融(只用目标机器人数据 vs 加 12 万小时视频),不是与其他 VLA 方法的横向比较,所以它证明的是「数据扩展有效」,不能直接读成「ZimaBlue 优于其他方法」。第二,Slow 分支输出的 K/V 缓存有个内在时滞——论文自己用 outdated 标注了这一点,也就是 Fast 分支正在依据一份基于过去观测的世界预测来行动,在场景快速变化时这份缓存的可靠性会下降,而这个失效边界论文没有量化。第三,12 万小时的数据规模本身构成了一道复现门槛,这个量级的第一人称视频不是多数团队能获取的,方法的可迁移性因此打折。第四,署名机构 Joy Future Academy 是个新出现的名字,源码里的作者上标标注的是任务分工(数据、预训练、中训练、后训练、双系统、加速、部署)而非机构隶属,实际的组织背景不透明,只有 Supervision 一栏出现了 Nan Duan。

4. PixSGR:粗尺度注意力指路稀疏精修

Advanced Pixel Diffusion Model with Guided Sparse Global Refinement | 电子科技大学 | arXiv:2609.00798

关键词:像素空间扩散,稀疏全局精修,跨尺度token打分,瓶颈监督,ImageNet FID 1.51,电子科技大学,PixSGR

  • 前序问题:像素空间扩散最近重新被看好,因为它绕开了 VAE 这一层压缩、直接在原始像素域建模分布,保真度上限更高。代价是维度爆炸——自然图像的像素维度极高,注意力算不动。现有方案的两种妥协各有明显后果:一种是用大 patch 做 tokenization,这会直接牺牲细节;另一种是在大 patch 内部做精修,但精修被锁在单个 patch 里,跨 patch 边界的结构连续性和长程 token 交互就丢了,具体表现为结构断裂。论文还给了一个观察来支撑它的切入点:可视化不同 Transformer 块与不同时间步的注意力图能看到,随着网络深度增加,注意力越来越集中在少数区域上。这个现象很关键——它意味着在有限的注意力预算下做全局精修不是没戏,因为真正需要交互的 token 本来就是少数,问题只是怎么在算之前就把它们找出来。
  • 本文贡献:PixSGR 的框架是一条由粗到细逐步展开的路径。起点是一个有监督的低通道瓶颈:先用低维表示高效捕捉自然图像的低维流形,而且这个瓶颈是被显式监督的——论文的可视化对比显示,加了瓶颈损失之后的瓶颈特征明显更结构化、语义更清晰,不加则杂乱。之后逐步扩展通道维度与空间分辨率,一层层恢复更细的结构。核心创新在空间精修阶段:跨尺度 token 打分,用粗尺度已经算好的注意力图来预选真正全局相关的交互,据此把细尺度注意力预先稀疏化。这样就能做超出单个 patch 的非局部精修,同时避开稠密注意力的二次代价——注意这与「先算完再剪枝」是相反的顺序,稀疏模式是在算之前就由粗尺度决定的。瓶颈通路另外提供一路辅助的干净图像预测,最终结果由一个卷积上采样头产出。论文还对瓶颈损失的权重与施加位置分别做了消融。
PixSGR 框架:低通道瓶颈到稀疏全局精修
Overview of the proposed PixSGR framework. PixSGR starts with supervised low-channel bottleneck blocks, expands the channel dimensionality in subsequent Transformer blocks, and performs spatial refinement with sparse attention. Cross-scale token scoring transfers coarse attention patterns to guide fine-scale sparse global interactions. The bottleneck pathway provides an auxiliary clean-image prediction, while a convolutional upsampling head produces the final prediction.
  • 实验效果:ImageNet 上的验证是直接的:256×256 分辨率下 FID 达到 1.51,而且扩到 512×512 时性能保持,FID 1.60。这个「放大分辨率不掉点」的性质对像素空间扩散尤其有意义,因为该路线最容易在高分辨率上崩。消融部分给出了两条支撑:一是瓶颈损失权重的影响,二是施加该损失的网络位置的影响,说明「有监督的低通道瓶颈」不是可有可无的装饰。注意力图可视化则从机理侧支撑了稀疏化的合理性——深层注意力本来就高度集中,所以预先筛掉大部分交互并不会损失多少信息。
两处关键设计的分析:瓶颈监督与注意力集中现象
Analysis of the key designs in our PixSGR framework. (a) Bottleneck feature visualization with and without the supervision of $\mathcal{L}_{\mathrm{bot}}$. Compared with the baseline, the supervised feature produces more structured and semantically meaningful coarse representations. (b) Attention map visualization across different Transformer blocks and timesteps. As the network depth increases, attention becomes increasingly concentrated on fewer regions, motivating sparse global refinement under a limited attention budget.
  • 批判点评:这篇的思路顺序值得注意:它先用注意力图可视化确认了「深层注意力天然集中」这个事实,再据此设计稀疏化,而不是先假定稀疏可行再补实验。这让跨尺度 token 打分显得不像一个技巧而像一个推论——如果注意力本来就只关心少数区域,那么用便宜的粗尺度注意力去预测哪些区域值得算,逻辑上就是自洽的。而且它是「算前定稀疏」不是「算后剪枝」,真正省下了计算。有监督低通道瓶颈那组特征可视化对比也很有说服力,直接展示了不加监督时表示会杂乱。ImageNet 256 的 FID 1.51 与 512 的 1.60 放在像素空间扩散这条线上是有竞争力的成绩,尤其是放大不掉点这一点。但有几处需要保留判断。第一,摘要给的是 FID 而没有给同预算下的实测延迟或吞吐对比,而这篇的卖点恰恰是效率——「避免二次代价」是理论层面的陈述,实际稀疏注意力在 GPU 上能否兑现理论加速,取决于稀疏模式是否规整,这一点没有交代。第二,稀疏模式由粗尺度注意力决定,那么粗尺度判断错误时细尺度就没有补救机会,这种误差传播的鲁棒性缺少分析。第三,验证只在 ImageNet 类条件生成上,没有文本到图像的结果,而后者的注意力分布形态与类条件差别很大。

5. Lapis:一步扩散把1080P深度提速7.6倍

Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention | 上海交通大学(教育部人工智能重点实验室 + 致远学院) | arXiv:2608.30129

关键词:单目深度估计,一步扩散,线性注意力,像素空间x预测,ECCV 2026,上海交通大学,Lapis

  • 前序问题:用生成式框架做单目深度估计这几年确实把细节保真度推上去了,但代价在高分辨率场景下变得不可接受:标准注意力是 O(N²),多步去噪又要重复付这个代价,两者叠加使得 1080P、1440P 这类实际应用分辨率下延迟高得没法用。直觉上的解法是换线性注意力加一步预测,但论文指出直接这么做会立刻暴露三个问题——结构一致性变差、细节丢失、噪声残留。原因不难理解:线性注意力削弱了全局建模能力,深度图这种需要全局一致布局的输出最吃亏;而一步去噪意味着没有后续步骤来修正采样噪声,误差无处消化。所以问题不是「能不能用线性注意力和一步扩散」,而是「怎么把这两个手段引入之后被削掉的全局一致性、边界锐度和抗噪能力,用别的机制补回来」,而且补回来的成本不能把省下的算力再吃掉。
  • 本文贡献:Lapis 用一条由粗到细的层级来分别修补上述三处损失。全局一致性交给 Patch 级一致性模块:它接入预训练语义先验(DINOv2)来强制全局连贯,同时引入局部卷积偏置来保证相邻 patch 之间的结构连续,具体是在 FFN 里加一路残差 3×3 深度卷积(论文称 ConvFFN),并用 AdaLN-Zero 做调制。边界锐度交给 Pixel 级精修模块:通过基于跳连的像素对应关系恢复清晰几何边界,输入是 unpatchify 之后的 token 与编码的 RGBD,走同样的调制结构。抗噪则靠预测目标的选择:一步扩散的采样噪声本质上是偏离干净数据流形,于是它利用流形假设直接采用 x 预测策略,把目标定在干净数据流形上,而不是预测噪声再反解。训练损失除 MSE 外还加了直接作用在 x 空间的多尺度梯度匹配损失来提升深度图锐度。整个框架是像素空间的 x 预测加一步去噪。
Lapis 架构:线性化 DiT 加双模块补偿
  • 实验效果:多个基准上 Lapis 同时拿到 SOTA 精度与边界锐度,覆盖不同分辨率。效率数字是最直观的:相比此前的 SOTA 生成式方法,1080P 下推理延迟降低最多 7.6 倍、1440P 下降低最多 10.9 倍——注意倍数随分辨率上升而变大,这正是 O(N²) 到线性的差异在高分辨率上的体现,也说明这套方法越往高分辨率越划算。论文另外展示了测试时分辨率扩展的现象:输入分辨率提高,模型产出的细节更细,说明它在训练分辨率之外仍然可用。附录还给了边缘感知的点云评测(Chamfer 距离)与模型规格表。
跨分辨率的精度与边界锐度对比
  • 批判点评:这篇的结构很干净:它没有把线性注意力和一步扩散当成免费午餐,而是先明确列出这么换会丢什么(结构一致性、细节、噪声),再逐条给出补偿机制,最后用一个由粗到细的层级把它们组织起来。三处补偿的针对性都对得上——用 DINOv2 语义先验补全局、用深度卷积补 patch 间连续、用 x 预测把一步采样的噪声问题转化成流形对齐问题。特别是 x 预测这一步,它把「一步去噪没有后续步骤纠错」这个结构性缺陷绕开了,而不是靠加大模型硬扛。加速倍数随分辨率上升而变大也是自洽的,符合复杂度分析的预期。但要注意几点。第一,7.6× 与 10.9× 的对照是此前的 SOTA 生成式方法,而深度估计领域还有大量前馈判别式模型本来就很快,这篇没有和它们比延迟,所以「高效」是在生成式这个子类内部成立的。第二,加速比高度依赖分辨率,在常见的 512 或 768 输入下收益会显著缩水,论文用最大值表述容易让人高估通用收益。第三,全局一致性依赖 DINOv2 的语义先验,那么在 DINOv2 表现弱的域(低光、水下、医学)上这套补偿是否还成立,缺少验证。第四,测试时分辨率扩展被作为优点展示,但更高分辨率下细节增多也可能是幻觉细节增多,论文用可视化呈现而没有给对应的量化误差曲线。

6. SinkPruner:高范数token其实是冗余不是线索

SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models | 香港中文大学 + Weitu AI + 北京大学 | arXiv:2609.01004

关键词:视觉token剪枝,高范数离群token,注意力汇聚(attention sink),视觉净化器,EMNLP 2026,香港中文大学,SinkPruner

  • 前序问题:多模态大模型处理长视觉 token 序列的计算开销很大,剪枝是主流省法,做法上分视觉中心与文本引导两类。但论文指出这两类方法共有一个盲区:高范数离群 token——特征范数异常大的那些 token。问题出在这些 token 恰好会在注意力排序里占据高位,于是被现有方法当成信息量大的重要线索保留下来。论文的观察是相反的:这些高范数离群 token 在特征维度和空间维度上都高度冗余,也就是说它们既不携带独特信息,也不覆盖独特区域,被保留纯属误判。更麻烦的是保留它们会带来连锁后果——它们在 LLM 解码器里形成注意力汇聚(attention sink),把注意力权重大量吸走,造成注意力偏置与注意力弥散,让真正相关的视觉 token 分不到权重。所以这不是「剪枝比例还能不能再高」的问题,而是「现有剪枝方法一直在保留错误的东西」。
  • 本文贡献:SinkPruner 是训练无关的,采用由粗到细的两模块设计。第一个模块是视觉净化器:它先识别高范数离群 token,把它们聚合成单个汇聚 token(而不是简单丢弃,保留其统计作用但不再占据序列位置),再通过注意力过滤与相似度过滤两道筛选出真正有信息量的保留 token。这一步的直接效果是同时缓解注意力汇聚与注意力弥散两个症状。第二个模块是文本引导剪枝器:净化后的视觉序列再与文本 token 交互,利用累积的文本到视觉注意力,只留下与查询语义对齐的视觉 token。两个模块的顺序是有讲究的——先做与文本无关的净化,再做与查询相关的选择,这样文本引导阶段面对的已经是一个没有离群干扰的序列,其注意力信号才可信。论文用散点图量化了净化效果:标准文本引导方法(如 SparseVLM)处于高汇聚状态,汇聚 token 比例 14.23%,而 SinkPruner 把这个比例压到 3.85%。
SinkPruner 两阶段:视觉净化器与文本引导剪枝器
SinkPruner framework. % Left (Visual Sanitizer): As shown in the Attention Ranking (far left), high-norm outlier tokens (purple) dominate the top ranks despite being background noise. We aggregate these outliers into a single sink token (red hashed) and select informative reserved tokens (orange) via attention and similarity filtering. % Right (Text-Guided Pruner): The purified visual sequence further interacts with text tokens (green), utilizing accumulated text-to-vision attention to retain only semantically relevant visual tokens.
  • 实验效果:在 12 个图文基准与 4 个视频语言基准上验证。最有代表性的数字是压缩强度下的性能保持:在 89% token 削减率下,LLaVA-1.5 仍保住 96.5% 的原始性能,Qwen2.5-VL 保住 91.8%。汇聚比例从 14.23% 降到 3.85% 提供了机理层面的证据,说明性能保持不是碰巧而是确实消除了注意力偏置。另一个有意思的结果是可迁移性:视觉净化器可以单独接到现有剪枝方法上提升它们的性能,说明「先清离群再选 token」这个前置步骤有独立价值,不必整套替换。
LLM 解码器中视觉注意力汇聚的分布对比
Distribution of Visual Attention Sinks in LLM Decoder. % We visualize the relationship between attention weights (y-axis) and massive activation values in sink dimensions (x-axis). % (Left) Standard text-guided methods retain a large cluster of sink tokens (red line, value $>5$), resulting in a high sink ratio of 14.23%. % (Right) Our approach, by filtering visual outliers upstream, suppresses these massive activations, significantly reducing the sink ratio to 3.85% and alleviating attention bias.
  • 批判点评:这篇的价值在于它推翻了一条被广泛沿用的判据。剪枝方法普遍拿注意力权重当重要性代理,而它指出这个代理在高范数离群 token 上系统性失效——那些 token 排名高不是因为重要,而是因为范数大。这个反直觉的发现有实证支撑(特征与空间双维度冗余、汇聚比例 14.23%→3.85%),也解释了为什么以往方法在高压缩率下崩得快。把离群 token 聚合成单个汇聚 token 而不是直接扔,是个细致的处理——保留其吸收作用但不让它占位。两模块的先后顺序也有道理:先做与查询无关的净化,文本引导阶段的注意力信号才干净。视觉净化器能单独加到别的方法上提升效果,进一步说明这个前置步骤是可分离的真贡献。但有几点需要注意。第一,两个骨干的保持率差距不小(96.5% vs 91.8%),说明收益取决于骨干本身的冗余程度,Qwen2.5-VL 这种更强的模型上收益明显缩水,那么在下一代骨干上还剩多少不好判断。第二,性能保持率是跨 16 个基准的汇总,掩盖了任务间的方差——细粒度定位、OCR 这类依赖特定空间位置的任务对剪枝远比 VQA 敏感,摘要层面看不到最差情况。第三,89% 是个很激进的削减率,摘要没有给出不同削减率下的性能曲线,无法判断这个方法的性能衰减是平缓还是在某个阈值突然崩。第四,「高范数离群 token 是冗余的」这个结论建立在当前视觉编码器的伪影特性上,如果编码器架构改变(例如换成没有 register token 伪影的编码器),这条前提可能不再成立。

7. UMM-Synergy:统一多模态模型不是放一起就协同

Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System | 南洋理工大学 S-Lab + 商汤研究院 | arXiv:2609.01607

关键词:统一多模态模型,理解生成协同,任务解耦MoT,逐层探针,端到端优于流水线,南洋理工大学,UMM-Synergy

  • 前序问题:统一多模态模型现在很热,但热度掩盖了一个基本问题没被回答:把视觉理解和视觉生成放进同一个模型,功能上统一了,学习上真的协同吗?论文把这个模糊问题拆成三种可能——两个目标互相增强、争夺容量、或者仅仅共存互不影响。这三种情形对架构设计的含义完全不同,但过去的工作大多直接展示统一模型能做两类任务,很少去检验中间发生了什么。检验这件事本身有难度:绝大多数统一模型都用了预训练视觉先验(视觉编码器或扩散先验),这些先验会把「协同效应」和「先验本身带来的收益」混在一起,无法归因。所以论文要求一个结构上原生、不含预训练视觉先验的受控设定,才能干净地观察两个目标之间的关系。这个方法论要求本身就是这篇工作的一部分——不这么做,任何关于协同的结论都可能是先验的功劳。
  • 本文贡献:论文在受控原生设定下从三个层面展开。表示层:用逐层探针(语义分类、mIoU、深度 R-MSE)检查两个目标对视觉表示的影响,同时对比三种架构——稠密共享(所有 token 走同一个 LLM 解码器)、模态解耦 MoT(文本留在 LLM、所有视觉 token 走从零训练的分支)、任务解耦 MoT(理解用的视觉 token 保持语言锚定、只把生成用的视觉 token 特化)。任务层:通过三个案例研究检验双向迁移是否发生。系统层:把端到端统一模型与一个理解、生成能力相当的规划器-执行器流水线做对比。核心发现有三条:第一,两个目标确实互相提供有用信号——生成会丰富用于理解的视觉特征,理解会强化用于生成的视觉语言对齐;但如果两个目标被强迫走同一条计算路径,其中一个会压倒另一个,造成不对称退化,而任务解耦架构(特化冲突的视觉计算、保留语义交互)能避免这种退化。第二,当理解与生成任务依赖共享知识时会出现正向双向迁移。第三,在明确同时需要图像理解与生成的复杂任务上,端到端统一模型优于能力相当的流水线组合。
三种统一多模态架构对比
Illustration of different architectures in our study. (a) Dense sharing sends all tokens through the same LLM decoder. (b) Modality-decoupled MoT keeps text in the LLM and sends all visual tokens through a scratch-trained branch. (c) Task-decoupled MoT keeps Und-V language-anchored while specializing Gen-V. For simplicity, we omit the pre-buffer layers here.
  • 实验效果:逐层探针给出的证据是具体的:联合训练确实强化了视觉表示,在语义与几何两类探测任务上都有提升,而且最明显的收益出现在早期与中间层。PCA 可视化从另一个角度佐证——把 patch 级特征投到共享的三维 PCA 基上做 RGB 图,联合训练产生的物体区域更连贯、空间结构更清晰,与冻结探针的结论一致。架构对比说明的是不对称退化的存在与任务解耦 MoT 的缓解作用。系统层对比则说明统一模型的价值不止于接口统一——在需要理解与生成配合的复杂任务上,端到端优化的收益是流水线拿不到的。
逐层探针:联合训练如何改变视觉表示
Layer-wise probing experiments of visual representations. Higher is better for classification and mIoU; lower is better for depth R-MSE. Joint training strengthens visual representations, with the clearest gains in early and middle layers across semantic and geometric probing tasks.
  • 批判点评:这篇的贡献主要在方法论。它注意到「统一模型有协同效应」这个说法一直缺少干净的证据,因为预训练视觉先验会污染归因,于是主动选择了一个更难做但可解释的受控设定——结构原生、无视觉先验。这个选择让它的结论比同类工作可信得多。三层拆解也很清晰:表示层用探针看内部、任务层看迁移、系统层比端到端与流水线,每层各自可证伪。最有实操价值的发现是「不对称退化」:两个目标确实互惠,但共享同一条计算路径时其中一个会压倒另一个,因此任务解耦(只特化冲突的视觉计算、保住语义交互)是必要的——这直接是架构选型建议。端到端优于同等能力流水线这一条,则给「为什么不用两个专门模型拼起来」提供了实证回应。但受控设定的代价也在这里。第一,无预训练视觉先验是为了干净归因,而现实中的统一模型几乎全都带先验,那么「生成丰富理解表示」这个收益在已有强视觉编码器的情况下还剩多少,很可能大幅缩水甚至消失——论文没有验证这一点,这是结论外推时最需要警惕的地方。第二,受控设定通常意味着模型规模不大,而容量竞争这个现象本身高度依赖规模,小模型上观察到的不对称退化在大模型上可能因容量充足而消失。第三,摘要层面给的是趋势性表述(「最清晰的收益在早中层」)而非可比的量化幅度,读者难以判断协同效应的强度。

8. ReNFT:已崩的奖励模型能修回多样性

ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration | 南方科技大学 + 腾讯优图实验室 | arXiv:2609.00061

关键词:奖励后训练,模式崩塌修复,概率质量重校准,反枢纽提示,双路混采,腾讯优图,ReNFT

  • 前序问题:扩散生成器做奖励后训练几乎必然付一个代价:概率质量会向少数几个被奖励偏好的模式集中,同一个提示下的输出多样性被抹掉。这就是模式崩塌。现有的缓解手段都依赖外部信号或外部接口——在奖励里加感知目标、调整参考正则、或者改文本编码器。这些做法的共同局限是它们都是预防性的:能在训练时抑制崩塌发生,但没有一个能修复一个已经崩掉的适配器,更做不到在修复的同时保住已经拿到的奖励收益。而这恰恰是实践中最常见的处境:你已经花了算力做完后训练、拿到了高奖励,然后发现多样性没了,此时重新训练成本高昂而且未必避得开同样的坑。论文的切入点是一个观察:在线后训练主要是在重新分配从预训练继承来的能力上的概率质量,而不是学习新的视觉内容。如果这个判断成立,崩塌就是抑制而不是删除,那它原则上可以从生成器内部逆转。
  • 本文贡献:ReNFT 就是在这个判断上构造的内部概率质量重校准流程,分三步。第一步是无条件探针:先找出「反枢纽」提示——即与提示无关的偏置最容易暴露出来的那些提示,把修复算力优先投在这里。第二步是两条策略主导的混合路径:从同一个提示、同一个初始噪声出发生成配对的反事实提案,一条探测冻结基座方向以找出被抑制的替代模式,另一条暴露后训练之后的无条件倾向。这个「同噪声配对」的设计是关键,它保证了两个提案的差异只来自路径而不是采样随机性。第三步是奖励排序加自适应翻转保护:对每一配对做奖励排序来指派拉(pull)与推(push)角色,翻转保护则强制每组的拉比例有 0.5 的下限,防止修复过程被奖励信号带回崩塌方向,最后用联合配对的 NFT 更新实现修复。整个过程不改奖励函数、不动文本编码器,只在生成器内部重新分配概率质量。
ReNFT 三步修复流程
ReNFT pipeline. (a) Unconditional probes prioritize anti-hub prompts; (b) two policy-dominated mixed routes generate matched proposals from the same prompt and initial noise; (c) reward ranking and the adaptive flipping guard assign pull/push targets for joint-and-paired NFT repair. The VAE decoder is omitted for clarity.
  • 实验效果:两个基准上的结果都体现了同一种权衡结构:在 PickScore 上保住 NFT 奖励的 98.9%,同时把 DreamSim-Div(多样性指标)提高 58.8%;在 GenEval 上保住 99.0% 的奖励,多样性提高 55.0%。这组数字的意义在于它证明奖励与多样性并非必须互斥——付出约 1% 的奖励损失可以换回超过五成的多样性恢复。论文另外给了训练动态曲线:ReNFT 从已经崩掉的检查点分叉出来、修复 50 步,可以看到奖励与多样性两条曲线的走向;以及混合路径模式与反枢纽选择的消融,说明这两个设计不是可选装饰。自适应翻转保护的效果也被单独可视化——原始拉比例与加保护后的比例对比。
训练动态与消融:奖励与多样性的走向
Training dynamics and ablations. (a)(b): PickScore reward and DreamSim-Div; (c)(d): GenEval reward and DreamSim-Div. ReNFT branches from the hacked checkpoint $H$ (star) and repairs for 50 steps; the dashed line marks the base generator. (e)(f): mixed-route pattern and anti-hub ablations after 50 repair steps from the same $H$; the dashed line marks NFT at $H$.
  • 批判点评:这篇提的问题是真实的工程处境:后训练做完、奖励拿到、多样性没了,重训代价高。它给出的判断——崩塌是抑制不是删除,因此可以从内部逆转——是整篇的支点,而且这个支点建立在一个可检验的观察上(在线后训练主要重新分配预训练已有的能力,而非学新内容)。三步设计各有针对性:反枢纽提示把修复算力投在偏置最暴露处,同噪声配对保证两条路径的差异不被采样随机性污染,翻转保护则挡住修复过程被奖励拉回崩塌。98.9% 奖励保持换 58.8% 多样性提升这个交换比很有说服力,说明两者的对立没有想象中那么硬。但要注意几点。第一,基线是 NFT 自身,不是其他抗崩塌方法,所以这组数字回答的是「能不能修」而不是「修比预防好」,实践中如果预防型方法本来就能避开崩塌,ReNFT 的适用场景会窄很多。第二,DreamSim-Div 是多样性的代理指标,提升五成不等于人眼感知的多样性提升五成,也不排除多样性提升伴随质量方差变大——这方面缺少人类评估。第三,修复预算是 50 步,这个预算是怎么定的、多样性恢复是否会随步数继续提升或反转,摘要层面看不到。第四,方法针对的是「适配器已崩」这一具体形态(LoRA 类后训练),对全参数后训练造成的崩塌是否同样适用,没有交代。

9. PredErase:删物体要连影子一起删掉

PredErase: Training-Free Object-and-Effect Removal with Predictive Latent Guidance | 香港大学 + 中山大学 | arXiv:2609.00956

关键词:物体移除,训练无关推理,I-JEPA预测引导,接触带先验,FLUX.2 Fill,香港大学,PredErase

  • 前序问题:论文开头那句话就是它的全部动机:移除一个物体不等于填掉它的掩码。投射的阴影、接触处的暗化通常落在用户给的实例掩码之外,所以一个只在掩码内编辑的冻结 Fill 模型,会把物体的光度足迹留在周围表面上——物体不见了,它的影子还在,结果比不删更违和。有监督的移除模型通过配对的干净底板数据学到了这种联合擦除,但需要专门的成对数据与离线训练。训练无关的编辑器则冻结预训练权重,可它们大多把实例掩码当成全部可编辑区域,并且用 CLIP 或 DINO 这类能量去引导采样——这些能量的问题在于它们不预测被遮挡区域应该是什么,只是度量相似性,因此无法告诉模型洞里该长出什么结构。所以问题变成:在完全不训练的前提下,怎么同时解决「哪里可以改」和「改成什么」这两件事。
  • 本文贡献:PredErase 把这两个问题明确分开处理,跑在冻结的 FLUX.2 与 I-JEPA 上。「哪里可以改」用接触带先验解决:对实例掩码 M_obj 做距离变换得到上下文图,据此膨胀出一个包含接触带与阴影带的编辑支撑 M_flux,这样局部残留(支撑平面上的阴影与接触暗化)就被暴露在可编辑范围内。「改成什么」用预测式引导解决:先把图像的物体区域灰填,让为掩码 token 预测而预训练的 I-JEPA 在表示空间给出一个基于上下文条件的洞内目标并缓存下来——注意 I-JEPA 的训练目标本来就是预测被遮挡内容,这与 CLIP/DINO 的相似性度量有本质区别。采样时冻结的 FLUX.2-klein-4B 沿自己的原生轨迹走,只在 t∈{4,2} 两个时间步上把解码出的 Fill 补全与缓存目标做稀疏投影梯度对齐,并且投影保证在可编辑 latent 支撑之外的额外更新为零——即打包支撑外的坐标被锁住,不会被引导带偏。全程不更新任何模型权重。
PredErase 训练无关管线:分开回答「填什么」与「哪能改」
PredErase training-free pipeline. Top: gray-filled $I_{\mathrm{vis}}$ lets frozen I-JEPA predict and cache hole tokens $\mathbf{E}_{\mathrm{target}}$. Bottom: a contact-band prior expands $M_{\mathrm{obj}}$ into the effect-aware Fill support $M_{\mathrm{flux}}$. Center: frozen FLUX.2-klein-4B follows its native trajectory; at $t\in\{4,2\}$, decoded features are aligned with $\mathbf{E}_{\mathrm{target}}$ (Eq.) and projected so that the additional I-JEPA update is zero outside the editable latent support (Eq.). No model weights are updated.
  • 实验效果:在 RemovalBench、RORD-Val、DEFACTO-Val 三个基准的实例级掩码设定下,PredErase 相对原生 FLUX.2 骨干有提升。论文对结论的界定相当克服:它明确写出有监督移除模型在若干全图外观指标上仍然领先,因此它支持的主张是「对冻结 Fill 模型做训练无关的物体与效果联合编辑」,而不是取代基于配对数据的擦除器。定性对比在 RemovalBench 1024×1024 实例掩码下给出,列包括输入、掩码、原生 FLUX.2-klein-4B、有监督 OmniEraser、PredErase 与干净底板真值,行为桌上香蕉、瓷砖上手机、桌面鼠标三个案例。论文还单独给了失败案例分析。
RemovalBench 实例级掩码下的定性对比
Qualitative comparison on RemovalBench ($1024{\times}1024$, instance-only masks). Columns: Input, $M_{\mathrm{obj}}$, native FLUX.2-klein-4B, supervised OmniEraser, PredErase (FLUX.2), clean-plate GT. Rows (top to bottom): banana on desk, phone on tile, desk mouse.
  • 批判点评:这篇最值得学的是它对问题的切分:把「哪里允许改」和「洞里该是什么」当成两个独立子问题,各配一个机制。这个切分抓住了训练无关移除失败的真实原因——以往方法在两处都不到位,编辑区域等于实例掩码所以阴影动不了,引导能量是相似性度量所以不知道该填什么。用 I-JEPA 做预测引导是个恰当的选择:它的预训练目标本来就是从可见上下文预测被遮挡 token,天然回答「洞里该长什么」,这一点比 CLIP/DINO 强的地方是原理性的而非调参性的。只在 t∈{4,2} 两步做稀疏对齐、并把支撑外的更新投影成零,也是很克制的干预方式,避免引导污染整张图。论文对自身定位的诚实度值得称赞——直接写明有监督方法在多项指标上仍领先。但边界同样明显。第一,接触带是靠距离变换膨胀出来的几何先验,对典型的地面接触阴影有效,但真实光照下的阴影方向和长度取决于光源位置,硬拉杆式的膨胀在长投影阴影、多光源、镜面反射这些情形下会失效。第二,方法链依赖 FLUX.2 与 I-JEPA 两个特定冻结模型,其中引导时机 t∈{4,2} 是与骨干采样步数强绑定的超参,换骨干需要重新校准。第三,性能仍落后于有监督方法,所以它的实用价值集中在「没有配对数据」这个约束下,如果能拿到干净底板数据,直接训一个更划算。

10. TimeSteer:让台词精确落在指定时间段

TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models | 中国科学技术大学 | arXiv:2609.01277

关键词:音视频联合扩散,推理期语音调度,源跨度定位,区域感知latent重映射,SpeechShift基准,中国科学技术大学,TimeSteer

  • 前序问题:预训练的音视频联合扩散模型对「生成什么」提供了丰富控制,但对「什么时候说」完全没有显式控制手段。你可以描述一句台词的内容,却无法要求它出现在第 2.8 秒到 4.46 秒之间。实践中这个缺口很要紧——配音、对白定时、多说话人轮次都依赖精确的时间落点。直接的做法是在提示里加一句「from 2.8s to 4.46s」,但论文的定性实验显示这样做基本无效,语音仍然贴在视频开头附近,说明时间信息没有被模型当作硬约束吸收。而重训一个带时间条件的骨干代价高昂,也不现实。于是问题被限定成一个更精确的形式:在完全不微调骨干的前提下,能否把耦合的语音与视觉发音动作放进用户指定的起止区间内。难点在于语音和口型是耦合的,单独平移音频会导致音画不同步,而这两者在 latent 里是纠缠在一起的。
  • 本文贡献:TimeSteer 建立在对去噪过程的两个内在性质的发现上。第一,存在一个对时间敏感的文本到音频交叉注意力头,它暴露了每句话在 latent 时间轴上的模型隐含源跨度——换句话说,模型自己知道它把这句话放在哪了,只是没告诉你。第二,预测出的干净 latent 已经把耦合的语音与视觉发音动作组织好了,所以可以只改它们的时间位置而不必重新生成内容。基于这两点,方法分两步且训练无关:源跨度定位从文本到音频交叉注意力估计每句话的源跨度,具体是对引用 token 的注意力权重按音频 latent 求和得到 m_i,再用相对阈值 τ·m_max 取首尾得到跨度 [s_0, s_1];区域感知 latent 重映射则通过一张读取映射把内容从源区间搬到目标区间,映射在 [0,d_0] 与 [d_1,T-1] 上用三次 Hermite、在 [d_0,d_1] 目标语音段上用仿射(保持常速,避免语速被拉伸),并保证端点对齐。这张读取映射同时作用在音频与视频 latent 的时间索引上,因此音画耦合被自动保持。论文另外提出 SpeechShift,作为联合音视频生成中区间级语音调度的首个基准。
TimeSteer 总览:源跨度定位与区域感知 latent 重映射
Overview of TimeSteer. (a) Given target intervals, TimeSteer localizes each utterance's source span and relocates its predicted audio-visual content. (b) Source Span Localization estimates source spans from text-to-audio cross-attention. (c) Region-Aware Latent Remapping relocates the content through its read map.
  • 实验效果:在两个代表性骨干上的实验显示,TimeSteer 相对训练无关基线大幅提升区间可控性,同时保持有竞争力的整体生成质量。论文用 HR_0.2(命中率)、IoU 与 WER 三个指标交叉验证,并给出跨五个随机种子的样本级 Spearman 相关性:HR_0.2 与 IoU 正相关说明两个时间指标彼此一致,两者与 WER 负相关说明更好的时间控制往往伴随更低的转写错误率——这条负相关很重要,它排除了「靠牺牲语音清晰度换时间对齐」的可能。定性图展示了对照:不加 TimeSteer 时即使在提示里追加「from [start] to [end]」,语音仍停留在视频开头附近;加了之后台词能落进任意用户指定的目标区间,同时保持生成质量与文本对齐。
定性语音调度:提示里写时间没用,重映射才有效
Qualitative speech scheduling. Without TimeSteer, a timing instruction of the form “from [start] to [end]” is appended to the original prompt, yet the speech remains near the video onset. TimeSteer places the utterance within any user-specified target interval while preserving generation quality and text alignment. Shading marks the target intervals; frames are sampled at 1,fps with aligned mel-spectrograms below.
  • 批判点评:这篇的方法论姿态很典型也很有效:先在冻结模型内部找现成的可利用结构,再围绕它设计最小干预。两个发现都属于「模型其实已经有了,只是没暴露」——时间敏感的交叉注意力头暴露了隐含时间位置,干净 latent 已经组织好了音画耦合。这让方法不需要任何训练,也解释了为什么它能同时移动语音和口型:因为读取映射作用在时间索引上,耦合关系是被整体搬运的,而不是分别对齐的。映射的分段设计也考虑到了实际问题——目标语音段用仿射保持常速,避免把语速拉长,两侧用三次 Hermite 保证平滑。三指标交叉验证加上 WER 负相关是很扎实的验证方式,它主动排除了「用清晰度换对齐」这种取巧路径。但需要注意几点。第一,整套方法依赖「存在一个时间敏感的交叉注意力头」这个经验性结构,摘要没说清这个头是怎么选出来的、在不同骨干上是否稳定存在,若换模型需要重新定位这个头,方法的通用性就要打折。第二,SpeechShift 是自建基准,评测标准与难度分布都由作者定义,缺少第三方对照。第三,重映射搬运的是已有内容,因此目标区间的时长必须与源跨度基本匹配——若用户指定的区间明显短于或长于模型自然生成的语音长度,仿射段就得压缩或拉伸语速,这个失效边界摘要没有量化。第四,验证只在两个骨干上,且都属于联合音视频扩散这一类。

趋势观察

  1. 世界模型开始接管「界面」和「动作」两类以前必须写代码的东西 — 今天最值得读的是 Runway 的 Solaris,它把一个看似离生成模型很远的东西拉进了世界模型的射程:图形界面。传统界面必须先用代码把外观和行为一条条写死,Solaris 干脆把鼠标点击、拖拽当作条件信号,自回归地逐帧生成界面的下一个视觉状态,用户下一步操作的对象就是模型刚生成的那一帧。它还把「理解意图」和「渲染画面」分给了两个部件——语言模型负责维护状态、解释用户想干什么并规定交互该产生什么后果,视觉世界模型只负责把这个后果画出来。250 人 7500 次盲测里,在「哪个结果更符合给定指令」上 Solaris 拿到 62% 对 25%,而在「哪个在场景里表现得更自然」上差距拉到 72% 对 21%——后者比前者赢得更多,恰好说明生成式界面的优势不在精确执行而在情境连贯。同一天 H3-World 从另一侧给出呼应:它不新造动作模块,而是发现 33B 的 MiniMax-H3 本来就能零样本听懂自然语言里的角色行为与镜头运动指令,于是只用 8000 条游戏样本、0.199% 可训练参数的 LoRA,把这种粗糙的语言接口改造成时间上精确对齐的世界控制。两篇的共同判断是:大视频模型里已经长出来的能力,比新加的专用模块更值得挖。
  2. 「无动作标签的视频」正式成为机器人策略的主要数据来源 — ZimaBlue 把这条路线做到了可以摆数字的程度。机器人操作的老问题是带动作标签的轨迹太贵、多样性太差,而第一人称视频里其实塞满了物体交互、接触动力学和长程行为。它用三段式课程把这些无动作视频转成控制能力:先在人类与机器人第一人称视频上做因果化的具身视频预训练,再用统一动作表示在异构机器人轨迹上做视频-动作中训练,最后针对目标机器人特化。真机零样本评测里,从「只用目标机器人数据」扩到 12 万小时以上具身视频,成功率从 36.1% 提到 77.8%——这个 2 倍多的提升几乎全部来自动作无标签的数据。为了让生成式世界模型真能实时控制,它还做了异步 Slow-Fast 双系统:高容量 Slow 世界模型输出可泛化的时空表示与逐层视频 K/V 缓存,轻量 Fast 分支吃着这份缓存在单张 RTX 4090 上跑到 30 Hz 动作预测。这个「大模型慢想、小模型快动」的分工,和 Solaris 里「语言模型想、世界模型画」的分工是同一种思路的两次出现。
  3. 推理加速这一侧,今天集中在「把不该花的算力找出来删掉」 — 四篇效率论文的切口出奇一致,都是先指认一处结构性浪费再定点清除。PixSGR 针对像素空间扩散:既然直接在像素域建模维度太高,现有做法要么用大 patch 粗暴切分丢细节、要么把精修锁在单个 patch 内部导致跨边界结构断裂,它就用粗尺度的注意力图预先筛出真正相关的交互、把细尺度注意力稀疏化,在 ImageNet 256 上做到 FID 1.51。Lapis 针对单目深度估计的生成式方案:标准注意力 O(N²) 加多步去噪在高分辨率下完全跑不动,它换成线性注意力加一步扩散,靠 Patch 级一致性模块补全局结构、Pixel 级精修模块补边界,1080P 下延迟降到原来的 1/7.6、1440P 降到 1/10.9。SinkPruner 则报告了一个反直觉的观察:现有视觉 token 剪枝方法会把「高范数离群 token」当成重要线索保留下来,实际上这些 token 在特征和空间两个维度都高度冗余——把它们过滤掉之后,LLaVA-1.5 在削掉 89% token 时仍保住 96.5% 原始性能。S²Prune 更进一步质疑了剪枝的评价基准本身:它发现按重要性或冗余度选 token 会产生稳定的空间偏置,甚至不总能打赢最朴素的均匀网格采样,因此改为先保证每个区域至少留一个 token 再按 Laplacian 变化分配预算。这四篇放在一起的启示是,效率工作的价值越来越取决于「你指认的浪费是不是真的浪费」,而不是压缩比数字本身。

人工智能炼丹君 整理 | 2026-09-03


更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」

每日更新 · 论文精选 · 深度解读 · 技术脉络

微信搜索 人工智能炼丹君 或扫描下方二维码关注

扫码关注「人工智能炼丹君」

0

评论 (0)

取消
粤ICP备2021042327号