首页
应用
关于
Search
1
Pytorch DDP
2,482 阅读
2
Pytorch 常见问题
1,515 阅读
3
视频时序切分
1,341 阅读
4
中文场景下的CLIP图文预训练
1,044 阅读
5
Semi-Supervised + Noisy Label
1,028 阅读
AIGC
AIGC Daily Papers
AIGC Fundamentals
其他
职场经验复盘
多模态理解
购房/投资
阅读
广告
Segmentation
LeetCode
Pytorch
Python
Shell
C++
常用链接
Search
标签搜索
AIGC
人工智能
论文速读
ai
视频生成
DiT
对齐
蒸馏
扩散模型
attention
transformer
视频编辑
图像生成
diffusion
基础知识
稀疏注意力
多模态
文生图
NVIDIA
llm
Jefxiong
累计撰写
203
篇文章
累计收到
8
条评论
首页
应用
栏目
AIGC
AIGC Daily Papers
AIGC Fundamentals
其他
职场经验复盘
多模态理解
购房/投资
阅读
广告
Segmentation
LeetCode
Pytorch
Python
Shell
C++
常用链接
页面
关于
搜索到
14
篇与
diffusion
的结果
2026-09-23
AIGC 每日速读|2026-09-23|NVIDIA像素扩散FID 1.46,仍输latent
今日 AIGC 论文速览 今日共 10 篇 · 图像生成与像素扩散 2 篇 · 视频世界模型与 3D 一致 2 篇 · 视频生成加速与流式编辑 2 篇 · 动作与音频生成 2 篇 · 音视频因果与奖励评测 2 篇 重点论文标题列表 PixelDiT2(NVIDIA):像素扩散 FID 压到 1.46 WorldCrafter(ARC Lab, Tencent IEG):分钟级探索重访 PSNR 18.0 ⚡ GAE(HKUST):相机轨迹误差砍半 FVD 降 23% SparkDiffusion(Peking University, Melon Group):97% 稀疏下 265 倍单卡加速 MixiMotion(PTIT, Hanoi):一步动作对齐 0.835 逼近教师 今日论文速览 1. PixelDiT2:像素扩散 FID 压到 1.46 PixelDiT2: Representation-Grounded Pixel Diffusion Transformers | NVIDIA;University of Rochester | arXiv:2609.24919 关键词:像素空间扩散,表征先验,表示对齐,DINOv3,ImageNet ⚠️ 前序问题:像素空间扩散不用自编码器、直接在 RGB 上去噪,省掉了 latent 重建瓶颈,代价是收敛慢、最终画质长期落后 latent 扩散。作者的判断是缺一个显式表征先验:latent 扩散天然在紧凑结构化的隐空间里去噪,像素扩散却要一边学「好去噪的表征」一边学「怎么生成像素」,两件事挤在同一次训练里互相拖累。 本文贡献:提出 representation grounding:用一个冻结的预训练视觉基座模型在整个去噪过程里持续提供 per-patch 表征监督。带噪图像走像素去噪通路,同时冻结编码器产出 per-patch 特征,一个时间步条件化的 DiT 块 P_g 把它映射成 scaffold,再通过空间 AdaLN 调制扩散 transformer;REPA 只作为训练期辅助目标。另提出延迟 grounding dropout:训练初期保留 grounding,到 epoch 160 再开启 dropout。 PixelDiT2 at ImageNet-512x512: samples, architecture, and convergence. 实验效果:ImageNet-256×256 上 H/16 模型 600 epoch 达 FID 1.46、IS 301.6;512×512 上 680 epoch 达 FID 1.48、IS 295.7,两档都是像素侧最好(同表其余像素方法 1.61–3.94 / 1.78–3.95)。论文强调 epoch 预算:512 档 epoch 200 就超过 PixelDiT 850 epoch 的 FID,预算低 4.25 倍。 PixelDiT2 reaches FID 1.78 at epoch 200 and 1.48 at epoch 680. 批判点评:「补上表征先验」在像素侧成立,但把两张表横着读是另一面:256 上 latent 侧 RAE-XL FID 1.13、REPA-XL 1.29 都优于 1.46,512 上 RAE-XL 1.13 同样压过 1.48,IS 也不及 REPA-XL 306.3 与 JiT-G 306.8。也就是说「追平」只在像素扩散内部成立,跨阵营仍差约 0.3 FID,摘要里 narrowed the gap 的措辞容易被读成已经追平。另外延迟 dropout 的开启时机是在 512 档上调出来的,256 档用的是从头独立 dropout,两档训练协议并不一致,跨分辨率可比性打了折扣。 2. WorldCrafter:分钟级探索重访 PSNR 18.0 WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory | ARC Lab, Tencent IEG;Peking University | arXiv:2609.24984 关键词:视频世界模型,隐式3D记忆,长程一致性,相机可控,流式生成 ⚠️ 前序问题:视频世界模型做交互式探索时,长程一致性一直是硬伤:走出一段距离再回头,场景常常「认不出」是刚才那个地方。难点在于历史观测越来越多,而视频生成器的 token 预算是固定的,怎么把历史压进有限 token、又不依赖显式深度对应,是个两难——显式 3D 重建重且脆,简单堆历史帧则 token 直接爆掉。 本文贡献:核心洞察是「让被请求的视角来决定历史怎么压缩」。一个与视频生成器联合训练的 memory encoder 把历史观测编成紧凑的 3D-aware 表示,再由 pose-conditioned readout 按当前目标相机位姿读出固定数量的、目标视角专属 token,在去噪前注入,全程不需要显式深度对应。配合 max-coverage 历史检索、最近时间上下文和 few-step 蒸馏,实现从单张图或文本出发的流式分钟级探索。 Overview of the WorldCrafter pipeline. 实验效果:VBench 自建输入模式 725 段视频上 Overall 81.910 为全表第一(Alaya-EVOKE 81.406、SANA-WM 80.841、Echo-WM 80.211),主体一致性 82.695、背景一致性 90.589、运动平滑 98.787、整体一致性 26.745 均为第一。长程重访一致性上 MEt3R 0.166、PSNR 18.016、SSIM 0.517,相对次优 Lyra 2.0(0.334 / 14.050 / 0.390)近乎翻倍。 Qualitative long-horizon revisit comparison in a static scene. 批判点评:重访那张表真正的第一不是 WorldCrafter 而是它的加速版 WorldCrafter-fast(MEt3R 0.129、PSNR 20.868、SSIM 0.616)——少步蒸馏的变体反而在一致性上更好,这暗示「更多步数」本身可能带来累积漂移,论文没有就这条给出解释。视觉质量上也不是全胜:美学质量 AQ 61.432 只排第四,不及 SANA-WM 63.467;动态程度 DD 96.893 是全表最低(其余 97.087–100),说明换来的一致性里有一部分是靠画面动得更少买到的。评测均在自建输入模式下完成,未与公开榜单协议对齐。 3. GAE:相机轨迹误差砍半 FVD 降 23% GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation | The Hong Kong University of Science and Technology;ARC Lab, Tencent IEG;The University of Hong Kong;The University of Texas at Austin | arXiv:2609.24981 关键词:几何原生隐空间,3D一致性,自编码器表征,相机轨迹,感知生成统一 ⚠️ 前序问题:视觉生成器能出逼真画面,却保不住一个前后一致的 3D 场景。作者认为这不只是建模问题,更是表征问题:生成器演化的是外观为中心的隐空间,感知模型恢复几何用的是语义丰富、编码跨视角结构的空间,两者不在同一坐标系上。常见补丁是「再输出一个几何头」,等于把几何当副产品,治标不治本。 本文贡献:不把几何当额外输出,而是直接把一个几何基座模型的特征重参数化成紧凑、可扩散的隐空间——几何原生自编码器 GAE,其 latent 同时可解码到外观、深度、相机和点图。训练分两阶段:先训 codec 把冻结的多层几何特征压进 latent,再用条件流只在「待生成视角」的 latent 上做流匹配,参考视角 latent、相机射线和文本作为控制,让感知与生成共用同一个隐空间接口。 Overview of Geometry-Native Autoencoder (GAE). 实验效果:在固定生成器与训练协议的控制对比下:重建侧 GAE-128 用比原始几何特征少 24 倍的通道,PSNR 28.76 / LPIPS 0.036 / rFID 5.4(RealEstate10K)反而略优于原始 L0 特征;生成侧 GAE-64 最优,RealEstate10K FVD 225.7、PSNR 20.02、SSIM 0.711,DL3DV FVD 287.0、PSNR 18.00,相对最好的非 GAE 受控 latent 分别降 FVD 12.7% 与 23.1%;ATE 在 RealEstate10K 降 52.8%、DL3DV 降 23.3%,MEt3R 取到受控组最佳 0.1208 / 0.1347。 Multi-frame RGB, geometry, and camera-pose comparison across RealEstate10K scenes. 批判点评:最有价值的是控制变量设计,但同一张表也留了口子:受控组之外还列了 Gen3R 与 GLD 两个参考方法,其中 Gen3R 在 RealEstate10K 的 MEt3R 是 0.1157,优于 GAE-64 的 0.1208——「最佳」限于受控 latent 这个口径。DL3DV 的重投影误差上 GAE 只有 0.0028–0.0029,反而不如 WAN2.1 VAE 的 0.0019,说明几何原生 latent 在像素级回投影精度上并不占优。另外通道数选择本身就不一致:128 在重建上最好、64 在生成上最好,论文没给选择依据,实际部署还得自己再权衡一次。 4. SparkDiffusion:97% 稀疏下 265 倍单卡加速 SparkDiffusion: Mitigating the High-Sparsity Trap --- A Unified Framework for up to $265\times$ Single-GPU Acceleration of Visual Generation | Peking University, Melon Group;Tsinghua University;Alibaba Group;University of Electronic Science and Technology of China;Harbin Institute of Technology | arXiv:2609.23153 关键词:稀疏注意力,推理加速,少步蒸馏,FP8量化,视频扩散 ⚠️ 前序问题:视频扩散 transformer 贵在注意力要处理超长时空 token 序列,做稀疏注意力是自然的加速思路。但作者发现一个「高稀疏陷阱」:稀疏度推到极致时,逐步训练损失还在稳步下降,最终生成质量却停滞甚至倒退。诊断指出这是监督问题——主要误差来自高噪声的结构生成阶段,逐步局部训练修不动它,只有对齐终态的训练才修得动。 本文贡献:由此给出一条分阶段原则:先把稀疏架构适配成粗粒度先验,再校正终态分布。SparkDiffusion 按此串起三件事——短程稀疏 warm-up、少步 trajectory-mixed 蒸馏、FP8 量化配融合 kernel,并把三者做成可乘的加速因子。覆盖 Wan2.1/Wan2.2 骨干、T2V/I2V 任务、480P/720P 分辨率,以及 H100 与 RTX 5090 两种 GPU。 Overview of the SparkDiffusion framework. 实验效果:3 步无 CFG 推理下,Wan2.1-T2V-14B-720P 在单张 RTX 5090 上端到端 265× 加速(H100 上 220×);Wan2.1-T2V-1.3B-480P 端到端 1.3 秒出片。长序列 720P 上维持 97% 注意力稀疏,1.3B-480P 上 90%。VBench 总分从 dense 的 83.69 到 83.15,掉 0.54 分;同表延迟与显存项均为最好(18.0 / 8.0)。 End-to-end latency and speedup of SparkDiffusion over Full Attention on NVIDIA H100 and RTX 5090 GPUs. 批判点评:265× 是三个因子相乘的结果,其中大部分来自 3 步蒸馏而非稀疏本身,读标题很容易把功劳全记在稀疏上——论文在图表里做了分解,但正文强调的仍是合成后的倍数。质量代价是实打实的:83.15 低于 dense 83.69,且稀疏度从 90% 提到 97% 时分数从 83.42 掉到 83.15,说明高稀疏陷阱只是被缓解、没被消除。另外源码里仍能看到若干未清理的 TODO 占位注释(作者元数据、BF16 两列标注为占位),作为预印本部分数值还需等正式版复核。 5. MixiMotion:一步动作对齐 0.835 逼近教师 MixiMotion: One-Step Text-to-Motion Generation via Asymmetric Set Distillation | Posts and Telecommunications Institute of Technology, Hanoi, Vietnam | arXiv:2609.23010 关键词:文本到动作,一步生成,集合蒸馏,运动学监督,推理延迟 ⚠️ 前序问题:文本到动作生成质量上来了,但迭代采样要几十上百次网络评估,延迟高,交互式动画、游戏这类场景用不了。压缩成严格一步模型有两大障碍:一是文本条件下的动作天然多模态,同一提示对应多个合理动作,固定的教师-学生一一对应会把多种有效模式平均掉;二是只在归一化表征空间里对齐,解码后可能出现明显运动学瑕疵。 本文贡献:MixiMotion 用离线集合蒸馏:对每个提示让冻结的多步教师先生成 K=4 个动作存进离线教师库,学生训练与推理时都不再查教师;学生从独立噪声采样 M=8 个一步样本,用非对称双向集合匹配训练——教师到学生方向鼓励覆盖教师支持的多样动作,学生到教师方向抑制不被支持的生成,两侧权重 α=(1, 0.20) 故意不对称。再叠加解码空间的端点、轨迹与身体分组运动学监督。 MixiMotion: offline asymmetric set distillation for one-step text-to-motion generation. 实验效果:ViMoGen 上语义对齐 0.835,一步方法里第一(MotionLCM-1 0.825、naive 一步教师 0.711),逼近 50 步 HY-Motion-1.0-Lite 教师的 0.858;六个类别中有四类超过 MotionLCM-1。25 人盲评总体 4.33 对教师 4.50,同为一步/少步里最高(MotionHiFlow 4.20、MotionLCM-1 3.98)。单次网络评估延迟从 829.58 ms 降到 9.30 ms。 Qualitative comparisons between HY-Motion-1.0-Lite and MixiMotion. 批判点评:摘要里的 89.2× 是单次网络评估口径,正文自己给出的端到端加速是 6.75×——差了十几倍,文本编码与渲染等开销没算进去,读者很容易把 89.2× 当成真实提速。另外 0.835 其实仍略低于多步的 MLD 0.840(与 MDM 0.833 基本持平),「逼近教师」成立,但严格说还没超过最好的多步基线。消融里非对称权重只带来 0.829→0.835 的 0.006 增益,解码空间监督贡献 0.832→0.835,各组件边际收益都很小;学生从教师热启动、460M 参数与教师同量级,并没有变小。语义分数由 Qwen3-VL-30B 判 yes/no 问题自动给出,非人类标注。 6. SVEET:双向模型改流式 15 FPS Streaming Video Editing with Easy Adaptation | Shanghai Jiao Tong University | arXiv:2609.24788 关键词:流式视频编辑,双向转自回归,特征解耦,正交解耦训练,实时生成 ⚠️ 前序问题:预训练的双向视频扩散模型编辑质量好,但它需要看完整段视频,做不了逐帧自回归的流式编辑。直接改造会撞上两个矛盾:双向骨干的特征在时间上互相依赖,而流式推理要求条件帧彼此独立;可控性与因果性两个优化目标还会互相拉扯,联合训练通常顾此失彼。 本文贡献:先系统复盘已有 video-to-video 扩散方案,归纳出流式适配的两条原则:骨干特征解耦、条件帧独立。据此给预训练双向模型加一条辅助控制分支,用时间独立自注意力编码源视频,中间特征注入对应骨干块;为弥合双向与流式的特征空间差异,再提出解耦训练 ODT,显式约束「视频可控性」与「模型因果性」两个优化方向正交,使二者在推理时兼容,并实现跨异构骨干的零样本迁移。 Our proposed SVEET. 实验效果:视频风格迁移上 VLM 编辑准确率 7.4322 为全表第一(LiveEdit 5.8672、DayDream+CF 5.2321、SDV2 4.2297),CLIP 文本对齐 0.2287、主体一致性 0.9447、背景一致性 0.9298、运动平滑 0.9898、美学质量 0.5550 均为第一。消融中 ODT 把 2D 版从 7.1898 提到 7.4322、3D 版从 7.0653 提到 7.3315,推理期投影(6.4250)与两阶段 teacher forcing(7.0927)都不如它。单张 H100 上 15 FPS,未用任何额外加速手段。 Qualitative comparison results on stylization. 批判点评:唯一没拿第一的一列是整体一致性(0.1123 第二),而拿下这列的 Channel concat 编辑准确率只有 1.8902——几乎没在编辑,说明这个指标在这组对比里更接近「越不改越高分」,拿它当唯一失分项反而暴露了指标本身失效。实验只在风格迁移这一个任务上给了完整数字,其余编辑任务的优势主要靠定性图支撑。15 FPS 是在 H100 上测的,离真正的端侧实时还有距离,且论文没有给出不同分辨率或时长下的 FPS 曲线。 7. COT-TTS:听对话推断语气 MOS 4.15 COT-TTS: Audio Context-Aware Text-to-Speech with Chain-of-Thought Reasoning | The Hong Kong University of Science and Technology;Nanjing University;JIUTIAN Research, China Mobile;Peking University;China Mobile (Hong Kong) Innovation Research Institute | arXiv:2609.22697 关键词:上下文感知语音合成,链式推理,可编辑风格,级联对比,时长一致性 ⚠️ 前序问题:语音合成的说话方式现在基本靠用户显式下指令,但自然对话里该怎么说本应从上下文推断出来。现有系统要么让用户逐句指定,要么把 ASR、LLM、TTS 串成级联——参数动辄 30B 以上,而且级联转换会把原始语音里的副语言信息(非语言发声、节奏、情绪强度)丢掉。 本文贡献:把「上下文感知推理式 TTS」定义成新任务:给定历史对话音频、目标文本和参考语音,先理解上下文,再显式推理出一段中间 CoT,最后按指定音色合成目标语音,且这段 CoT 可被检查与编辑。配套建了大规模双语对话语音数据集(900 万训练样本,含 100 万高质量子集)和 800 条人工核验、源不重叠的评测基准,并给出 0.6B / 1.7B 端到端自回归模型,直接产出带情绪标注的转写、可编辑风格推理和语音 token。 Overview of the end-to-end CoT-guided autoregressive model. 实验效果:英文基准上 COT-TTS-0.6B 拿到 Human MOS 4.150 全表第一(级联 3.050–3.500),情绪一致性 0.954 第一,时长误差 1.155 秒远优于级联的 5.1–12.5 秒;中文基准上 0.6B Human MOS 4.200 同样第一。可编辑 CoT 变体在中文上拿到最高的 LLM 综合分 3.461 与历史理解 4.079。参数量只有级联系统(34–39B)的几十分之一。 Distributions of the normalized audio quality score, naturalness score, target-audio effective-speech ratio, and emotional expression intensity over 50K randomly sampled examples. 批判点评:「参数少几十倍、效果相当」要看是哪一列:UTMOSv2 2.943 低于 two-a3b-fish 的 3.138,DNSMOSPro 3.180 明显不及 two-qwen3omni-seedvc 的 4.240,WER 0.041 也高于 three-dia-a3b-fish 的 0.012;LLM 评测的 CoT 逻辑 4.558 不及 4.836,综合分 2.304 不及 3.601。真正领先的是人类整体评分、情绪一致性和时长误差三项。更值得注意的是两个反常:0.6B 的人类评分(4.150 / 4.200)高于 1.7B(4.050 / 4.150),规模变大反而变差;开启可编辑 CoT 后推理分数上去了,英文 Human MOS 却从 4.150 掉到 3.500——论文把这解释为改动把分布推离训练域,等于承认「可编辑」目前要付音质代价。 8. Common Cause:灰度视频让音频翻车 62% Common Cause, Not Cross-Attention: Blocking Visual Shortcuts in Audio-Video Generation | RIKEN iTHEMS;RIKEN AIP;South China University of Technology;Columbia University | arXiv:2609.22361 关键词:音视频生成,因果推断,反事实不变性,视觉捷径,共享表征失效 ⚠️ 前序问题:音视频联合生成器的训练数据里,「看起来是什么」和「听起来是什么」高度相关——某种材质、纹理或物体外观总与某种声音同时出现。这种相关往往是虚假的:模型可以只从外观预测声音,完全不碰「是什么事件」这个因果变量。一旦测试时外观与事件的关联被打破,模型就会直接合成错误事件的声音。 本文贡献:这是一篇受控的因果研究而非又一个模型。先建音视结构因果模型,让音频在构造上独立于视频的干扰外观,再系统检验流行解法——直接 cross-attention、共享 latent、bottleneck、无监督 shared/private 分解、忠实共享先验,证明这些「走公共因」的做法全都抓不住要害,因为共享 latent 不是干预,模型照样拿得到外观代理变量。真正堵住捷径需要对干扰变量做干预:在 SCM 与干预假设下,论文证明反事实不变性是识别因果预测器的充要条件。 The counterfactual intervention do(v:=v') made concrete (Colored-MNIST). 实验效果:在特征向量 SCM、程序化像素视频、真实图像配频谱音频、移动真实数字、条件生成器五个场景验证。反事实惩罚随因果线索变强从 263× 平滑坍缩到 2.7×,说明捷径只在因果线索难读时才被采用;Moving-MNIST 上直接模型 OOD 准确率 0.21 而本文方法 0.995。对真实预训练视频转音频模型 MMAudio 做输入干预:灰度化让 top-1 声音类别翻转 62%、色彩旋转 54%,最小编辑只翻 22%。 The failure, made audible. 批判点评:最尖锐的一段是「修不好」:作者用重着色一致性项把 MMAudio 的速度网络微调 1500 步,色彩旋转翻转率基本没动(62.5% → 63.9%),真正下降的是通用 OOD 敏感度(高斯噪声 83.3% → 70.8%)——这次微调买到的是整体更鲁棒,而不是论文想修的外观捷径,恰好反证诊断与修复之间还有距离。另外结论高度依赖 SCM 与干预假设成立,真实数据上的干预只能做「改写外观」这类近似;MMAudio 实验只有 24 条真实视频、其中 18 条用于微调,样本量偏小。 9. RewardVerse:先写准则再打分 PLCC 0.52 RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling | Institute of Automation, Chinese Academy of Sciences;University of Chinese Academy of Sciences;The Hong Kong University of Science and Technology;Tencent | arXiv:2609.22947 关键词:视频奖励模型,评分准则中介,标量漂移,RGPO,强化学习奖励 ⚠️ 前序问题:用强化学习优化视频生成模型时,奖励模型是地基,但现有视频奖励模型直接把复杂主观质量映射成一个标量,没有显式评分准则,于是出现标量漂移:分数尺度在不同提示之间坍缩或整体平移,RL 拿这种奖励训练并不稳。 本文贡献:借鉴人工标注工程,在「评测请求」和「打分器」之间插入一个动态评分准则 rubric 作为中间表示:先显式生成评测标准,再按准则打分,给标量一个语义锚点。为训练这条协作流水线提出两阶段 RGPO:阶段一用自演化的种子 rubric 预热打分器(偏好奖励 + 格式奖励 + 校准损失),阶段二联合优化 rubric 生成器、产出随请求自适应的准则,同时持续把打分器对齐人类评分。 Overview of RewardVerse and its two-stage RGPO training. 实验效果:16 维 EvalVerse 基准上 Joint(Ours) 在 14 个维度取得最高 PLCC,宏平均 PLCC 0.520、SRCC 0.493 均为第一(次优 Q-Scorer 0.467 / 0.354);Logic 维度 PLCC 0.750 对次优 0.593,Action 0.566 对 0.390。漂移诊断上 RGPO 把均值偏差从 +0.610 降到 +0.164,PLCC/SRCC 从 0.240/0.222 提到 0.505/0.458,预测标准差从 0.457 扩到 1.332,被压缩的分数区间被重新拉开。换到闭源 Gemini-3.1-Pro 上,加 rubric 仍让 PLCC 从 0.490 提到 0.593。 Score distributions of six reward models on the shared 10-dimensional test subset. 批判点评:「14/16 维最高」是真的,但剩下两维恰好是最容易被低层画质解释的:Temporal 那列 Ours 0.538 不及 VideoScore2 的 0.697,SRCC 侧也有两列被 Q-Scorer 与 Raw-rubric 超过。也就是说在偏感知质量而非认知/时序的维度上,rubric 中介的优势会收窄——论文自己也点出 Q-Scorer 在光照、逻辑这类与低层画质相关的维度上仍有竞争力。Gemini 实验只对比了有/无 rubric 两个变体,且受限于 API 只能读自然语言浮点输出,无法与开源模型在同一训练协议下横比。此外 rubric 由模型自生成,其质量评估仍依赖同一套 VLM 裁判,存在自证循环的风险。 10. IMPLICIT-Bench:5493 条中性提示词测隐式偏见 IMPLICIT-Bench: Measuring Implicit Bias in Text-to-Image Models under Neutral Prompts | The University of Melbourne | arXiv:2609.24228 关键词:文生图偏见评测,隐式偏见,知识图谱三元组,中性提示,去偏见权衡 ⚠️ 前序问题:文生图模型的偏见评测大多用「一张 [职业] 的照片」这类槽位模板,只能孤立地探显性人口属性(性别、肤色)。它漏掉了更隐蔽的一类:在自然提示里,当与刻板印象相关的属性没有被指定时,模型仍然默认输出刻板结果——这种隐式偏见现有评测基本看不见。 本文贡献:用结构化知识图谱构造受控提示三元组:中性、刻板、反刻板三个变体只在单一偏见维度上不同,其余场景语义保持一致,从而能把偏见效应精确归因到模板类基准做不到的粒度。最终发布 5,493 条提示、覆盖 11 个偏见类别,并用多模型一致性、CLIP 验证和人工评测三重校验。基于它评测现有去偏见方法,揭示出偏见降低与语义保真之间的基本权衡。 Four-stage KG-grounded benchmark pipeline. 实验效果:过滤后保留的中性图显著偏向刻板端:VLM 均值从 1.75 升到 3.40(Qwen3-VL)、1.26 升到 2.65(Gemma-4),未参与筛选的 CLIP 验证器同向移动。最终基准上 CLIP 判定 67.7% 的 Δx 为正(Cohen's d = +0.39),Qwen3-VL 71.6%(d = +0.85),三个裁判在 Δx 层面正相关(Pearson r = 0.22–0.44)。12 名人工评审在 100 个样例上复现了同样排序:刻板 3.78 > 中性 3.17 > 反刻板 1.60,75.9% 的 KG 被认为确实反映社会刻板印象。 Cross-model qualitative comparison, set 1. 批判点评:三个裁判的一致性是这个方法最脆弱的一环:Gemma-4 的倾向比例只有 48.7%,几乎等于抛硬币,d 也只有 +0.29,与 CLIP 的 67.7%、Qwen3-VL 的 71.6% 不在一个量级;裁判间 Pearson r 仅 0.22–0.44,CLIP 与两个构建裁判的逐图相关性也只有 0.42 / 0.55。人工侧同样不完美:VLM 相对人类均值的 MAE 接近 0.97–0.99,且 12%–16% 的样例把刻板与反刻板的方向判反。样本分布也不均衡——physical-appearance 类只有 14 条,人工研究里 sexual-orientation 一行只落在单个样例上。作者自列的局限同样实在:KG schema 单轴、源数据带 WEIRD 偏斜、去偏见实验只在 Qwen-Image 上做过。 趋势观察 世界模型这一轮在比「记得住」,不是在比「画得好」 WorldCrafter 让目标相机位姿去决定历史怎么压成固定数量的 token,GAE 则干脆把几何基座的特征重参数化成生成用的隐空间。两者承认的是同一件事:分钟级的一致性不是把模型做大就能换来的,而是取决于历史和几何以什么形式存在。有意思的是 WorldCrafter 的加速版在重访一致性上反超了标准版,说明步数与一致性之间未必是正相关。 像素扩散与 latent 扩散的差距,正被「表征」而不是「架构」填平 PixelDiT2 不引入自编码器,而是让一个冻结的视觉编码器在整个去噪过程里持续提供 per-patch 表征,把表征学习和像素生成拆成两件事。不过两张主表横着读会发现,1.46 是像素侧最好、却仍不及 latent 侧 RAE-XL 的 1.13,IS 也不及 REPA-XL 的 306.3——差距在缩小,但没有消失。 加速方案的瓶颈已经从「算力」挪到了「监督」 SparkDiffusion 指出高稀疏下逐步损失在降、终态质量却不涨,根因是监督没有对齐终态;SVEET 则指出双向改流式的瓶颈不在算力而在两个优化方向互相干扰,于是显式约束它们正交。两者都不是靠新算子取胜,而是重新安排了训练时究竟该优化什么。 评测类工作开始把「裁判本身」当成被审对象 IMPLICIT-Bench 的三个裁判一致性只有 Pearson r = 0.22–0.44,其中一个几乎等于抛硬币;RewardVerse 则发现外部打分器在认知类维度上可以是负相关(VideoScore-v1.1 在 Logic 上 PLCC −0.245)。当奖励模型和偏见裁判都开始被自己的盲区反噬,评测可信度就成了需要单独论证的事,而不是默认前提。 人工智能炼丹君 整理 | 2026-09-23 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年09月23日
3 阅读
0 评论
0 点赞
2026-09-22
AIGC 每日速读|2026-09-22|阶跃星辰全双工98.9登顶,清华W4A4逼近FP16
今日 AIGC 论文速览 今日共 10 篇 · 语音与音频生成 2 篇 · 视频生成与物理一致 2 篇 · 图像编辑与三维生成 2 篇 · 生成理解一体化 2 篇 · 推理加速与评测 2 篇 重点论文标题列表 StepAudio 3(StepFun-Audio Team):全双工语音模型98.9分登顶 OmniVChat(CUHK):全模态对话视频2800题 ⚡ CompAdapt(HIT):物理视频生成PIS 0.862 KaiNinja(Alaya Lab):3D部件生成免分割器 4DGS-Fixer(Goertek Alpha Labs):稀疏四视角重建4D高斯 今日论文速览 1. StepAudio 3:全双工语音模型98.9分登顶 StepAudio 3 Realtime Technical Report | StepFun-Audio Team | arXiv:2609.14005 关键词:实时语音交互,全双工对话,边想边说,音频语言模型,MTP解码 ⚠️ 前序问题:实时语音交互要同时满足三件互相拉扯的事:听懂语音里丰富的声学线索(意图、情绪、环境),在对方还没说完时就能自然接话(停顿、附和、打断),以及先做足够深的推理再开口。传统做法要么把推理挪到对话之外、延迟跟着涨,要么为了低延迟直接砍掉推理深度——「想得深」和「答得快」长期被当成一对不可兼得的取舍。 本文贡献:StepAudio 3 Realtime 把整套系统组织成一个连续的「听—对话—思考—行动」循环。三个关键部件:Deep Perception 从原始音频里抽取丰富的声学线索来理解意图;Seamless Duplex 对同步的用户/模型双路音频流建模,处理停顿、附和与打断;核心创新是 Think-While-Speaking——让私有推理与语音输出并行执行,并用 Medusa 式的 MTP 解码加速思考,从而把「想」这一步塞进「说」的同一段时间窗里。训练侧配了一个 Adaptive Thinking 路由,先判断当前这一轮是否需要显式推理,若不需要就走 direct route、留一个空的 think block,避免为简单对话付出推理成本。此外集成了Voice Agent,在对话流不中断的前提下异步执行工具调用,把工具返回结果再融回对话。 实验效果:按官方技术报告的自测:推理模式下 StepAudioChat 宏平均 73.0,达到专用推理模型的水平;MMSU 90.6;Artificial Analysis Full-Duplex Bench Overall 98.9;τ-Voice 宏任务成功率 56.0%。同表里 ASR 侧 StepAudio 3 ASR Max 在 LibriSpeech clean 1.18、WenetSpeech meeting 4.35、AISHELL-1 0.49,三项均为全表最低错误率;音频理解侧 MMAR 86.5、AudioMultiChallenge 49.3;通用能力侧 HMMT 86.8、GPQA Diamond 83.0、MultiChallenge 59.7。 批判点评:优势几乎全部集中在「实时语音交互」这一列:Full-Duplex Bench 98.9 领先 Doubao 2.0 Lite 的95.3 与同表 Gemini 系列的 95.1~98.4,ASR 三项也确实拿到最低错误率。但同一张表暴露了明确的短板——AudioMultiChallenge 49.3,比同表最好成绩 67.0 落后近 18 分;GPQA Diamond 83.0 低于同表最高的 90.3;MultiChallenge 59.7 也落后最好成绩 68.1。τ-Voice 上 56.0 与 Doubao 2.0 Lite 的 56.5 基本持平甚至略低,说明「边想边说」这套机制在需要长链条决策的智能体任务上还没转化成稳定优势。此外全部数字均为团队自评、无第三方复现,报告也没有给出 Think-While-Speaking 与串行思考在同等算力预算下的严格对照——增益里究竟有多少来自 MTP 解码加速、多少来自推理与发声的并行重叠,需要拆开才能判断架构本身的净贡献。 2. OmniVChat:全模态对话视频2800题 OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue | The Chinese University of Hong Kong;Alibaba Token Hub;Shanghai Jiao Tong University;Shanghai Innovation Institute;Zhejiang University | arXiv:2609.21465 关键词:音视频对话,全模态模型,合成数据,强化学习奖励,基准评测 ⚠️ 前序问题:让全模态模型像人一样「看着你、听你说话就直接回应」,而不是先把语音转成文字、把视频转成描述再喂给语言模型。直接吃音视频能省掉转写带来的外部延迟与算力,也保住了表情、环境、手边物品这类感知线索。但这条路有两个卡点:一是人们用自己设备录的真实对话数据极其稀缺;二是同一个意图有无数种说法,好的回答往往要结合用户所处的环境与表情,用关键词匹配根本判不出回答质量。 本文贡献:论文把这条路线正式命名为 OmniVChat,并配齐了数据、评测、训练三件套。数据侧 OmniVChat-Studio 是一个多智能体合成引擎,用智能体协作加视频生成造出单轮与多轮的音视频对话;评测侧 OmniVChat-Bench 覆盖 5 大能力类、17 个子类、22 个场景域共 2800 条合成实例,另有人工实录的 OmniVChat-Bench-Human(360 条)作为真实分布对照;训练侧 OmniVChat-RL 给出一套把回答正确性、效率与风格联合起来的 rubric 奖励设计,直接在合成对话上训练 Qwen3-Omni-Instruct,验证奖励设计能否迁移到真实录制的对话上。 实验效果:RL 训练满 1000 步(记录 51 个 checkpoint)后,OmniVChat-Bench 与人工录制的 OmniVChat-Bench-Human 命中率同步上涨,且合成集与实录集的曲线走势一致,论文还逐条给出了 16 个子类的学习曲线,说明在合成数据上得到的增益确实能迁移到真实对话。对比表里 Qwen3-Omni-Instruct 基线的综合命中率 0.186,训练后与 Qwen3.5-Omni-Plus 的 0.361、Doubao Seed 2.0 Lite 的 0.330 进入同一档。 批判点评:最值得警惕的是奖励设计里的「效率」项。训练曲线显示 Reply Efficiency(每千词的 rubric 命中数)从约 5 涨到 20 的同时,平均回复长度从接近 100 词一路掉到 35 词左右——效率提升有相当一部分来自「少说几句」而不是「说得更准」,在固定 rubric 打分下这几乎必然发生,机制上和同期的 reference-free 语音指标那篇讲的 reward hacking 完全一致。第二,OmniVChat-Bench 全部是合成实例,而实录集只有 360 条,并且只覆盖十二个单轮子类中的一部分,所以「迁移到真实对话」的证据强度受限于实录集规模——论文自己也在多个子类上标注 Bench Only,意味着这些能力在真实录制条件下根本没有对照数据。第三,用合成对话同时做训练和评测,存在评测集与训练分布同源的风险,跨数据集的零样本能力没有被检验。 3. CompAdapt:物理视频生成PIS 0.862 CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation | Harbin Institute of Technology;Alibaba Taobao | arXiv:2609.21455 关键词:文生视频,物理一致性,复合运动建模,神经动力学,一次性适配 ⚠️ 前序问题:扩散式文生视频能出画质、也能出时序连贯,但常常违反基本物理:物体不受重力、碰撞后穿模、运动类型中途乱切。已有的物理约束方法大多只会处理单一运动类型,还要人工指定物理参数,换一个没见过的物理环境就失灵。问题在于真实场景里的运动几乎都是复合的——耦合、多阶段转换、多物体碰撞,单一类型的动力学先验覆盖不了。 本文贡献:CompAdapt 把神经动力学建模从单一运动类型扩展到复合物理行为。架构上有两个关键模块:Motion Type Composite(MTC)在潜空间里把多个运动类型按时间关系做算子级复合,Multi-Object Interaction(MOT)在检测到物体接触时切到显式的交互动力学。自然语言提示被解析成结构化的物理语义——运动类型、时序关系、初始物理参数——实现端到端指定,不再需要人工调参。跨新物理环境靠 dynamics-aware prior matching 做一次性适配,不必重训核心动力学模块;另有 physics-aware 潜特征融合模块负责高速与复杂运动下的画面保真。 实验效果:消融实验:去掉 MTC 后 PIS 掉到 0.615,去掉时序建模掉到 0.589,去掉双 LLM 语义解析掉到 0.724,完整版 0.862;FID 15.0 / FVD 91.4 / PSNR 17.2 / SSIM 0.61,相比 Wan-Move(16.3 / 93.5 / 16.5 / 0.58)与 Go-with-the-Flow(17.5 / 96.7 / 14.9 / 0.56)在四项上均有改善,生成开销 2.9 与 Wan-Move 持平。定性部分把 NewtonGen、PhysT2V、Wan2.2、CogVideoX-5B、Veo3、Sora 全部拉到同一组提示下逐帧对照,覆盖抛体旋转、阻尼振荡、均匀加速、形变碰撞等组合运动。 批判点评:三处需要打折。第一,主指标 PIS(物理一致性分数)由论文自行定义,没有第三方榜单或社区复现支撑,而它在消融中的跨度(0.589 → 0.862)恰恰是全文最大的增益来源,指标自证的风险较高。第二,所谓「复合运动」实际只覆盖 9 类情形,其中真正涉及物体接触的弹性碰撞仅 2 类,多物体场景仍是最薄的一环,所谓 multi-object collisions 的证据量偏小。第三,「一次性适配」并不等于「免数据」——流程本身仍需要目标环境的一段观测视频(one-shot reference)才能完成 prior matching,因此把它当作通用物理先验来用还有前置成本。论文 comments 自注为 NeurIPS 2026 投稿(23 页、4 图),尚未经同行评审。 4. KaiNinja:3D部件生成免分割器 KaiNinja: Extending Native 3D Generators to the Part Level | Alaya Lab;The University of Tokyo;UC Merced;Institute of Science Tokyo | arXiv:2609.15659 关键词:三维生成,部件级建模,双体积表示,稀疏体素,免分割 ⚠️ 前序问题:TRELLIS.2 这类原生 3D 生成器能把一张图变成高保真、带材质、非水密的网格,但输出是一个融合好的整体;而下游的编辑、绑定骨骼、物理仿真全都按部件操作。最直接的办法是在融合网格上再跑一个 3D 分割网络,可这样既慢、又被分割精度卡死。真正的技术障碍更基础:O-Voxel 网格每个体素只存一片表面,所以单个 volume 在任何分辨率下都无法表示两个部件贴合的那层界面。 本文贡献:论文提出双体积(dual-volume)表示来补上缺失的界面——同一位置存两套体积,让贴合面两侧各自有归属。KaiNinja 建立在 TRELLIS.2 的 O-Voxel 之上,分两阶段生成:Stage 1 的 Layout Flow 把 3D 噪声网格去噪成逐 volume 的 occupancy 布局,两条流各自有自注意力、再用零初始化的全局注意力块跨流通信;Stage 2 的 SLat Flow 复用 TRELLIS.2 权重,只在活跃体素上对稀疏噪声去噪,最后由 FVAE 解码成 O-Voxel 体积并装配成部件分离的网格。整条流水线里没有掩码、也没有分割器。训练数据来源混杂,包含 CAD 模型和由 LLM 驱动的智能体创作的资产,作者称这是首个用智能体创作的部件数据训练的 3D 生成模型。 实验效果:相对不同范式的部件生成流水线,整体 Chamfer distance 降低 40%、严格部件 F-score 提升 16%;在held-out 测试集与训练未出现过的源上,KaiNinja 产出的部件数量都最接近真值,而 TRELLIS.2+X-Part、Hunyuan3D-2.1+X-Part、OmniPart、PartPacker 这几个基线常常把部件融在一起或者碎开。作者还报告一个反直觉现象:同样的骨干、同样的数据,加上部件级监督之后整体几何保真度反而也提升了。 批判点评:「免分割器」是这篇最硬的卖点,而它恰好没有回答分割器方案真正的软肋——精度上限。论文比的是部件数量、Chamfer 距离与 F-score,没有给出「部件语义是否对得上真值」的证据:在训练未出现的源上,KaiNinja 的部件着色与真值明显对不齐(椅子、花瓶、水壶几行都能看出切分位置与真值不同),也就是说「切得开」和「切得对」之间仍有距离,而语义正确性恰恰是分割器方案此前唯一能保证的东西。其次,40% / 16% 相对的是各基线外挂 X-Part 分割器后的组合结果,比的是「你的流水线 vs 别人的流水线」,而不是「dual-volume vs legacy O-Voxel」,无法分离表示本身的净贡献。第三,所谓「首个用智能体创作数据训练」目前只是自述,论文没有给出这类数据在训练集中的占比,也没有做数据来源的消融,因此这个卖点暂时无法验证。 5. 4DGS-Fixer:稀疏四视角重建4D高斯 4DGS-Fixer: Generative Sparse-View 4D Gaussian Splatting with Iterative Refinement Guided by Video Diffusion Priors | Goertek Alpha Labs;Singapore Institute of Technology;The Hong Kong University of Science and Technology | arXiv:2609.21176 关键词:4D高斯泼溅,稀疏视角,视频扩散先验,迭代精修,动态场景重建 ⚠️ 前序问题:用稀疏视角视频重建动态场景是典型的病态问题:观测太少、信息缺失,再多优化技巧也补不出来。更具体的症结在初始化——只有几个输入视角时,COLMAP 只能重建出稀疏残缺的点云,大片区域没有足够的高斯基元支撑,后续优化根本无从下手。也就是说问题出在起点,不在优化器。 本文贡献:论文给出一个两阶段的迭代精修框架。Stage 1 初始化:先对多路同步视频估计多视角深度图,把它们融合成稠密点云,为动态 4DGS 提供更完整的几何起点,替代 COLMAP 的稀疏点云。Stage 2 精修:沿新的相机轨迹渲染出视频,送进一个预训练的视频修复/恢复模型得到「修复后的伪目标视频」,再把它当作伪监督去迭代更新 4DGS 表示,多轮往复。整条链路的思路是用视频扩散先验补足缺失的观测信息,而不是继续在几何约束上加码。 实验效果:在常用的稀疏视角动态基准上,相对此前最好的方法 PSNR 提升接近 2 dB,作者称 substantially outperforms 现有基线。定性对比给出 GT / 4C4D / Ours 三行并排结果,4DGS-Fixer 在人物细节与背景完整度上都比 4C4D 明显更干净、更少孔洞。论文 comments 标注已接收至 SIGGRAPH Asia TC。 批判点评:整条链路的关键一步是「拿视频修复模型的输出当监督」,这带来一个绕不开的疑问:修复模型的幻觉会被原样写进 4DGS。用修复后的序列做伪监督,本质上是把生成先验的偏好当成真值——一旦输入视角极少、修复模型开始「编」,4DGS 就会忠实地记住这些编出来的内容;而 PSNR 的提升恰恰可能来自「补全得更像训练分布」而不是「更接近真实场景」。论文没有做「关掉修复模型、只保留深度稠密初始化」的对照,因此也说不清 2 dB 里有多少来自几何初始化、多少来自扩散先验。其次是部署成本:方法需要四路同步相机加一个预训练视频修复模型,实时性与泛化到非受控场景的能力都未讨论。源码层面还有个小瑕疵——LaTeX 里仍留着旧名「STGFixer pipeline」的残句没清理,说明从 STGFixer 改名到 4DGS-Fixer 之后并未完全同步。 6. RefineEdit:九类编辑背景保持最优 Refinement Is Inherently Editable: Training-Free Prompt-to-Prompt Image Editing with Generative Refinement Network | City University of Hong Kong (Dongguan);City University of Hong Kong;MBZUAI | arXiv:2609.20633 关键词:图像编辑,免训练,生成式精修网络,二值图像码,背景保持 ⚠️ 前序问题:文本引导的图像编辑要在「改对」和「别乱改」之间走钢丝。扩散类编辑器靠空间控制(掩码、注意力图)来圈定改动范围,而掩码一旦不准,结果不是改不彻底就是动到无关区域;因果自回归类编辑器还有一层额外约束——解码顺序固定,前面已经决定的 token 后面没法回头修正,早期的一个坏决策会被一路带下去。 本文贡献:论文换了一个编辑载体:不去控制扩散过程,而是在 Generative Refinement Network 的二值图像码上做全局精修。核心机制是双分支耦合——编辑分支从源轨迹的某个中间状态初始化,复用已经成形的布局;两个分支对同一批源采样 bit 分别给出概率,用它们的带符号差值挑出「该改的位置和 bit」。被选中的 bit 进入编辑精修,其余 bit 复制源分支持续演化的状态,于是「定位」与「生成」被绑在同一个精修过程里,编辑证据可以随图像演化不断被重新评估。为跨精修步稳定,论文加了两道约束:adaptive spatial freezing 抑制掩码无谓扩张,finite bit locking 让最近选中的 bit 保持可编辑。整套方案免训练、不需要外部掩码,也不需要注意力控制。 实验效果:在 PIE-Bench 的九类编辑任务上,RefineEdit 在 PSNR / LPIPS / MSE / SSIM 四项背景保持指标上全部最好,同时整图 CLIP 与被编辑区域 CLIP 也最高——「改得准」与「背景不崩」这次没有被做成取舍。定性部分与 LEDits++、FlowEdit、ChordEdit、MasaCtrl 在替换、添加、擦除、属性/姿态/颜色/材质/背景修改与风格迁移九类上逐一并排对比。 批判点评:最大的边界条件藏在实验设置里:这套流程要求源图来自 GRN 自己的生成轨迹——编辑分支要「继承源状态」,因此它编辑不了任意真实照片。论文在 limitation 里自己承认了这一点,但对普通用户而言,「只能改模型自己生成的图」和「能改我相册里的照片」是两个完全不同的产品。其次是超参:switch step(从第几步开始分叉)以及空间/bit 两个阈值都需要逐类调整,而且最优值是在同一个 PIE-Bench 评测集上选出来的,相当于用测试集选超参;论文的 limitation 也承认这些类别特定设置是在该基准上挑的,跨数据集泛化没有被验证。第三,九类各自用自己那一档配置,但真实用户不会先告诉系统「这次是换材质还是换背景」,多类混合的编辑场景仍未被覆盖。 7. QuAKE:W4A4 文生图量化误差校正 Quantization-Aware Kalman Estimation for Diffusion Sampling | Tsinghua University | arXiv:2609.21407 关键词:扩散模型量化,推理加速,W4A4,卡尔曼滤波,采样校正 ⚠️ 前序问题:量化是扩散模型落地的现实路径,但 W4A4 这种激进压缩会让量化去噪器的输出明显偏离全精度版本,而误差还会沿时间步持续传播、越积越大。已有的采样期校正方法基本只看当前步的局部信息,没有利用整条轨迹的历史——而误差恰恰是跨时间步传播的,用局部信息去修一个全局累积的问题,方向就不对。 本文贡献:论文把「用量化去噪器采样」重新表述成一个在线估计问题:既然真实的全精度输出拿不到,那就用历史量化输出去把它估回来。QuAKE 是为此设计的量化感知 Kalman 估计器,用一个平滑轨迹先验叠加一个条件高斯观测模型,每一步以闭式解递归更新「输出窗口」的后验,再把后验均值喂给采样器。它不改动量化网络、天然支持任意高阶多步 ODE 采样器,是一个即插即用的轻量校正器。论文同时给出了量化噪声的实证统计(边缘分布接近高斯、联合分布呈明显相关结构、条件分布可线性拟合),用来说明为什么 Kalman 这一套假设在这类噪声上站得住。 实验效果:在多个 W4A4 量化的文生图模型上,QuAKE 在「与全精度采样的分布差异」这一指标上持续领先:FLUX.1-dev + MJHQ-30K 上 FID 7.02 / KID 0.158,优于朴素量化的 7.30 / 0.257、TAC-Diffusion 的 7.31 / 0.304、Q-Drift 的 7.16 / 0.209;Sana-0.6B 上 7.90 / 0.289;PixArt-α 上 13.71 / 1.987;PixArt-Σ 上 15.99 / 3.401。开销按论文自己的测量几乎免费:FLUX.1-dev 单步延迟 22.2 ms(BF16)降到 6.2 ms(INT4 与 QuAKE 相同),DiT 体积 160 GiB 降到 102 / 104 GiB,端到端 23.51 s 降到 2.20 / 2.24 s。 批判点评:有一个容易被标题盖住的细节:QuAKE 赢的是分布距离(FID / KID),但在感知质量列上并不总是赢朴素量化。以 FLUX.1-dev + MJHQ-30K 为例,IR 分数 QuAKE 0.8822 低于 Quantized 的 0.8887,CLIP-IQA 0.9042 也低于 0.9057——也就是说 Kalman 校正主要抹平的是低层分布偏差,并没有让图在感知偏好上更讨喜;如果优化目标是下游打分模型或人眼偏好,朴素 INT4 甚至可能更安全。这不是论文的错,但摘要里「持续优于已有方法」的表述容易被读成全面胜出。其次,效率那一组三个数字(6.2 vs 6.2 ms、102 vs 104 GiB、2.20 vs 2.24 s)方向一致地说明校正本身几乎免费,反过来也说明它的收益完全来自「估得更准」而不是「跑得更快」——真正的加速来自量化,QuAKE 只负责把量化弄坏的部分补回来。最后,全部实验集中在文生图,视频扩散这类时间步更多、误差累积更长的场景是否同样成立,尚未给出证据。 8. AURA:对话式音乐编辑只训91M AURA: Unified Multimodal Framework for Conversational Music Editing | Aalto University;Technical University of Denmark;University of South Dakota;OpenRB Lab | arXiv:2609.14344 关键词:音乐编辑,多轮对话,多模态大模型,LoRA,概念token ⚠️ 前序问题:现有的指令式音乐编辑器是「一问一答」的:每条指令独立处理,用户想「先弱化鼓、再压一下高频、最后把情绪调柔和」这种逐步打磨的工作流根本走不通,因为模型记不住上一轮改了什么。此外,要改音乐光靠文字往往不够——用户脑子里想的是「这段场景听起来该是什么样」,而不是一串精确的音频术语。 本文贡献:AURA 把音乐编辑变成多轮对话。用一个多模态大模型读完整的对话历史、可选的一张图以及参考音频,把编辑意图蒸馏成一组紧凑的 concept token;再由 concept-to-audio(C2A)模块把这些 token 与逐帧对齐的参考特征注入冻结的 MusicGen 骨干——内部通过交叉注意力与 BiFAM 做对齐,让编辑既精确又不碰无关内容。训练只更新 91M 参数(LoRA rank-64 / α=128 加两个投影器与 C2A),1.9B 骨干全程冻结;对话数据由 Slakh2100 合成,共 66,539 段多轮对话。 实验效果:在域内 Slakh2100 与域外 MoisesDB 上同时评测:Add 任务的域外 FAD 0.84 对 Instruct-MG 的 3.84,Remove 任务域外 FAD 0.72 对 3.55,均为 4~5 倍降低;Remove 任务域内 SI-SDR +11.32 dB、SDRi +4.89,而 Instruct-MG 是 −2.10 / −8.53。消融显示对话历史确实起作用:只把最后一条指令喂给模型,Remove 的 SI-SDR 会掉到 −5.2 dB,SSIM 从 0.84 掉到 0.54。 批判点评:摘要里「域外 4~5 倍 FAD 降低」是有选择性的——它只覆盖 Add 与 Remove 两个任务;在 Extract 上 AURA 是 4.24 对 Instruct-MG 的 5.20,只有约 1.2 倍,并没有复现那个量级。更要紧的是 Extract 的SI-SDR 虽然比基线好得多(−7.62 对 −15.18),但仍是负值,说明「从混音里把目标音轨抽出来」这个任务本身离可用还有距离。其次,Remove 的域内增益(+11.32 dB)看着最亮眼,但该任务的域内评测集就来自训练数据来源域(Slakh2100 合成),换到域外 MoisesDB 只剩 +2.54 dB,跌幅接近 4 倍,真正的跨域能力比表格第一屏呈现的要弱。第三,91M 可训练参数对 1.9B 冻结骨干确实是漂亮的效率数字,但它同时意味着能力上限被 MusicGen-medium 这个骨干锁死,而论文没有给出换更大骨干的对照。 9. Qwen-Audio-3.0-TTS:四代语音模型瓶颈迁移史 The Evolving Bottleneck in Speech Generation: Interface Co-design and Staged Alignment from CosyVoice to Qwen-Audio-3.0-TTS | Alibaba Token Foundry | arXiv:2609.16514 关键词:语音合成,接口设计,瓶颈迁移,流匹配,阶段性对齐 ⚠️ 前序问题:语音合成的发展通常被叙述成「模型更大、tokenizer 更好、数据更多」,但这类叙事解释不了为什么某些改动立竿见影、某些就收效甚微。真正值得追问的是:每一代系统当下的主导瓶颈在哪里——是表征不够内容对齐?是接口不能因果流式?是覆盖度与可学习性不足?还是模型容量与跨模块协调出了问题? 本文贡献:这是一篇技术回顾(technical retrospective),沿 CosyVoice → CosyVoice 2 → CosyVoice 3 → Qwen-Audio-3.0-TTS 这条线给出另一种解释:进步来自瓶颈的反复迁移。四代之间不变的是一条分解——自回归语言模型负责「规划」,flow-matching 模型负责「渲染」;变的是两者之间的接口契约。作者把契约形式化成四个维度:representation(表征)、ownership(归属)、availability(可用性)、gradient reach(梯度可达性),并明确区分「单篇论文内的证据」与「跨论文比较」。每一代针对一个不同的约束:CosyVoice 立下监督式语义 token 这个内容对齐接口;CosyVoice 2 让接口对因果流式可用、把句级说话人嵌入从语言模型里移出;CosyVoice 3 靠多任务监督、数据与模型扩容、以及可微奖励优化(DiffRO)提升接口的可学习性与覆盖;Qwen-Audio-3.0-TTS 把帧率从 25 Hz 降到 12.5 Hz、渲染器改为条件在连续隐状态而非离散 token 嵌入上,并用五阶段课程做联合分阶段对齐。 实验效果:文中给出的实证来自各代公开系统:语义 token 的引入把中文 CER 从 2.56 降到 1.45、英文 WER 从 3.81 降到 2.57(CosyVoice 2 的模块消融);数据从约 17 万小时扩到 100 万小时、语言模型从 0.5B 扩到 1.5B(CosyVoice 3);Qwen-Audio-3.0-TTS 把帧率减半并保留 K=6561 的码本,五阶段课程依次为独立预训练、联合训练与质量退火、语言模型强化学习、声学鲁棒性、flow-matching 强化学习。 批判点评:这篇最需要标注边界的地方,作者自己写在 Figure 1 的图注里:「箭头编码的是我们的回顾性解释,而非受控的跨版本实验」。也就是说「瓶颈迁移」是一个事后叙事,不是被控制变量检验过的因果结论——拿它指导新系统设计时,风险在于你可能把相关性当成了因果。另一个更具体的问题是证据来源:文中复现的 tokenizer 对比(例如把帧率减半同时保持 K=6561 会一并损伤内容一致性与相似度)引自 Xiang et al. (2026),属于「论文内对比」的二次引用,不是独立复现;Table 1 也是同样的性质。因此这篇更适合当作一份结构清晰的领域地图来读——四维接口那套分析框架确实好用,也确实解释了「为什么改 tokenizer 有效、改渲染器无效」这类问题——但不宜当成可直接复制的工程配方。论文 comments 自注为 technical retrospective(11 页),本身也不以实验贡献为目标。 10. Ref-Free Metrics:13类语音指标在干净音频失效 The Limits of Reference-Free Speech Quality Metrics as Evaluators and Rewards on Modern Text-to-Speech | AGIGO;ETH Zurich;Sapienza University of Rome;University of Zurich | arXiv:2609.13150 关键词:语音质量指标,无参考评测,奖励攻击,成对偏好,评测协议 ⚠️ 前序问题:UTMOS、DNSMOS、SCOREQ 这类无参考质量预测器,今天既是 TTS 的默认自动评测器,又越来越常被拿去做偏好优化的奖励信号。这两个角色都建立在同一个假设上:预测分数能跟上人类偏好。但这个假设在什么条件下成立、什么时候会崩,此前没有被系统检验过。 本文贡献:论文把假设直接摆到台面上测。做法是构造一个成对判定任务——给两个音频片段,问预测器打分更高的那个是不是人更偏好的那个——然后在 6 个人工评分语料上跑,覆盖从「瑕疵明显」到「几近无瑕」的完整质量区间。评测对象包括 13 个无参考预测器家族(33 个分数变体)、13 个 Praat 韵律描述符,以及一批经典信号处理特征,每项都给出相对「随机基线」与「人类天花板」的位置。第二部分把这些指标当奖励用,对比单分数奖励与复合奖励在策略优化下的行为差异,并给出数据效率曲线。 实验效果:结论相当刺。在瑕疵明显的 BVCC 上,各指标准确率能爬到人类天花板附近(天花板 0.887,标定的复合分数到 0.92);但一旦两边音频都干净(TTS-HP),没有任何单个预测器能可靠指认被偏好的样本,好几个的准确率甚至低于「直接挑时长更长的那个」这个傻瓜基线(argmax clip duration 在 BVCC 0.517、SOMOS 0.368、SingMOS 0.456、SpeechJudge 0.370、TTS-Arena 0.523、TTS-HP 0.524),复合分数也才 0.52,而人类天花板是 0.764。奖励侧更严重:优化单一分数会诱发 reward hacking——指标冲上去了,但独立留出评测器和人工听测同时变差;复合奖励能抵抗这个倾向。数据效率曲线还给了个实用兜底:每类只取 min(20%, 1000) 条域内成对数据拟合一个带正则的线性头,就能把准确率相对最好的单指标提升 +1.5%(BVCC)到 +6.6%(SOMOS)。 批判点评:这篇的价值是给出一把尺子,而不是给出一个能用的指标——它自己也承认在干净音频上没有任何固定公式可迁移。要留意三点。第一,复合分数需要通过域内偏好标注拟合(论文用了 min(20%, 1000) 条域内成对数据),相对增益只有 +1.5% 到 +6.6%,也就是说「改用复合分数」这个建议的前提是你已经有该领域的偏好数据,对做通用 Reward Model 的人是不小的门槛。第二,它测的是成对偏好准确率,不是绝对 MOS 拟合度,「指标失效」的结论不能直接推成「MOS 预测不准」——在需要绝对分数的场景里结论需要重新验证。第三,时长基线之所以能赢,是因为评测语料里存在系统性的时长偏差,这提示「最好用的信号」可能来自数据偏置而非感知质量;反过来说,这也意味着任何在干净音频上得到的排行榜,都可能只是某个数据偏置的代理指标。 趋势观察 「边想边说」正在把推理的延迟藏起来 StepAudio 3 让私有推理与语音输出并行执行,用 Medusa 式 MTP 解码把思考压进说话的同一段时间窗;QuAKE 则把量化误差的校正重新表述成一个在线估计问题,用轨迹历史去猜全精度输出本该是什么。两者都在回答同一个问题:当「想清楚」和「立刻给」不能同时满足时,能不能把其中一件事塞进另一件事的时间窗里,而不是二选一。 物理一致性开始从「单类型」走向「复合行为」 CompAdapt 把神经动力学从单一运动类型扩到耦合运动、多阶段转换与多物体碰撞,并用一次性适配去应对没见过的物理律;4DGS-Fixer 干脆不追求几何自洽,改用视频扩散先验把缺失的观测补出来当伪监督。一个在约束上加码,一个在数据上放开,方向相反,但都承认了同一件事:稀疏观测下的物理,靠纯几何推不出来。 「部件」正在成为 3D 生成的新交付单位 KaiNinja 指出 O-Voxel 每个体素只存一片表面、单个 volume 在任何分辨率下都表示不了两个部件贴合的那层界面,于是用双体积表示把界面补上,全程不需要掩码或分割器。下游的编辑、绑骨与仿真要的正是部件而不是一整块表面。这提示 3D 生成的下一步未必是把表面做得更细,而是把语义切分做得更明确。 质量指标同时当评测和奖励,正在被自己的盲区反噬 语音侧,Ref-Free Metrics 那篇的 13 个无参考预测器在干净音频上集体失效,好几个甚至不如「挑最长的那个」,而优化单一分数会直接诱发 reward hacking;对话视频侧,OmniVChat 的效率项让平均回复长度从约 100 词掉到 35 词,效率上涨里混着「少说几句」。当同一个分数既当尺子又当奖励,它没测到的那部分就一定会被优化出来。 人工智能炼丹君 整理 | 2026-09-22 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年09月22日
2 阅读
0 评论
0 点赞
2026-09-17
AIGC 基本功|把 RL 用到扩散模型上-DiffusionRL
把 RL 用到扩散模型上:从一张图的奖励到整条去噪轨迹的梯度 所属方向:对齐与强化学习 | 难度:前沿 | 前置知识:GRPO、DDIM 采样 关键词:DiffusionRL、DDPO、去噪轨迹、终点奖励、信用分配、DPOK、DRaFT 01. 为什么需要它 扩散模型通常先学习“像训练数据”,但产品真正关心的目标往往不是训练集似然:文字有没有正确渲染、人物是不是多了一根手指、构图是否讨喜、生成物能不能被某个下游系统识别、视频运动是否自然。这些目标可能来自人工打分、视觉语言模型、OCR、物理模拟器,甚至一段只能返回分数的业务程序。它们大多不可微,也不一定有成对偏好数据,却都能回答同一个问题:这张最终样本值多少分? 直接把最终图片当成一次普通动作,会丢掉扩散模型最重要的结构:图片不是一次生成的,而是从纯噪声开始,经过几十次随机去噪才得到的。假设采样有 50 步,最后的文字错了,到底是哪一步需要改?如果只对最终结果拟合,模型既看不到每一步在旧策略下出现的概率,也无法使用 PPO 的重要性比率约束更新;如果硬把 50 个概率相乘成一个轨迹比率,数值又很容易趋近 0 或爆炸。 DiffusionRL 的关键不是发明一种新的扩散网络,而是换一个观察角度: 把一次完整采样视为一条有限时域 MDP 轨迹;当前 latent 是状态,下一 latent 的随机采样是动作,最终图片的评分是终点奖励。 这样,奖励虽然只在最后出现,整条轨迹的 log-prob 仍然可以参与策略梯度。DDPO(Denoising Diffusion Policy Optimization)正是把这个视角变成了可训练算法:它允许我们用 JPEG 可压缩性、目标检测器、审美模型或人工反馈等黑盒奖励微调扩散模型,而不要求对奖励函数求导。 这也是理解视频生成 RL 的统一入口。图片去噪已经有“时间步 × latent”的信用分配;到了视频,还会再叠加帧间运动、时序一致性和长时奖励。先把图像版的轨迹与概率比率看清,后面的算法名字就不再是一堆孤立缩写。 02. 最小可用理解 给定提示词 $c$,采样从 $x_T\sim\mathcal N(0,I)$ 开始;每个去噪步骤都由模型定义一个策略 $p_\theta(x_{t-1}\mid x_t,c)$。 完整轨迹的概率是所有步骤概率的乘积,所以它的 log-prob 是逐步 log-prob 之和;终点奖励 $R(x_0,c)$ 因而能乘到每一步的 score function 上。 实际训练不直接做无约束 REINFORCE,而是像 PPO 一样保存旧策略的逐步 log-prob、重新计算新策略 log-prob、裁剪概率比率,并用基线或组内标准化降低方差。 图里有一个必须说准的细节:网络通常输出噪声、velocity 或转移均值的参数,但在 MDP 记号中,“动作”是实际采样出来的 $x_{t-1}$。也就是说,网络参数化动作分布,采样器从这个分布中抽出动作;不要把“网络输出”和“环境中发生的动作”混成一件事。 03. 数学推导 3.1 先把一次随机去噪写成概率分布 为避免被不同预测参数化淹没,先只保留采样器真正需要的形式。对当前 latent $x_t$,模型根据时间步 $t$ 和条件 $c$ 预测噪声,再由调度器算出一个转移均值: $$\mu_\theta(x_t,t,c).$$ 带随机性的 DDIM 步可以统一写成: $$x_{t-1}=\mu_\theta(x_t,t,c)+\sigma_t z_t,\qquad z_t\sim\mathcal N(0,I).$$ 因此条件转移是一个高斯策略: $$\pi_\theta(a_t\mid s_t)=p_\theta(x_{t-1}\mid x_t,t,c)=\mathcal N\!\left(x_{t-1};\mu_\theta(x_t,t,c),\sigma_t^2 I\right).$$ DDIM 中的随机强度由 $\eta$ 控制。训练 DDPO 时通常必须让 $\eta>0$,这样被纳入似然目标的随机步骤才有普通高斯密度可用于 log-prob 和重要性比率。注意 $\eta>0$ 仍不保证所有步骤 $\sigma_t>0$:落到干净端的终步可能方差为零,需排除该步或显式采用非零方差,不能直接算高斯 log-prob。若 $\eta=0$,转移退化为确定性映射,$\sigma_t=0$,直接套高斯 log-prob 会除以零;确定性采样仍可用于可微奖励反传,但不能不加处理地套用这套随机策略梯度。 3.2 MDP 的四个元素 把扩散采样改写成 MDP 时,可使用下面的对应关系: RL 概念 扩散采样中的对象 状态 $s_t$ 当前 latent、时间步和条件:$(x_t,t,c)$ 动作 $a_t$ 从模型给出的分布中采样下一 latent:$x_{t-1}$ 策略 $\pi_\theta$ 反向去噪转移 $p_\theta(x_{t-1}\mid x_t,t,c)$ 奖励 中间步骤通常为 0;解码 $x_0$ 后得到 $R(x_0,c)$ 这里的“环境”几乎没有额外动力学:动作 $x_{t-1}$ 本身就成为下一状态的一部分,时间步从 $t$ 减到 $t-1$。文本编码器、VAE 解码器和奖励模型通常不属于策略参数;真正更新的是 UNet、DiT 或其 LoRA 适配器。 3.3 终点一个分数,为什么每一步都有梯度 给定提示词,一条轨迹记作 $\tau=(x_T,x_{T-1},\ldots,x_0)$。因为初始噪声不依赖模型参数,轨迹概率可分解为: $$p_\theta(\tau\mid c)=p(x_T)\prod_{t=T}^{1}p_\theta(x_{t-1}\mid x_t,t,c).$$ 取对数后,乘积变为求和: $$\log p_\theta(\tau\mid c)=\log p(x_T)+\sum_{t=T}^{1}\log p_\theta(x_{t-1}\mid x_t,t,c).$$ 目标是最大化期望终点奖励: $$J(\theta)=\mathbb E_{c,\tau\sim p_\theta}[R(x_0,c)].$$ 应用 likelihood-ratio trick: $$\nabla_\theta J(\theta)=\mathbb E\!\left[R(x_0,c)\nabla_\theta\log p_\theta(\tau\mid c)\right]=\mathbb E\!\left[R(x_0,c)\sum_{t=T}^{1}\nabla_\theta\log p_\theta(x_{t-1}\mid x_t,t,c)\right].$$ 这就是“奖励只在终点,梯度覆盖全轨迹”的来源。实践中会减去不依赖当前动作的基线 $b(c)$,得到优势: $$A=R(x_0,c)-b(c).$$ 减基线不会改变期望梯度,却能显著降低采样方差。若同一个 prompt 一次生成多张图,可以用组内均值和标准差做归一化: $$A_i=\frac{R_i-\operatorname{mean}(R_{1:G})}{\operatorname{std}(R_{1:G})+\epsilon}.$$ 组均值包含自身时,未标准化的中心化 score 估计在独立采样条件下有 $(1-1/G)$ 的缩放;随机标准差还会改变各组权重。因此上面的无偏基线证明不能直接套到组内标准化。它和 GRPO 的“组内相对分数”很相似,不过动作空间从 token 变成了高维 latent 转移。 3.4 每一步的 log-prob 到底怎么算 设动作 $x_{t-1}$ 有 $D$ 个独立高斯坐标、固定方差为 $\sigma_t^2>0$。真实联合 log-prob 必须对坐标求和: $$\ell_\theta=-\frac{\|x_{t-1}-\mu_\theta\|^2}{2\sigma_t^2}-D\log\sigma_t-\frac D2\log(2\pi).$$ 真实逐步联合概率比为 $r_t=\exp(\ell_\theta-\ell_{old})$。DDPO 作者实现 则把逐坐标 log-prob 取平均,即 $\bar\ell=\ell/D$,再计算 $$\bar r_t=\exp(\bar\ell_\theta-\bar\ell_{old})=r_t^{1/D}.$$ 这是一种控制高维数值尺度的工程替代比率,不再是严格的联合重要性权重;它也改变了 clip 的尺度。本文一维玩具 $D=1$ 时二者相同,多维复现时必须明确采用哪个约定。下式的 $r_t$ 应按所选约定解释。 PPO 风格的裁剪目标是: $$L_t(\theta)=\min\!\left(r_t A,\operatorname{clip}(r_t,1-\epsilon,1+\epsilon)A\right).$$ 训练代码通常最小化 $-L_t$。关键是先按转移计算比率再裁剪,不是先把所有 $r_t$ 相乘成一个轨迹比率。后者会随步数快速积累方差,也让某一步的异常比率拖垮整条样本。 3.5 同一个优势,不代表每一步得到同样的梯度 优势 $A$ 可以广播给每一步,但 score function 不同。对固定方差的高斯策略,有: $$\nabla_\theta\log p_\theta(x_{t-1}\mid x_t,c)=\frac{x_{t-1}-\mu_\theta}{\sigma_t^2}\nabla_\theta\mu_\theta.$$ 时间步的噪声尺度、采样残差、网络 Jacobian 都不同,因此各步的梯度贡献不会相等。终点附近通常对最终结果影响更直接,但并不存在“最后一步天然包办所有学习”的定理;调度器与模型参数化会改变信用在各步之间的分布。 04. 代码实现 下面的玩具过程只有一个可训练标量 $\theta$,但保留了 DDPO 的核心结构:8 步高斯去噪、只在终点计算奖励、保存逐步 log-prob、用中心化优势做 REINFORCE,并在最后演示新旧策略的 PPO 比率。 状态转移是: $$x_{t-1}=0.72x_t+0.18\theta+0.45z_t,\qquad z_t\sim\mathcal N(0,1).$$ 终点目标为 1.5,奖励为: $$R(x_0)=-(x_0-1.5)^2.$$ 完整代码见文末。直接运行: python3 ddpo_minimal.py 真实输出如下: trajectory_shape= (4096, 9) transition_log_prob_shape= (4096, 8) before_terminal_mean= 0.0052 before_reward_mean= -2.6513 after_theta= 2.2677 after_terminal_mean= 1.3577 after_reward_mean= -0.4370 per_step_gradient= [0.0088 0.0085 0.014 0.024 0.0358 0.0435 0.0578 0.0883] gradient_sample_std_raw_centered= 1.6981 1.3899 ppo_ratio_mean_min_max= 1.0010 0.4051 2.2337 ppo_clip_fraction= 0.3108 history_first= [ 0. -0.0165 -2.7295] history_last= [ 2.2677 1.3601 -0.4503] 几个 shape 很重要:4096 条轨迹、每条 8 个转移,所以状态数组有 9 个点,而 log-prob 只有 8 个。训练前 $x_0$ 均值约为 0;40 次更新后移到 1.36,接近目标 1.5,平均奖励从 -2.65 提升到约 -0.44。奖励是负平方误差,所以“更大”意味着更接近 0,而不是数值绝对值更大。 中心化前后,单样本梯度估计的标准差从 1.70 降到 1.39。这只是最简单的 batch baseline;工业实现还会按 prompt 维护统计量,避免一个本来就容易拿高分的 prompt 主导更新。 最后把参数轻微扰动,逐步比率均值仍约为 1,但极端值已经到 0.41 和 2.23,有约 31% 的转移落到裁剪区间之外。这说明“平均比率看起来正常”不足以判断更新是否安全,还要看 clip fraction、KL 和比率分位数。 右图里越靠近终点的转移贡献越大,是这个线性玩具过程的收缩系数 0.72 造成的:早期扰动经过多次收缩后影响变小。真实扩散模型不会总呈现这种单调形状,但它直观说明了:即使每一步共享同一个终点优势,信用仍由每一步的局部概率结构决定。 05. 工业级实现对照 截至 2026 年 9 月,DDPO 论文作者维护的参考实现 kvablack/ddpo-pytorch 仍是理解训练循环最直接的代码入口。其 scripts/train.py 和带 log-prob 的 ddim_step_with_logprob 展示了完整数据流: 采样 rollout:从 prompt 和初始噪声出发,保存形状近似为 [batch, steps + 1, C, H, W] 的 latents,以及 [batch, steps] 的旧策略 log-prob。 只给终点打分:将 $x_0$ 经 VAE 解码成图片,用 JPEG 可压缩性、审美分数、目标检测、视觉语言模型或业务规则计算奖励。慢奖励可以并发执行,但返回时必须和样本一一对齐。 构造优势:对全批次奖励标准化,或用 per-prompt statistics tracker 做条件化标准化。同一条轨迹的优势广播到各去噪时间步。 打乱样本与时间步:实现不仅 shuffle 样本,还可对每个样本打乱时间步顺序,降低相邻去噪步相关性对小批次更新的影响。 重算 log-prob:把保存的 $(x_t,x_{t-1},t,c)$ 喂给当前模型,通过 patched DDIM step 得到新策略 log-prob,而不是重新采样一个 $x_{t-1}$。 PPO 裁剪更新:计算逐步新旧比率,应用 clipped surrogate loss;通常只训练 LoRA,以降低显存、通信和策略漂移。 这个实现细节解释了为什么训练内存明显大于普通推理:rollout 阶段要保存整条 latent 轨迹和旧 log-prob,更新阶段又要为当前时间步建立反向图。若 rollout batch 为 $B$、去噪步数为 $T$,一轮采样至少处理 $B\times T$ 次 UNet/DiT 前向;若每批 rollout 做 $K$ 个 inner epochs,更新成本还会近似再乘 $K$。梯度累积只改变峰值显存,不会凭空消除总计算量。 早期 Hugging Face TRL 版本曾提供 DDPOTrainer,但当前上游目录与公开 API 已发生重构。读旧教程时应锁定对应版本,不要假设 trl/trainer/ddpo_trainer.py 在最新版仍是稳定入口;本文因此把论文作者仓库作为代码锚点。 从 rollout 到 update 的数据契约 工程里最值得先写清的不是 Trainer 类,而是一条样本在两个阶段之间必须携带什么。rollout 结束后,每条样本至少要保存 prompt 或其编码、全部时间步、从初始噪声到终点的 latents、旧策略逐步 log-prob、最终图片、原始奖励和经过标准化的优势。若使用 classifier-free guidance,还必须固定无条件分支、guidance scale 和文本编码方式;否则更新阶段重算出来的均值并不是采样时那条策略的均值。 update 阶段只取保存的当前 latent 和下一 latent,调用当前模型重算同一个已发生动作的 log-prob。这里绝对不能重新抽噪声:PPO 问的是“新策略对旧动作给出多大概率”,不是“新策略这次随机采到了什么”。这个区别在 token PPO 中很直观——不会在更新时重采一句回答——换成连续 latent 后却很容易藏在调度器接口里。 还应给 rollout 批次分配不可变的 sample id,并把 prompt、随机种子、reward 版本、模型 checkpoint 和 scheduler 配置写进元数据。这样一旦某个 batch 的 ratio 或奖励异常,能够重放出同一条轨迹并定位问题。只记录最后的 PNG 不够,因为不同 latent 轨迹可能解码成肉眼相近的图片,而策略梯度依赖的是当时每一步的概率。 多卡训练时,全局优势标准化也必须基于所有进程聚合后的奖励,而不是每张卡各算各的。否则不同卡的 prompt 难度稍有偏差,就会得到不同的零点和尺度;随后再做梯度平均,相当于混合了多套不一致的目标。相反,若采用 per-prompt 统计器,应明确冷启动策略:某个 prompt 样本太少时回退到全局统计,避免标准差接近零导致优势被放大。 DPOK:为什么还要加 KL 纯奖励最大化很容易把模型推离预训练分布。DPOK(Diffusion Policy Optimization with KL regularization)在在线策略梯度中加入参考模型约束,可抽象为: $$J_{\text{DPOK}}(\theta)=\mathbb E[R(x_0,c)]-\beta\,D_{\mathrm{KL}}(p_\theta\|p_{\text{ref}}).$$ $\beta$ 越大,模型越保守;越小,越容易快速追逐奖励,也越容易丢失多样性或出现奖励投机。PPO clipping 约束的是一次更新相对旧策略的变化,reference KL 约束的是长期相对基座模型的漂移,两者作用并不相同。 DRaFT:奖励可微时,可以不走 score function 如果奖励模型对像素可微,且采样器的整条计算图可以保留,就能把梯度从奖励直接穿过 VAE 与采样步骤反传到扩散模型。DRaFT 将这一路线系统化,并提出截断反传等变体来控制内存与梯度不稳定。 两条路线的选择很清楚: DDPO / DPOK:奖励可以是完全黑盒,只需要返回标量;代价是策略梯度方差较高,需要大量 on-policy 样本。 DRaFT 类方法:能利用奖励的路径导数,梯度通常更直接;但奖励必须可微,且跨很多采样步骤保存或重算计算图,显存与稳定性是主要问题。 它们可以共享同一个奖励定义,却不能把“对奖励求导”和“用奖励乘 log-prob”混写成一套推导。 06. 代价与边界 6.1 它省下了什么 不需要奖励函数可微,外部 API、人工评分和离散程序都能接入。 不需要为每个目标重新制作大规模成对偏好数据;在线采样能探索当前策略真正会生成的区域。 能复用 PPO 的裁剪、KL、优势归一化和诊断工具,把更新幅度控制在可观察范围内。 6.2 它付出了什么 on-policy 成本高:策略一更新,旧 rollout 很快过期;数据复用能力弱于离线偏好优化。 终点信用粗糙:所有步骤共享终点优势,方差高;步数越多、latent 越高维,问题越明显。 奖励调用可能成为瓶颈:大型 VLM 或人工评分比去噪本身还慢,异步队列与缓存很重要。 探索与画质有冲突:增大 DDIM 的 $\eta$ 有利于随机策略探索,却可能改变原有采样质量与分布。 奖励投机不会自动消失:OCR 奖励可能鼓励巨大文字,审美分数可能压低多样性,检测器奖励可能诱导模型画出分类器偏爱的纹理。 6.3 上线前至少记录这些指标 不要只看 mean reward。最低限度还应记录: 奖励均值、标准差和分位数,按 prompt 类别拆分; 新旧策略的 approximate KL、ratio 分位数与 clip fraction; 每个时间步的 loss、KL 或梯度范数,检查是否只剩少数步在学习; 多样性指标和基础画质指标,防止奖励提高但模式坍缩; 人工盲评或独立奖励模型的 holdout 分数,防止只攻破训练用 reward; 无效图片、NaN、全黑/过曝和安全过滤命中率。 如果奖励模型本身正在更新,还要给 reward 版本打快照。否则同一条训练曲线纵轴含义会变化,前后 reward 数字不可直接比较。 6.4 奖励怎么配,往往比优化器更重要 真实系统几乎不会只用一个分数。以文字生成图片为例,可以同时有提示词一致性、OCR 正确率、审美、人体结构和安全性五类信号。最直接的做法是加权求和: $$R=w_{\text{prompt}}R_{\text{prompt}}+w_{\text{ocr}}R_{\text{ocr}}+w_{\text{aesthetic}}R_{\text{aesthetic}}-w_{\text{safety}}C_{\text{safety}}.$$ 但“都放进来”不等于问题解决了。不同奖励的量纲与波动范围可能差几个数量级:OCR 是 0 或 1,审美模型可能落在 1 到 10,安全惩罚可能只有极少数样本非零。若不先校准,权重看似相近,实际梯度却会被方差最大的那一项占满。稳妥做法是先在固定基座模型上采一批校准集,观察每项分布,再做裁剪、标准化或分位数映射;训练期间同时画出每个子奖励,不能只保存加权总分。 还要区分“软目标”和“硬约束”。图片里文字少一个字,通常是可连续改进的软目标;生成违法内容则不应靠一个可被其他高分抵消的负权重处理。硬约束更适合在采样前后用过滤器、拒绝策略或拉格朗日约束单独处理。否则模型可能发现:只要审美分足够高,安全惩罚也值得承受。 多目标之间还会发生真实冲突。把 OCR 权重拉高,模型可能把文字做得巨大而破坏构图;只奖励检测器置信度,可能得到边缘锐利但不自然的目标。应当用 Pareto 视角看结果:同一批 checkpoints 同时比较各子目标和人工偏好,选择没有被某一维明显支配的方案,而不是盯着一条总 reward 曲线挑最高点。 6.5 三个能快速定位实现错误的不变量 第一,rollout 保存的状态数必须比转移 log-prob 数多 1;若二者相等,通常漏了初始噪声或终点 latent。第二,当新旧模型参数完全相同时,逐步 ratio 应非常接近 1,approximate KL 应接近 0;否则多半是调度器、CFG 分支、时间步索引或 log-prob 归约维度不一致。第三,打乱 batch 顺序不应改变同一个样本的 reward、prompt、latents 与 log-prob 对齐关系。异步奖励最容易在这里悄悄错位:训练仍会运行,均值甚至会上升,但模型学到的是别人的分数。 调试时先用一个可以解析求解的低维过程,就像本文代码;确认梯度方向、ratio 和 baseline 都符合预期,再接入大模型。直接在多卡图像训练里找符号错误,通常会把昂贵计算浪费在最便宜的 bug 上。 这些不变量也适合写进自动化测试:用固定随机种子的十几条轨迹做快速回归,每次升级 diffusers、调度器或混合精度设置后先跑它,再启动昂贵的正式训练。 07. 经典论文脉络 Training Diffusion Models with Reinforcement Learning / DDPO(arXiv:2305.13301)把扩散去噪正式改写为多步决策过程,给出基于 likelihood ratio 的 DDPO,并展示了不可微奖励下的微调能力。它奠定了“去噪轨迹就是策略轨迹”的主框架。 DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models(arXiv:2305.16381)把在线策略梯度与 KL 正则结合,强调奖励提升和预训练分布保持之间的平衡。 DRaFT: Directly Fine-tuning Diffusion Models on Differentiable Rewards(arXiv:2309.17400)转向可微奖励,通过采样链直接反传,并研究 full、截断和低方差版本,形成与 DDPO 互补的路线。 Reward-Directed Conditional Diffusion(arXiv:2307.07055)从 reward-conditioned / reward-directed 角度研究如何把黑盒目标引入扩散生成,说明“训练一个条件生成器”和“在线策略优化”是相关但不同的解法。 Diffusion Models for Reinforcement Learning: A Survey(arXiv:2311.01223)覆盖的是更宽的交叉方向:既包括用 RL 对齐扩散生成,也包括把扩散模型当作策略或规划器。阅读时要先辨认“RL 优化 diffusion”还是“diffusion 服务 RL”。 论文名称很像时,先看梯度从哪里来:若公式里是 $R\nabla\log p_\theta$,属于 score-function 策略梯度;若是 $\nabla_{x_0}R$ 沿采样链反传,则属于可微奖励路线;若训练数据是静态偏好对,通常又是离线偏好优化问题。 08. 常见误解 误解 1:模型预测的噪声就是 RL 动作 噪声预测是策略的参数化中间量。DDPO 的动作通常记为实际采样出的下一 latent $x_{t-1}$,策略概率才是 $p_\theta(x_{t-1}\mid x_t,c)$。只有这样,保存动作、重算 log-prob 和构造新旧比率才是一致的。 误解 2:奖励在最后,所以只有最后一步能更新 轨迹 log-prob 是逐步 log-prob 的和。终点奖励乘的是整条和,因此每个去噪转移都有 score-function 梯度。最后一步可能贡献较大,但不是唯一有梯度的一步。 误解 3:确定性 DDIM 也能原样计算 DDPO log-prob $\eta=0$ 时 $\sigma_t=0$,普通高斯 log-prob 不再成立。要么使用非零随机性,要么换成适合确定性路径的可微反传或其他估计器,不能简单给分母加一个 epsilon 就宣称理论等价。 误解 4:把所有逐步比率相乘,才是最“严格”的 PPO 轨迹比率在长链上方差巨大。DDPO 实践通常按去噪转移计算和裁剪 ratio;这是一种稳定的 surrogate,而不是把一个 50 步连乘数硬塞进普通 PPO 公式。 误解 5:同一奖励广播到每一步,所以每步学到的一样 优势相同,不等于 score function 相同。噪声方差、预测残差、网络敏感度和调度器权重都随时间步变化,逐步梯度自然不同。 误解 6:奖励不可微就无法优化扩散模型 DDPO 只需要采样结果和标量奖励,不需要奖励梯度。不可微带来的问题是估计方差和样本成本,而不是“没有任何梯度”。 误解 7:训练 reward 上升就代表模型全面变好 模型可能只学会利用 reward 的盲点。必须同时看独立评估、人工盲评、多样性、prompt 遵循和安全指标;最好用不同架构的 holdout reward 检查泛化。 09. 动手验证:四个改动看懂算法 文末代码只依赖 NumPy,建议依次改四个参数,每次固定随机种子并比较输出。 实验 A:把 steps 从 8 改为 16 预期状态 shape 从 (4096, 9) 变成 (4096, 17),log-prob shape 从 (4096, 8) 变成 (4096, 16)。更长轨迹会增加梯度求和项;在不调整学习率与归一化时,训练波动通常更明显。 实验 B:把 noise_std 从 0.45 降到 0.10 探索减弱,采样更集中;但 score function 含 $1/\sigma^2$,数值会更尖锐。过小噪声并不等于更稳定,极限到 0 反而失去这套高斯策略梯度的基础。 实验 C:删掉优势中心化 把 advantage = (reward - reward.mean()) / ... 改成直接使用 reward。gradient_sample_std_raw_centered 的第二个值会失去优势,训练曲线更抖。这个实验直观看到 baseline 改变方差而不改变目标最优点。 实验 D:增大新旧参数差 在 PPO 诊断部分增大 new_theta - old_theta。你会看到 ratio_min/max 更极端,clip_fraction 上升。工程上这对应学习率过大、inner epochs 过多或 KL 约束过弱。 进一步可把终点奖励改成离散黑盒:例如 reward = (abs(x0-target) < 0.25)。代码仍能训练,但由于奖励更稀疏,往往需要更大 batch、分层采样或更好的 baseline。这正是从玩具例子走向 OCR 成功率、目标检测命中和人工反馈时遇到的现实问题。 10. 延伸阅读 这篇位于“对齐与强化学习”路径的第三段: 策略梯度与 PPO 基础:理解 advantage、ratio、clipping 和 KL; 从 DPO 到 GRPO:去掉价值网络:理解组内相对优势; 本文 DiffusionRL:把 token 轨迹换成 latent 去噪轨迹; 视频生成中的强化学习与奖励模型:在去噪信用之外,再处理画质、运动与指令遵循的多目标奖励。 如果 DDIM 还不熟,先记住本文真正依赖的最小事实:它把 $x_t$ 和网络预测组合成下一步均值,并可用 $\eta$ 注入高斯随机性。从 DDIM 到高阶采样器 已展开采样公式、ODE/SDE 视角与高阶求解器。 最后用一句话收束: DiffusionRL 不是把一个 PPO 套在图片外面,而是把每次去噪转移变成可计概率的动作,再让终点奖励沿整条轨迹分配信用。 附录:完整代码 09 节用到的脚本全文如下(ddpo_minimal.py、make_figures.py)。复制到本地存成同名文件,按各脚本开头的依赖说明准备环境后即可运行。 ddpo_minimal.py """NumPy-only toy DDPO: treat iterative denoising as a stochastic policy. This is an algebra demo, not an image generator. A scalar latent follows a short Gaussian reverse process. One parameter shifts every denoising mean, and a terminal reward teaches the process to end near a target value. """ from dataclasses import dataclass import numpy as np @dataclass(frozen=True) class ToyConfig: steps: int = 8 batch_size: int = 4096 contraction: float = 0.72 action_scale: float = 0.18 noise_std: float = 0.45 target: float = 1.5 def gaussian_log_prob(value, mean, std): """Elementwise log N(value; mean, std^2).""" return -0.5 * ((value - mean) / std) ** 2 - np.log(std * np.sqrt(2.0 * np.pi)) def rollout(theta, cfg, rng): """Sample x_T -> ... -> x_0 and retain every transition. Array index 0 stores x_T; index cfg.steps stores x_0. The transition mean is mu_theta = contraction * x_t + action_scale * theta. """ latents = np.empty((cfg.batch_size, cfg.steps + 1), dtype=np.float64) means = np.empty((cfg.batch_size, cfg.steps), dtype=np.float64) log_probs = np.empty((cfg.batch_size, cfg.steps), dtype=np.float64) latents[:, 0] = rng.normal(size=cfg.batch_size) for j in range(cfg.steps): mean = cfg.contraction * latents[:, j] + cfg.action_scale * theta next_latent = mean + cfg.noise_std * rng.normal(size=cfg.batch_size) latents[:, j + 1] = next_latent means[:, j] = mean log_probs[:, j] = gaussian_log_prob(next_latent, mean, cfg.noise_std) terminal = latents[:, -1] rewards = -(terminal - cfg.target) ** 2 return latents, means, log_probs, rewards def score_function(latents, means, cfg): """d log pi_theta(x_{t-1}|x_t) / d theta for every transition.""" residual = latents[:, 1:] - means return residual * cfg.action_scale / (cfg.noise_std**2) def policy_gradient(rewards, per_step_scores): """REINFORCE with a batch baseline; terminal advantage is broadcast to T steps.""" centered = rewards - rewards.mean() advantages = centered / (rewards.std() + 1e-8) trajectory_scores = per_step_scores.sum(axis=1) gradient = np.mean(advantages * trajectory_scores) per_step_gradient = np.mean(advantages[:, None] * per_step_scores, axis=0) return gradient, per_step_gradient, advantages def evaluate(theta, cfg, seed): rng = np.random.default_rng(seed) latents, means, log_probs, rewards = rollout(theta, cfg, rng) return { "terminal_mean": float(latents[:, -1].mean()), "reward_mean": float(rewards.mean()), "latents": latents, "means": means, "log_probs": log_probs, "rewards": rewards, } def train(cfg, updates=40, learning_rate=0.08, seed=7): theta = 0.0 history = [] rng = np.random.default_rng(seed) for update in range(updates + 1): latents, means, _, rewards = rollout(theta, cfg, rng) scores = score_function(latents, means, cfg) gradient, per_step_gradient, advantages = policy_gradient(rewards, scores) history.append((update, theta, latents[:, -1].mean(), rewards.mean(), gradient)) if update < updates: theta += learning_rate * gradient return theta, np.asarray(history), per_step_gradient, advantages, scores, rewards def ppo_diagnostics(theta_old, theta_new, cfg, seed=123, clip_range=0.2): """Re-evaluate old transitions under a candidate new policy.""" rng = np.random.default_rng(seed) latents, old_means, old_log_probs, rewards = rollout(theta_old, cfg, rng) new_means = cfg.contraction * latents[:, :-1] + cfg.action_scale * theta_new new_log_probs = gaussian_log_prob(latents[:, 1:], new_means, cfg.noise_std) ratios = np.exp(new_log_probs - old_log_probs) clipped = np.abs(ratios - 1.0) > clip_range return rewards, ratios, clipped if __name__ == "__main__": np.set_printoptions(precision=6, suppress=True) cfg = ToyConfig() before = evaluate(theta=0.0, cfg=cfg, seed=2026) theta, history, per_step_gradient, advantages, scores, rewards = train(cfg) after = evaluate(theta=theta, cfg=cfg, seed=2026) raw_gradient_samples = rewards * scores.sum(axis=1) centered_gradient_samples = (rewards - rewards.mean()) * scores.sum(axis=1) ppo_rewards, ratios, clipped = ppo_diagnostics( theta_old=0.0, theta_new=0.5, cfg=cfg ) print("trajectory_shape=", before["latents"].shape) print("transition_log_prob_shape=", before["log_probs"].shape) print("before_terminal_mean=", f"{before['terminal_mean']:.4f}") print("before_reward_mean=", f"{before['reward_mean']:.4f}") print("after_theta=", f"{theta:.4f}") print("after_terminal_mean=", f"{after['terminal_mean']:.4f}") print("after_reward_mean=", f"{after['reward_mean']:.4f}") print("per_step_gradient=", np.round(per_step_gradient, 4)) print( "gradient_sample_std_raw_centered=", f"{raw_gradient_samples.std():.4f}", f"{centered_gradient_samples.std():.4f}", ) print( "ppo_ratio_mean_min_max=", f"{ratios.mean():.4f}", f"{ratios.min():.4f}", f"{ratios.max():.4f}", ) print("ppo_clip_fraction=", f"{clipped.mean():.4f}") print("history_first=", np.round(history[0, 1:4], 4)) print("history_last=", np.round(history[-1, 1:4], 4)) assert before["latents"].shape == (cfg.batch_size, cfg.steps + 1) assert before["log_probs"].shape == (cfg.batch_size, cfg.steps) assert after["reward_mean"] > before["reward_mean"] assert abs(after["terminal_mean"] - cfg.target) < abs(before["terminal_mean"] - cfg.target) assert np.all(np.isfinite(ratios)) make_figures.py """Generate the explanatory figures for the DiffusionRL article. Requires NumPy, Matplotlib and Pillow. The numerical chart reuses the exact toy process from ddpo_minimal.py so the article and figure cannot drift apart. """ from pathlib import Path import matplotlib matplotlib.use("Agg") import matplotlib.pyplot as plt import numpy as np from PIL import Image, ImageDraw, ImageFont from ddpo_minimal import ToyConfig, train OUT = Path(__file__).resolve().parents[1] / "figures" OUT.mkdir(exist_ok=True) def _font(size, bold=False): candidates = ( "/System/Library/Fonts/PingFang.ttc", "/System/Library/Fonts/Hiragino Sans GB.ttc", "/usr/share/fonts/opentype/noto/NotoSansCJK-Bold.ttc" if bold else "/usr/share/fonts/opentype/noto/NotoSansCJK-Regular.ttc", ) for path in candidates: try: return ImageFont.truetype(path, size) except OSError: pass raise RuntimeError("请安装中文字体后再生成 DiffusionRL 示意图") def trajectory_mdp(): image = Image.new("RGB", (1800, 980), "#f8fafc") draw = ImageDraw.Draw(image) ink, blue, green, orange, muted = "#172033", "#2563eb", "#059669", "#ea580c", "#526078" draw.text((90, 55), "把多步去噪看成一条 MDP 轨迹", font=_font(70, True), fill=ink) draw.text((92, 150), "状态是当前 latent,动作是下一 latent 的采样,终点图像只得到一次奖励", font=_font(38), fill=muted) draw.text((900, 285), "策略 πθ = pθ(next | current, c)", font=_font(32), fill=blue, anchor="mm") xs = [170, 480, 790, 1100, 1410] labels = ["xT", "xT−1", "xT−2", "…", "x₀"] subtitles = ["纯噪声", "较粗结构", "结构成形", "继续去噪", "最终样本"] for i, (x, label, subtitle) in enumerate(zip(xs, labels, subtitles)): color = blue if i < len(xs) - 1 else green draw.rounded_rectangle((x - 105, 360, x + 105, 540), radius=36, fill="#ffffff", outline=color, width=6) draw.text((x, 400), label, font=_font(46, True), fill=color, anchor="mm") draw.text((x, 485), subtitle, font=_font(28), fill=muted, anchor="mm") if i < len(xs) - 1: draw.line((x + 110, 450, xs[i + 1] - 120, 450), fill=ink, width=5) draw.polygon( [(xs[i + 1] - 120, 450), (xs[i + 1] - 148, 433), (xs[i + 1] - 148, 467)], fill=ink, ) draw.line((1515, 450, 1650, 450), fill=orange, width=5) draw.polygon([(1650, 450), (1622, 433), (1622, 467)], fill=orange) draw.rounded_rectangle((1510, 630, 1735, 820), radius=32, fill="#fff7ed", outline=orange, width=5) draw.text((1622, 675), "R(x₀,c)", font=_font(44, True), fill=orange, anchor="mm") draw.text((1622, 750), "终点奖励", font=_font(31), fill=muted, anchor="mm") draw.line((1620, 545, 1620, 625), fill=orange, width=5) draw.polygon([(1620, 625), (1603, 597), (1637, 597)], fill=orange) draw.rounded_rectangle((90, 650, 1380, 850), radius=30, fill="#eef4ff") draw.text((130, 685), "同一个优势 A 被广播到每一步:", font=_font(39, True), fill=ink) draw.text((130, 750), "A · [grad log pθ(xT−1 | xT) + … + grad log pθ(x₀ | x₁)]", font=_font(39), fill=blue) draw.text((130, 805), "奖励只在终点出现,但整条轨迹的 log-prob 都参与更新。", font=_font(31), fill=muted) image.save(OUT / "diffusion_rl_mdp.png", optimize=True) def cover(): image = Image.new("RGB", (1280, 720), "#081225") draw = ImageDraw.Draw(image) # A denoising trajectory that gradually changes from noise-like dots into a # clean latent. Keeping this code-native makes the cover deterministic. rng = np.random.default_rng(7) stages = [190, 400, 610, 820, 1030] palette = ["#60a5fa", "#38bdf8", "#2dd4bf", "#34d399", "#f59e0b"] for i, x in enumerate(stages): radius = 62 draw.ellipse((x - radius, 258 - radius, x + radius, 258 + radius), outline=palette[i], width=5) spread = 47 - i * 7 for _ in range(38 - i * 4): px = x + int(rng.normal(0, spread)) py = 258 + int(rng.normal(0, spread)) dot = 2 + i draw.ellipse((px - dot, py - dot, px + dot, py + dot), fill=palette[i]) if i < len(stages) - 1: draw.line((x + 72, 258, stages[i + 1] - 75, 258), fill="#94a3b8", width=4) draw.polygon( [(stages[i + 1] - 75, 258), (stages[i + 1] - 96, 246), (stages[i + 1] - 96, 270)], fill="#94a3b8", ) draw.rounded_rectangle((1068, 190, 1222, 326), radius=26, fill="#431407", outline="#f59e0b", width=4) draw.text((1145, 258), "+R", font=_font(48, True), fill="#fbbf24", anchor="mm") draw.text((92, 415), "把 RL 用到扩散模型上", font=_font(64, True), fill="#f8fafc") draw.text((96, 507), "DiffusionRL · DDPO · 去噪轨迹 · 信用分配", font=_font(34), fill="#93c5fd") draw.rounded_rectangle((94, 603, 426, 659), radius=25, fill="#1d4ed8") draw.text((260, 631), "AIGC 基本功", font=_font(28, True), fill="#ffffff", anchor="mm") image.save(OUT / "wechat_cover_diffusion_rl.png", optimize=True) def training_and_credit(): cfg = ToyConfig() _, history, per_step_gradient, _, _, _ = train(cfg) updates = history[:, 0] fig, axes = plt.subplots(1, 2, figsize=(11, 4.3)) ax = axes[0] ax.plot(updates, history[:, 3], color="#2563eb", linewidth=2.5, label="mean terminal reward") ax.set_xlabel("policy updates") ax.set_ylabel("reward (higher is better)") ax.grid(alpha=0.2) ax2 = ax.twinx() ax2.plot(updates, history[:, 2], color="#059669", linewidth=2.2, label="mean x0") ax2.axhline(cfg.target, color="#059669", linestyle="--", alpha=0.45, label="target") ax2.set_ylabel("terminal latent mean") lines = ax.get_lines() + ax2.get_lines() ax.legend(lines, [line.get_label() for line in lines], frameon=False, loc="center right") ax.set_title("Toy DDPO learns from terminal reward") ax = axes[1] steps = np.arange(cfg.steps) ax.bar(steps, per_step_gradient, color=plt.cm.Blues(np.linspace(0.45, 0.95, cfg.steps))) ax.set_xticks(steps, [f"{cfg.steps-i}→{cfg.steps-i-1}" for i in steps], rotation=40) ax.set_xlabel("denoising transition") ax.set_ylabel("estimated gradient contribution") ax.grid(axis="y", alpha=0.2) ax.set_title("Same reward, different credit per step") fig.suptitle("Terminal reward becomes a trajectory-level policy gradient", fontsize=15, weight="bold") fig.tight_layout() fig.savefig(OUT / "diffusion_rl_training_credit.png", dpi=190) plt.close(fig) if __name__ == "__main__": trajectory_mdp() training_and_credit() cover() for name in ( "diffusion_rl_mdp.png", "diffusion_rl_training_credit.png", "wechat_cover_diffusion_rl.png", ): print(OUT / name) 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年09月17日
7 阅读
0 评论
0 点赞
2026-08-27
AIGC 每日速读|2026-08-27|浙大清华19B音视频4步2.5秒出片TurboT2VA
今日 AIGC 论文速览 今日共 10 篇 · 推理加速与少步蒸馏 1 篇 · 扩散后训练与奖励对齐 2 篇 · 音频统一理解与生成 1 篇 · 视觉 tokenizer 与表征组织 2 篇 · 图生 3D 与 PBR 资产 1 篇 · 物理接地图像编辑 1 篇 · 世界模型数据引擎 1 篇 · 大规模开源数据集 1 篇 重点论文标题列表 TurboT2VA(浙江大学、清华大学、天津大学、青岛大学、新加坡国立大学):19B音视频4步蒸馏2.5秒出片 DiffusionOPSD(字节跳动 Seed、新加坡国立大学、加州大学圣地亚哥分校、牛津大学、香港科技大学、马里兰大学、加州大学伯克利分校、杜克大学):把奖励梯度变成中间去噪目标 RVM(佐治亚理工学院、NVIDIA):奖励加权速度匹配替代策略梯度 FireRedAudio(小红书):理解与生成各走一条连续表征 AffineTok(复旦大学、阿里巴巴 Token Hub(Wan 团队)):语义仿射一致把gFID压到1.10 今日论文速览 1. TurboT2VA:19B音视频4步蒸馏2.5秒出片 TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation | 浙江大学、清华大学、天津大学、青岛大学、新加坡国立大学 | arXiv:2608.24674 关键词:少步蒸馏,一致性蒸馏,音视频联合生成,LTX-2,稀疏注意力,W8A8量化,浙大清华 前序问题:文本到「视频+音频」的联合生成能一次产出画面与声音同步的内容,但这类模型的推理成本高得离谱:采样轨迹长(40 步)、参数量大(19B)、而且视频流与音频流的计算特性完全不同,异构多模态计算让常规加速手段难以直接照搬。把大规模 T2VA 模型蒸馏成少步学生具体卡在三处:一是模态不均衡优化——视频与音频的损失尺度、收敛速度差异显著,共用一套归一化会让某一路主导梯度;二是连续时间一致性训练在这个规模上很难稳住,学生容易在训练中后期崩掉;三是质量与多样性的权衡——分布匹配类目标(DMD)虽然能把画质拉上去,却容易把生成多样性压塌,退化成少数几个模式。 本文贡献:TurboT2VA 的主体是一套双散度蒸馏框架加一条渐进课程。框架分三块:左侧对视频与音频分别做前向一致性蒸馏(各自沿教师 PF-ODE 学自己的一致性场,同时带跨模态一致性约束);中间是 T2VA 双流骨干,视频流与音频流各有 self-attention 与 text cross-attention,再通过 VA cross-attention 相互耦合;右侧做反向散度精修,用分布匹配把学生输出分布拉向教师分布。课程按 dCM 预热 → sCM 精修 → sCM+DMD 联合优化三段推进,先建立稳定且多样的生成轨迹,只有到最后才引入分布级精修——顺序反了就会先塌多样性。模态不均衡用 per-modality normalization 解决。除蒸馏之外还配了一套架构感知的推理栈:guarded W8A8 量化与算子融合、padded-text compaction、模态感知稀疏注意力,但明确保留跨模态与文本条件路径为 dense,不对音画同步这条链路做近似。 Overview of the proposed Dual-Divergence Distillation framework for T2VA acceleration. The left panel illustrates forward consistency distillation for video and audio modalities, the middle shows the T2VA backbone with cross-modal interaction, and the right panel depicts reverse divergence (distribution matching) refinement. 实验效果:在 LTX-2 上做 4 步蒸馏,标准评测分辨率 512×768 下生成器延迟从 50.52 秒降到 2.51 秒,20.1 倍加速,同时维持视觉质量、音频保真度、多样性与音画同步。高分辨率部署(1024×1792、121 帧、单卡 NVIDIA H20、batch size 1)下的完整栈拆解得很清楚:40 步教师基线 318.74 秒;加 W8A8 与算子融合得 1.37 倍,降至 233.34 秒;换成 4 步学生再得 19.18 倍,降至 12.16 秒;最后叠加 SageSLA 稀疏注意力(默认 ρ=0.3)再得 2.08 倍,落到 5.83 秒,整体 54.67 倍(仅生成器)。训练曲线消融跑到 7,500 全局步:分阶段 dCM→sCM→sCM+DMD 在进入联合阶段后反超直接做 sCM+DMD,并在训练后期保持更强表现;从同一段 dCM+sCM 前缀出发,分阶段 sCM+DMD 的 Javis 分数也高于纯 DMD 精修或只继续 sCM。 High-resolution inference acceleration, achieving a 54.67$\times$ generator-only speedup on one NVIDIA H20. 批判点评:20.1 倍与 54.67 倍都是 generator-only 延迟,不含 VAE 解码、文本编码与音频后处理,端到端加速会明显低于这两个数字,读者不要直接当成「出片时间快 54 倍」。更需要留意的是 54.67 倍把蒸馏(19.18 倍)和推理工程栈(1.37×2.08≈2.85 倍)的功劳乘在了一起——工程栈那部分与蒸馏方法本身无关,换任何一个模型都能拿,混在一个标题数字里报有夸大之嫌。质量侧只给了「strong visual quality / audio fidelity / synchronization」这类定性表述,没有 FVD、CLAP、AV-Sync offset 的绝对值,也没有与 40 步教师的逐项差距,而少步蒸馏最该被审视的恰恰是「掉了多少」。W8A8 前面挂了 guarded 这个限定词,说明存在必须保护的敏感层,但哪些层回退高精度、回退比例多少没有交代,这会影响别人复现时的实际加速比。稀疏注意力保留了 dense 跨模态路径,意味着收益会随音视频 token 配比波动,不同视频时长下的敏感性没测。全部结论只在 LTX-2 一个骨干上得到;H20 是国内特供算力卡,其显存带宽与算力配比和 H100 差异不小,量化与稀疏化的收益能否平移过去论文没有讨论。 2. DiffusionOPSD:把奖励梯度变成中间去噪目标 On-Policy Self-Distillation in Diffusion Models | 字节跳动 Seed、新加坡国立大学、加州大学圣地亚哥分校、牛津大学、香港科技大学、马里兰大学、加州大学伯克利分校、杜克大学 | arXiv:2608.24646 关键词:扩散后训练,on-policy自蒸馏,奖励梯度,中间监督,人类偏好对齐,字节Seed 前序问题:强化学习能把扩散模型对齐到人类偏好与任务目标上,但奖励是打在端点(生成图)上的,它不告诉某一步的中间去噪预测该往哪个方向改。这就是扩散 RL 的结构性困难:自回归模型有可解析的样本似然,可以直接套策略梯度;扩散模型没有,于是现有方法只能绕——要么从随机去噪转移拼出轨迹似然,要么用证据下界近似端点似然。两条路都要付额外的计算与算法复杂度,而换来的监督信号仍然稀疏地挂在轨迹末端,中间那几十步实际上是在盲走。 本文贡献:DiffusionOPSD 把「图像级奖励引导」直接转成「clean-output 预测的显式目标」。每一轮外循环里,一个冻结的 behavior policy 先生成轨迹,同时提供采样查询状态与 anchor;奖励梯度在每个 anchor 周围构造出有界的正目标与负目标;可训练 policy 以 detached supervision 的方式拟合这些目标(作者称之为 finite fitting),拟合完成后用指数移动平均更新刷新 behavior policy。这个结构的价值不只在效果——它把「目标构造」和「有限实现」拆成两个可以分别度量的环节,从而让扩散 RL 第一次变得可诊断。论文特意做了同 query 的受控实验来分别观测这两环。 Reward-to-policy paradigms. We contrast trajectory credit, late-state reward backpropagation, and endpoint supervision with our explicit intermediate targets constructed before finite fitting. 实验效果:在 SD 3.5-M 与已做过步蒸馏的 Z-Image-Turbo 两个骨干、10 个 evaluator 组成的 20 个 reward-matched 设置中,19 个取得最佳 held-out 分数;相比最强竞争方法最高提升 44.0%。训练成本上,相比 DiffusionNFT 在 SD 3.5-M 上省 40% GPU-hours、在 Z-Image-Turbo 上省 63%(实验用单节点 8×NVIDIA A800-SXM4-80GB)。人类标注偏好中,标注者在 64%、71%、90%、61% 的 prompt 上更喜欢 DiffusionOPSD 而非 base 模型、FlowGRPO、DiffusionNFT、ReFL;胜出原因的构成显示提示词对齐与视觉质量各占大头。鲁棒性 sweep 表明 query noise 从低到中、目标半径 ρ 从 0.08 到 0.40 都稳定在默认水平附近。最耐人寻味的是那个负面发现:受控同 query 实验里,reward 梯度目标的构造增益是 +0.03511、DiffusionNFT 端点是 −0.03551,但一次拟合更新之后,HPSv2.1 的目标序在 62.3% 的 prompt 上发生反转——构造阶段赢得多,不代表落地得多。 Robustness and human preference. Low-to-mid query noise and target radii from $0.08$ to $0.40$ remain near the default, while query noise $0.90$ and branch coefficient $10$ fall to $0.2884$ and $0.2961$. Annotators prefer DiffusionOPSD over the base model, FlowGRPO, DiffusionNFT, and ReFL on $64\%$, $71\%$, $90\%$, and $61\%$ of prompts. 批判点评:这篇最有价值的结论其实是负面的:目标构造增益与单次拟合实现增益之间只有弱相关(62.3% 反转率)。它说明方法的两个部件耦合得比论文正面叙事更松,但论文没有据此给出「目标半径该怎么选」的可操作准则,把一个诊断工具停在了诊断阶段。19/20 的胜率听起来压倒性,可 10 个 evaluator 背后只有少数几类 reward,同一 reward 下多个 evaluator 高度相关,等效独立比较数远小于 20,这个分母是被放大过的。44.0% 是「相对最强对手的最大提升」而不是中位提升,属于挑最好看的那一格报。鲁棒性图自己也暴露了边界——query noise 取 0.90、branch 系数取 10 时 ClipScore 掉到 0.2884 与 0.2961,说明超参窗口并不宽,而实际调参时未必知道自己在窗口的哪个位置。作者共 14 人以上、横跨 8 家单位,正文却以「DiffusionOPSD Team」匿名署名(真实名单只在附录),这类大团队技术报告的工程细节历来难以被外部独立复现。 3. RVM:奖励加权速度匹配替代策略梯度 Scaling Reinforcement Learning for Diffusion Models via Velocity Matching | 佐治亚理工学院、NVIDIA | arXiv:2608.23664 关键词:扩散奖励微调,速度匹配,免轨迹更新,VBench,动态跟踪奖励,NVIDIA 前序问题:奖励微调正在成为把扩散模型对齐到人类偏好与任务目标的主要工具,但现有方法基本是把大语言模型那套策略梯度机制整体继承过来的。问题在于扩散模型不像自回归模型,它对生成样本没有可计算的似然。结果是当前方案只能从随机去噪转移构造轨迹似然,或者用证据下界近似端点似然,两者都引入额外计算与算法复杂度。作者要论证的是一个更激进的判断:这套基于似然的机制对扩散奖励微调根本不是必需的。另外还有个实践层面的坑——标准偏好奖励在视频生成上会偏爱画面干净但几乎静止的输出,等于奖励模型在鼓励模型偷懒。 本文贡献:提出 reward-based velocity matching(RVM),一个直接作用在速度场上的免轨迹更新。流程是:从高斯噪声出发做 16 步 ODE rollout(不用 CFG)得到分组样本,用公开奖励模型加上自研的 dynamic-tracking(DT)运动奖励打分;每个生成样本只加噪一次得到 x_t,其速度目标为 v = ε − x0;然后用奖励加权的速度匹配损失做回归,额外带一个可选的 anchor 项控制相对参考速度场的漂移。方向上它强化高奖励生成对应的速度方向、抑制低奖励方向,不需要沿轨迹反传,也不需要任何似然项。论文进一步指出这是一个通用框架,RAM 与 DiffusionNFT 都可作为特例被恢复。文中还给出了轨迹损失与速度匹配的机制对比:轨迹损失提升的是被采样单步转移的似然,因而朝下一个去噪状态移动,而那个中间状态是随机的、不保证比当前更接近干净端点,目标方向因此含噪。 Overview of RVM. Left: RVM fine-tunes Wan2.1-1.3B with a simple reward-weighted velocity-matching loss. Grouped rollouts are scored using public reward models together with our dynamic-tracking (DT) reward, and each generated sample $\bm{x}^i_0$ is noised once to $\bm{x}^i_t$ and regressed toward its velocity target $\bm{v}^i=\bm{\epsilon}^i-\bm{x}^i_0$, with an optional anchor velocity $\bm{v}_{\mathrm{anc}}$ controlling model drift, avoiding trajectory storage and likelihood estimation. Right: on Wan2.1-1.3B, RVM achieves the best VBench Overall score at a fraction of the training cost of trajectory-based methods. 实验效果:在 Wan2.1-T2V-1.3B 上,RVM 用 525 GPU-h(8×H100,含 rollout、奖励评估、梯度更新三段)完成微调,FlowGRPO 需 1,159 GPU-h(2.2 倍)、DanceGRPO/TaRoS 需 6,171 GPU-h(11.8 倍);成本最低的同时拿到最高的 VBench Overall 84.13,FlowGRPO 为 75.91。引入 DT 奖励后运动幅度大幅改善,而 VBench 整体表现同时上升,说明「动起来」和「好看」并非必须二选一。另一个实用发现是:速度更新一旦简化,具体用哪种损失变体的影响就小于奖励与 anchor 的设计——这把调参重心从损失工程挪到了奖励工程。少步推理测试中,把训练好的 16 步时间网格子采样到 5 步与 4 步、保持同一 timestep schedule,VBench Total 仍然保持稳健。 GPU-hour cost comparison on Wan2.1-T2V-1.3B. Training time is decomposed into rollout, reward evaluation, and gradient update. % Note that despite being the cheapest, RVM attains the highest VBench Overall ($84.13$ vs. $75.91$ for FlowGRPO). 批判点评:提交件里作者块留的还是 ICLR 会议模板的占位符(Cranberry-Lemon University 那一段),真实作者信息在另一份 tex 文件里,说明投稿版本管理相当仓促,这类细节多少反映了工作的成熟度。「统一了 RAM 与 DiffusionNFT」的说法要打折看——特例关系通常依赖特定的权重函数与 anchor 取值,论文没有给出这些约化成立的严格条件表,缺了它这个 claim 更像叙事包装。VBench Overall 84.13 对 75.91 的差距确实不小,但作者自己就指出 VBench 系偏好奖励会偏爱静态高清画面、并因此专门做了 DT 奖励,那么再把 VBench Overall 当作主指标来宣布胜利,逻辑上有循环论证的味道。GPU-h 对比中 RVM 的 rollout 只用 16 步且不开 CFG,而基线是否在同等 rollout 预算与采样配置下测量没有交代清楚,成本优势里有多少来自算法、多少来自采样设置无法分离。主实验集中在 1.3B 规模,14B 级别模型上速度场回归是否仍然稳定、anchor 项该怎么随规模调整,都还是空白。 4. FireRedAudio:理解与生成各走一条连续表征 FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation | 小红书 | arXiv:2608.24168 关键词:音频语言模型,统一理解生成,连续表征解耦,零样本TTS,语音编辑,小红书 前序问题:一个统一的音频模型既要识别和理解语言、副语言(情绪、说话人)与环境信息,又要支持语音合成与编辑。矛盾集中在表征这一层:理解任务偏好紧凑特征,因为长上下文建模吃不下高帧率细节;而语音生成需要可重建的特征,必须保留细粒度声学信息。用一套离散 token 同时服务两端,往往两头都不讨好——压得够紧就重建不回来,留得够细就撑不起一小时长音频的上下文。 本文贡献:FireRedAudio 共享一个 9B 参数的 LLM,但为理解与生成分设两条独立的连续输入表征。待识别或分析的音频走专用 Audio Encoder 加 Adapter;用于生成条件的语音输入走 RedAE 路径——RedAE 本身是个自编码器,把 50Hz 的音频帧压成 25Hz latent,训练时由一个冻结的教师 Audio Encoder 提供高层监督,并通过 iSTFT head 重建波形。LLM 直接输出文本,或者经 Flow Head 去条件一个 flow-matching DiT,产出连续声学 latent 再由 Decoder 还原成波形;DiT 的条件里同时包含历史干净 latent 与当前含噪 latent 以及 LLM 隐状态。经渐进多任务训练后,同一个模型支持 ASR、音频理解(可覆盖长达一小时的录音)、零样本 TTS、Instruct TTS,以及语义级与声学级两类语音编辑。作者称这是首个公开披露的、在单个可训练自回归 LLM 内为理解与生成分别提供连续输入表征的统一音频语言模型,代码已开源。 Overview of FireRedAudio. Decoupled continuous pathways encode inputs for understanding and generation. The shared LLM produces text or conditions a DiT to generate RedAE latents, which are decoded into waveforms. The inset illustrates the DiT conditioning for one audio step. 实验效果:综合评测下,音频理解与多语种 ASR 达到有竞争力或领先的水平;零样本 TTS 在内容准确率与说话人保持两项上都强;Instruct TTS 的指令跟随领先;语义与声学两类语音编辑相比 Ming-UniAudio-Edit 有大幅改善。长音频侧展示了四类能力:结构化组织(把录音解析成带 start/end、说话人、背景音、情绪的时间戳表格,量化的时间定位评测就聚焦这一项,达到秒级时间戳精度)、长文摘要(可按对象聚焦,如「只总结 Guest B」并给出 02:15/14:40/37:05 这类带时间锚点的要点)、时间↔内容双向检索(既能问「12:00 谁在说什么」也能问「定价模型在哪几个时间点被提到」)、以及跨录音证据的全局分析(如「为什么 Guest A 在 24:10 笑」需要串起 03:10 到 24:10 的多个证据节点)。这些结果支撑了一个结论:中等规模模型上,解耦的连续输入表征足以统一音频理解与连续潜空间语音生成。 Four representative long-form audio-understanding capabilities: structured organization, long-form summarization, bidirectional retrieval between time and content, and global analysis over evidence distributed across a recording. Our quantitative temporal-grounding evaluation focuses on structured organization. 批判点评:「首个公开披露」这个 claim 叠了三层限定词——publicly disclosed、within a single trainable autoregressive LLM、separate continuous input representations——本质是在一个足够窄的定义里宣称首创,读者要看清边界再决定这个「首个」值多少。9B LLM 的底座是什么、是否从某个开源模型继续训练,摘要完全没提,而这直接决定了工作量、复现难度与结果的归因。「competitive or leading」是典型的选择性表述,缺少与 Qwen-Audio、Step-Audio、Ming-UniAudio 等同类在主流 benchmark 上的逐项数字,读者无从判断领先幅度。一小时长音频理解的量化评测只覆盖「结构化组织」一项,摘要、双向检索、全局分析三项在图里是能力示意(带具体案例的界面示例)而非量化结果,这三项的真实可靠度目前无法评估。解耦两条表征的代价是推理时要同时维护两套编码器,额外的参数量与显存开销没有交代。语音编辑只对比了 Ming-UniAudio-Edit 一个基线,样本偏少。 5. AffineTok:语义仿射一致把gFID压到1.10 AffineTok: Semantic Affine Consistency for Diffusion-Friendly Visual Tokenizer | 复旦大学、阿里巴巴 Token Hub(Wan 团队) | arXiv:2608.23864 关键词:视觉tokenizer,语义对齐,扩散友好,SAC一致性,gFID,复旦阿里 前序问题:视觉 tokenizer 越来越流行往潜空间注入语义监督,好让下游扩散学得更轻松。但「语义究竟该怎么组织才有利于去噪」这个问题几乎没被认真研究过。现有做法是训一个 projector 直接从含噪 latent 预测语义——作者指出这实际预测的是「干净图语义的平均」,而扩散过程真正做的是先预测后验均值的干净 latent、再从它解码语义,也就是「平均后干净 latent 的语义」。这两者并不等价,把前者当目标去对齐,等于在优化一个错位的量。 本文贡献:论文先把问题形式化,定义语义恢复目标:去噪过程应当从含噪 latent 恢复出干净图的语义内容,好的 tokenizer 应当让这件事更容易。关键结果是一个正交分解——语义恢复误差可以正交拆成「从含噪 latent 直接做最优语义预测的误差」与「上述两种预测之间的误差」。第二项正是被忽略的一致性要求,作者命名为 Semantic Affine Consistency(SAC),并给出 tokenizer 侧的代理指标 M_SAC 用于在不训扩散模型的前提下诊断。方法层面 AffineTok 用两个纯训练期组件促进 SAC:Global Semantic Coordination Token(GSCT)是一个前置的可学习 token,与 patch embedding 一起送进 encoder,用来协调干净 latent 的语义组织、让「语义平均」这个操作仍然有意义,解码前该 token 即被丢弃;Posterior-Mean Semantic Alignment(PMSA)学一个后验均值预测器 G_post,从含噪输入预测后验均值 latent,再用语义投影器监督从中恢复出的语义。语义监督由冻结的 DINO 提供,两个组件推理时都不存在,因此零部署开销。 Overall framework of AffineTok. The input image is processed in parallel by a frozen VFM and a trainable tokenizer. Its encoder jointly maps patch embeddings and a prepended learnable GSCT to a global output and clean patch latents (z_0). After (z_0) is noised into (z_t), the resulting global and noisy patch representations receive semantic supervision; the global output is then discarded, while (z_t) is decoded for reconstruction. Along the PMSA path, (G_post) maps (z_t) to a posterior-mean estimate, and (S_post) maps the estimate to semantics. Only clean patch latents are retained downstream. 实验效果:M_SAC 在所评估的多个 tokenizer 与扩散模型规模上都紧跟生成质量,与 SiT-XL 的 gFID 达到 0.960 的 Pearson 相关,这构成了「用 SAC 指导 tokenizer 训练」的依据。ImageNet 256 上,相比基线在 20 epoch 时 gFID 降低 26%;继续训练后取得新的 SOTA——不用 classifier-free guidance 时 gFID 1.21,用 guidance 时 1.10。针对性语义探针(越低越好)显示:语义轴不一致率上,RecTok 在 θ>30° 为 58.3%,加 GSCT 降到 24.4%(降 58%);θ>35° 从 29.5% 降到 7.8%(降 73%);θ>40° 从 12.2% 降到 2.8%(降 77%)。严重失败率(Top-10 语义检索 miss)上,RecTok 在 t=0.7/0.8/0.9 三档为 5.6%/6.4%/15.1%,GSCT+PMSA 后降至 2.3%/3.1%/6.7%(分别降 59%/52%/56%)。 Targeted semantic probes for GSCT and PMSA (lower is better). Left: Cross-split semantic-axis inconsistency rates for RecTok and +GSCT across three angular thresholds. Right: Top-10 semantic retrieval miss rates for RecTok and +GSCT+PMSA under three severe noise levels. 批判点评:0.960 的 Pearson 相关是在有限数量的 tokenizer 与扩散规模上算出来的,样本点少时相关系数极易虚高,论文需要给出参与拟合的点数与置信区间,否则「M_SAC 可以当选型指标用」这个推论支撑不足。正交分解本身是恒等式变形,它严格说明 SAC 是语义恢复误差的一个必要成分,但不等于「提升 SAC 必然提升生成质量」——两者仍可能同源于第三个变量,论文的因果链是靠相关性搭起来的。gFID 1.10/1.21 是「继续训练」后的结果,基线是否在同等训练预算下评测需要核对,否则 SOTA 里混进了算力优势。语义探针的失败率依赖作者自定的角度阈值 θ,θ 从 30° 挪到 40° 时降幅从 58% 变成 77%,挑阈值的空间不小,读者应关注全曲线而非某一点。GSCT 与 PMSA 只在 ImageNet 256 的类条件生成上验证,能否迁移到文生图与视频 tokenizer 完全未知,而后者才是这条技术线的主战场。 6. KATok:按内容丢token压缩率推到252 Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation | Kakao(韩国) | arXiv:2608.24293 关键词:视频tokenizer,自适应压缩,Gumbel-Softmax,时空冗余,潜在扩散,Kakao 前序问题:潜在扩散之所以能做高保真图像与视频合成,靠的是用 VAE 把数据压到紧凑潜空间来省算力。但常规 VAE 对视频并不合适——它采用固定压缩率,无法适配时空内容复杂度的巨大差异。一段几乎静止的镜头和一段剧烈运动的镜头会被压成同样多的 token:前者纯粹浪费,后者细节不够。固定码率这件事在图像上尚可忍受,到了视频这个冗余度极高、且冗余分布极不均匀的模态上就成了明显的浪费。 本文贡献:KATok 是一个基于 transformer 的 VAE,内含与 latent token 联合学习的自适应 token selector。视频先切成时空 patch 编码成连续 latent token;selector 用 Gumbel-Softmax 松弛为每个 token 预测 keep-or-drop 概率,也就是评估该 token 的内容丰富度,产出一份软 token-drop mask;这份 mask 与 decoder 的注意力共享,保证编解码两侧的 token 选择保持一致;decoder 则通过可学习的 granular query token 去注意保留下来的 latent,重建原始输入。直接把自适应 tokenization 接到扩散模型上会出问题——丢 token 会打乱原有的时空结构,导致生成时内容与位置错配。为此论文提出两种位置预测策略:cascaded generation 与 joint generation(内容与位置联合生成),用来保证空间一致性。 Overall architecture of KATok. A video is divided into spatio-temporal patches and encoded into continuous latent tokens. The adaptive token selector predicts per-token keep probabilities via Gumbel–Softmax relaxation, producing a soft token-drop mask shared with the decoder attention for consistent token selection. The decoder reconstructs the input via learnable query tokens by attending to the masked latent tokens, forming an end-to-end differentiable pipeline for adaptive token selection. 实验效果:在 SOTA 级压缩率下同时保持强重建与生成质量。压缩率随输入尺寸单调增长,这是自适应方案相对固定方案的核心优势:256²×16 帧约 133,384²×16 约 159,480²×16 约 183,512²×16 约 191,一路到 512²×32 帧达到 252;对照之下 ElasticTok 在测到的两个尺寸上都固定在约 102,OmniTokenizer 则是一条 96 的水平线。也就是说输入越大、冗余越多,KATok 的收益就越明显。进一步分析表明这个改善主要来自削减时空冗余、移除低信息量 token,定量与定性结果都支持这一点。消融图显示:朴素模型直接生成稀疏 latent 时会出现内容-位置错位(图中红框标出),而 joint content-position 与 cascaded 生成策略能缓解这个问题并提升整体生成质量。 Token scaling with video size. As spatial and temporal resolution increase, our method achieves progressively higher compression ratios, demonstrating efficient scalability across input sizes. In contrast, OmniTokenizer maintains a fixed compression ratio, and ElasticTok remains nearly flat. (Conventions and compression ratio definition follow Table.) 批判点评:「data-dependent 压缩」的另一面是 token 数变成不定长,这会直接冲击批处理效率、显存预算与推理调度。论文只在「空间错位」这一处正面应对(靠两个生成策略补救),完全没有量化不定长带来的吞吐损失——而这恰恰是工业落地时第一个要问的问题。压缩率 252 对 96 的对比要成立,前提是双方重建质量在同一水位,可论文对质量只用了「strong」这样的定性词,缺少同 PSNR/rFID 下的压缩率对照表。图里另一个可疑点是 ElasticTok——它本身就是弹性 token 方案,却几乎持平在 102,与其设计意图不符,很可能是基线配置未针对这些分辨率调优,这类对比对基线不太公平。keep-or-drop 是二元决策的松弛,对于「部分重要」的 token 没有中间档,直觉上不如按重要度分配比特数来得优雅。评测集是 UCF、Kinetics、Sky 一类经典短视频数据集,长视频与高动态场景没有覆盖,而那才是自适应压缩本该发挥最大价值的地方。 7. Luce:单图出可重光照PBR高斯资产 Luce: Relightable Gaussians for 3D Asset Generation | Apple | arXiv:2608.23943 关键词:图生3D,PBR材质,可重光照,高斯splatting,rectified flow,Apple 前序问题:高保真的图生 3D 需要一个同时刻画几何与外观的 3D 表示。而要支持重打光、并且能接进标准渲染管线,这个表示必须包含 PBR 模态——albedo、metallic-roughness 与表面法线。现实是主流生成式 3D 表示往往只产出「把光照烘死在外观里」的结果:单看渲染图挺漂亮,一旦塞进游戏引擎或影视管线换个环境光就露馅,因为模型从未把材质与光照分离。 本文贡献:Luce 把几何与 PBR 材质统一在一个体素化的多模态高斯云里,为每个模态配专属的高斯基元。流程分两段:表示转换阶段,给定一个 3D PBR 资产先渲染多视角图,再在稀疏体素网格上按模态各拟合一套高斯 splat(albedo、metallic-roughness、normals),得到 PBR Gaussians;一个结构化潜空间 VAE(SLatVAE)把这个表示编码成紧凑可扩散的 latent,并能解码回 PBR Gaussians。生成阶段,一个 rectified-flow transformer 从单张图生成该 latent,条件来自预训练图像编码器的多层特征(DINOv2 的 L6/L12/L18/L24),多层同时取用是为了兼顾语义上下文与细空间细节;先过 Sparse Structure Flow 定结构、再过 SLat Flow 出 latent、最后由 SLat Decoder 解成 PBR 高斯。产物可直接用 GS 渲染器配 IBL 环境贴图着色,也可选走 Mesh Decoder 导出带切向空间法线图的纹理网格。 Overview of Luce. (Top) Representation and SLatVAE. Given a 3D PBR asset, here a Toys4K sample, we render multiview images and fit per-modality Gaussian splats (albedo, metallic-roughness, normals) on a sparse voxel grid. A structured latent VAE (SLatVAE) encodes this representation into a compact, diffusible latent and decodes it back to PBR Gaussians. (Bottom) Generation pipeline. Given a single input image, a sparse-structure flow first predicts the sparse voxel layout. Conditioned on multi-layer DINOv2 features, SLatFlow then generates a PBR Gaussian latent at each active voxel. The structured latent decodes into relightable PBR Gaussians and also serves as input to the mesh decoder, which yields textured meshes with tangent-space normal maps and a complete PBR material set. 实验效果:Toys4K 上取得单图生 3D 的 SOTA,FID 相比最强基线改善 28%。论文另建了一个 AI 生成图像构成的 benchmark,在其上 CLIP 图文对齐分从最佳基线的 0.8299 提升到 0.8519。解码出的 PBR 模态可以在新环境贴图下通过标准 PBR 合成直接着色渲染,不需要抽网格、也不需要 UV 展开——这是相对「先出网格再烘材质」流程的实质简化。重光照验证里,论文把自家 deferred PBR 渲染器在高斯拟合上的输出与用 Blender EEVEE 渲染纹理网格的参考并排对照:同一把战锤在户外日光、草地、暮色、studio 点光、室内、拱廊六种环境贴图下,金属面的高光位置、锤头与手柄的整体色温都随环境同步变化,两条渲染路径的结果高度接近。生成资产还能保住文字、logo、铭文这类细节。 PBR shaded rendering. The decoded PBR modalities (albedo, metallic-roughness, normals) enable shaded rendering under novel environment maps via standard PBR compositing (Eq.), without mesh extraction or UV unwrapping. We compare our deferred PBR renderer on the GS fit against the textured mesh rendered with Blender EEVEE as a reference; the environment maps are listed in Appendix. 批判点评:重光照那组图容易被误读,需要说清楚:它比的是「自家 GS 渲染器 vs Blender EEVEE 渲染同一份纹理网格」,验证的是两条渲染路径自洽、材质分解没跑偏,而不是「重光照质量超越其他生成方法」——论文里没有与基线在重光照维度上的对比。FID 改善 28% 的评测集 Toys4K 是玩具类物体,几何规整、材质单纯,能否外推到复杂场景资产或有透射/次表面散射的材质,证据不足。CLIP 分 0.8519 对 0.8299 只差 0.022,落在 CLIP-score 的噪声量级内,属于弱证据;何况这个 benchmark 由作者自建,构成、规模与筛选标准都需要审视。为每个 PBR 模态各配一套高斯基元意味着基元数量成倍增长,训练与推理开销、体素网格分辨率上限论文摘要没有交代,而这决定了方法的实际可用规模。网格导出被标为 optional,说明主路径产物仍是高斯,要进现有 DCC 管线还差一步转换。作者全部来自 Apple,摘要未提代码或模型是否发布,短期内外部复现的可能性偏低。 8. TransPhy:看两张示例学会物理变换规则 TransPhy: Visual In-Context Learning for Physically Grounded Image Editing | 北京大学、商汤科技研究院、浙江大学 | arXiv:2608.24119 关键词:视觉上下文学习,物理接地编辑,MoE-LoRA,规则归纳,BAGEL,北大商汤 前序问题:视觉示例是指定图像变换的天然接口——很多变换用文字穷举描述极其困难,比如「让这块金属锈到这个程度」或者「让布料在这个受力下这样塌陷」。但现有视觉上下文学习(VICL)方法主要处理外观级的关系迁移,对物理接地的变换支持很有限,而后者的结果取决于材质属性、几何、物体交互与环境条件。给定一对 source-target 示例和一张查询图,物理接地的 VICL 要求模型做三件事:推断出被示范的是什么变换、把这个变换的效果适配到查询图特有的场景上下文、同时保住与规则无关的内容不被改动。 本文贡献:先建数据与评测:PhysVICL-74 含 74 条物理接地变换规则、5,240 对 source-target 图像,组合成近 7.5 万个训练与评测上下文;benchmark 划分把「新实例迁移」(同规则换物体)与「未见规则泛化」分开评,避免用同一个总分掩盖两种截然不同的难度。方法上 TransPhy 把任务分解成物理规则归纳与过渡对齐渲染两步:先预测被示范的规则,并生成一段针对查询图的显式目标状态描述(把隐式的视觉示范转成可检查的中间语言表示);再通过 token 级的混合专家适配合成目标图,专家路由由局部化的过渡线索引导。实现在统一模型 BAGEL 上:理解通路走 Text Encoder 与 ViT Encoder,生成通路走 VAE Encoder,各自经 projector 汇入 MM Attention;Token Level Align 模块用示例对的差分(1-Sim)算出过渡热图,经 Top ρ%、token merging、region refine 得到精炼的过渡证据,以 L_STC 监督对齐 router;MoE-LoRA 的多个专家承担规则渲染,配 router 负载均衡与 token 负载均衡两个约束。 Overview of TransPhy on BAGEL. The understanding and generation pathways encode the exemplar--query context; ViT-derived transition evidence aligns token-level routing, while MoE-LoRA experts render the inferred physical rule. 实验效果:在物理规则遵循度、查询一致性、未见规则泛化三项指标上均优于既有的视觉上下文编辑方法。机制侧的证据来自专家路由可视化:逐层的专家使用热图呈现明显分化(不同 MoE block 偏好不同专家,而非均匀使用),说明路由确实学到了结构而不是退化成平均;把全部 token 硬路由到单个专家时(分别强制走 Expert 0 至 Expert 3),同一张查询图会得到肉眼可辨的不同编辑结果,红框标注处差异最明显——这支持了「不同专家承担了不同的变换成分」这一设计假设,而不是彼此冗余的副本。 Expert routing visualization. Left: layer-wise expert-routing heat map. Right: results obtained by hard-routing all tokens through experts~0--3. 批判点评:74 条规则、5,240 对图像撑起「近 75K 个上下文」,说明上下文是由有限图像对组合放大出来的,这个数字的实际信息量远小于字面,读者不该把它当成 7.5 万个独立样本看。更关键的缺口是:物理接地变换的真值怎么来的——渲染引擎合成、真实拍摄,还是另一个生成模型产出?摘要完全没交代,而这直接决定这个 benchmark 是否真的「物理正确」,如果真值本身来自生成模型,整套评测就退化成模仿另一个模型的偏好。效果全部以定性优势描述(improves adherence / consistency / generalization),没有一个绝对数字,也没有与具体基线的逐项对比表,这在有自建 benchmark 的情况下尤其说不过去。专家路由图分辨率偏低,红框标注的差异需要放大才能辨认,作为核心机制证据偏弱。方法只在 BAGEL 一个统一模型上实现,对底座能力的依赖程度未知。「未见规则泛化」的划分粒度(留出整条规则,还是同族规则的变体)会极大影响难度,摘要没有说明。 9. Game2World:先擦掉HUD再拿游戏视频训世界模型 Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training | Game2World 团队(通讯作者 Dongping Chen,论文未标注机构归属) | arXiv:2608.24680 关键词:世界模型数据,游戏录屏,HUD移除,数据引擎,视频编辑,AAAI2027 前序问题:电子游戏是视频世界模型训练数据的规模化来源——环境多样、交互复杂、野外录屏在互联网上近乎无限。但原始录屏有个结构性缺陷:它把游戏世界和屏幕空间界面纠缠在一起。血条、小地图、任务提示、按键提示、伤害数字这些 HUD 元素会引入游戏特定的偏置和与世界无关的动态,世界模型会把「UI 的变化」当成「世界的变化」学进去,最终产出的既不是干净的画面也不是可信的动力学。 本文贡献:提出 GameUI-Taxonomy 与 G2WEngine,把「游戏 UI 定位与移除」形式化成一套全栈框架。HUD 资产抽取一路是:质量过滤(303 款游戏共 65.72 小时)→ 关键帧采样(采出 1,010 个不同帧)→ 标签起草 → 人工精修(平均每帧 3.69 个 HUD 部件)→ UI 抽取(把裁剪块转成透明资产)。HUD 覆盖层合成一路是:多样性过滤(去掉近似帧)→ 基于语义的构图布局与资产选择 → 时序动画(区分静态与弹出式资产的轨迹)→ alpha 合成与 bbox 追踪,确保合成出来的 UI 在时间上是连贯的。据此构建 Game2World:96K 合成配对视频(带精确重建目标)+ 来自 303 款游戏的 1,079 段野外片段用于真实评测;资产库含 21 个分类下 5,132 个已验证 UI 元素。最后提出 GameCleaner——一个免 mask 的游戏 UI 移除模型,把多模态语义理解与视频编辑能力结合起来,不依赖预先给定的 mask 就能识别并移除多样 HUD,同时保住底层场景内容与时序动态。 Overview of G2WEngine, a scalable data engine that transforms in-the-wild gameplay videos into world-model-ready data through HUD asset extraction, temporally coherent UI synthesis, and downstream support for HUD understanding, removal, and clean gameplay generation. 实验效果:受控 pilot 实验中,用去 UI 录屏训练的世界模型整体 VideoReward 比用带 UI 数据训练的高 6.83%——这是整篇工作的因果论断落点。UI 移除评测上,GameCleaner 在合成视频上平均 AAR 达 95.36,超过最强的时序 mask 基线 57.3%;野外片段上取得最佳 AAR 80.05,背景保持度 99.8。消融给出两条实用曲线:数据规模方面,野外评测下带参考图的表现从 0.2 规模的约 62 分升到全量的约 79.5 分,且曲线尚未收敛,说明继续加数据仍有空间;参考图 drop ratio 方面,野外表现在 20% 附近最好(约 79.8),过高(50%、80%)反而掉到 56、55 附近,而合成集上的表现则对 drop ratio 几乎不敏感(一直在 93~96)——这个合成/野外的分歧本身就是提示。 Ablation study of data scaling and reference drop ratio during training. We find out that larger and more diverse dataset show generalizable result on in-the-wild evaluation and have not converge yet. 批判点评:6.83% 的 VideoReward 提升来自「受控 pilot」,而模型规模、训练配置、评测 prompt 数量摘要一概没交代。这是全文最关键的因果论断,证据却最薄:去掉 HUD 有益在直觉上显然成立,但提升幅度是否稳定、在多大模型上还成立,目前没有答案。「超过最强时序 mask 基线 57.3%」是相对提升,考虑到基线在合成集上的绝对 AAR 只有 60 出头,相对数字把绝对差距放大了不少。野外 AAR 80.05 与合成 95.36 之间那 15 分的落差是重要信号:它说明合成 UI 与真实 UI 之间仍有明显分布差,而合成数据恰恰是训练主力,这个 gap 才是方法的真实上限所在。1,079 段野外片段作为评测集偏小,303 款游戏的品类分布也未公开,UI 风格的长尾覆盖存疑。1,010 帧的人工精修量对应 5,132 个元素尚算合理,但 21 个分类的边界是否清晰、多标注者一致性如何,都没有报告。最后,arXiv comments 里作者直接留邮箱寻求科研合作与资金支持,正文中也缺失机构归属——这是一支早期自筹阶段的团队,工程可复现性需要谨慎预期。 10. LAION-BVD:1000万小时开源视频数据集 LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training | 图宾根大学与图宾根 AI 中心、LAION、于利希超算中心(JSC, FZJ)、Wynd Labs、马普智能系统研究所与 ELLIS Institute Tübingen、慕尼黑工业大学 MCML | arXiv:2608.24845 关键词:开源视频数据集,多模态预训练,CommonCrawl,音频文本,ViCLIP,LAION 前序问题:多模态预训练的视频侧长期缺开放的大规模数据。现有开源视频数据集规模有限(InternVid-10M 量级),真正的大数据集掌握在少数机构手里且不公开,社区因此无法在视频与音频模态上独立验证 scaling 结论——图文模态上 LAION-5B、DataComp-1B 已经把这条路打通了,视频侧却一直缺一个对应的公共基础设施。 本文贡献:LAION-BVD 从 CommonCrawl 中筛出 13 亿条平台特定视频 URL(BVD-URLs),用分布式基础设施实际下载了 8,000 万个视频、总时长 1,000 万小时(BVD-RAW),面向视频、音频、图像三种模态的预训练设计。数据管线用内容感知的场景检测切出片段,并为片段合成生成视频 caption 与音频 caption。派生子集包括:从 240 万视频按 10 秒到 30 分钟过滤并切片得到的 BVD-V-55M(5,500 万片段),再采样出 BVD-V-10M 与 BVD-V-50M;按 2 到 30 秒过滤得到的 BVD-A-1.7M 与 BVD-A-10M 音频片段;以及采样并筛选场景切换帧得到的 BVD-I-300M(3 亿张图像)。最后一条是个有意思的角度——把视频帧当作图文数据的替代来源,因为场景切换帧的视觉分布与常规网页图库明显不同。全量数据集已向研究社区发布。 LAION-BVD data curation pipeline. We source data from CommonCrawl and filter for platform-specific video URLs, resulting in 1.3B high-quality video candidates. Out of these, we successfully downloaded 10M video hours using a distributed infrastructure from which we create the BVD-* subsets. 实验效果:在这些数据上训练的模型在标准 video-text 与 audio-text benchmark 上具备竞争力,且随训练量或模型规模增长持续改善。ViCLIP 上,BVD-V-10M 与 BVD-V-50M 的平均检索约为 56.3 与 56.9、平均分类约为 68.2 与 68.4,两项都高于 DataComp-1B(约 45.0 与 62.6)与 InternVid-10M(约 52.8 与 67.6)。CLAP 音频文本上,BVD-A-10M 的曲线整体位于 Laion-Audio 之上,且随模型规模增长的斜率更陡,从约 42.9 升到约 46.8,而 Laion-Audio 同区间为 42.1 到 44.8。用场景切换帧训练的模型取得了强图文检索表现——这印证了「视频帧可作为图文数据替代源」的判断;但同一组实验也诚实报告了反面:LAION-BVD 的 ImageNet 零样本分类仍弱于网页 alt-text 基线。 LAION-BVD is an open web video dataset at unprecedented scale. It facilitates strong downstream performance for multimodal pretraining. Left: dataset scale in comparison with existing video datasets. Right: average downstream performance of ViCLIP (video-text, tab:exp_results_wise_ft) and scaling-trends of CLAP (audio-text, tab:exp_results_clap_pure) on standard benchmarks. These results demonstrate that LAION-BVD serves as valuable training data across both video and audio modalities. 批判点评:caption 是「synthetically generate」的,也就是模型产出的伪标签。这决定了数据集的语义上限,也会把 captioner 的偏置固化进所有下游模型,而摘要没说用的是哪个 captioner、也没做 caption 质量的人工抽检——对一个定位为公共基础设施的数据集来说,这是最该交代清楚的一项。1,000 万小时是「下载到的原始时长」,真正进入训练的是切片后的子集(如 BVD-V-50M),两个量级不能混着读,标题里的数字带有一定的宣传性质。ImageNet 零样本弱于 alt-text 基线是个诚实且重要的负面结果:它说明视频帧的分布优势偏检索、不利分类,但作者点出后没给成因分析,读者拿不到「什么时候该用这份数据」的判断依据。开源发布的到底是 URL 列表还是视频本体,极大影响长期可用性——CommonCrawl 系数据集普遍存在链接腐烂,几年后的实际复现率会显著下降。版权授权状态与内容安全过滤强度未在摘要交代,这类超大规模网络采集数据集的合规风险不容忽视。评测骨干只有 ViCLIP 与 CLAP 这类相对轻量的判别式模型,这份数据能否直接用于生成式视频预训练(也就是社区最想要的用法)完全没有验证。 趋势观察 扩散后训练同一天冒出两条「去似然化」路线,方向出奇一致 — 今天最值得放在一起读的是 DiffusionOPSD(字节 Seed)和 RVM(NVIDIA + Georgia Tech)。两篇互不引用、机构毫无交集,却在同一个判断上撞车:把大语言模型那套策略梯度机制搬到扩散模型上,是一条走歪了的路。原因很朴素——自回归模型有可解析的样本似然,扩散模型没有。为了凑出一个「似然」,现有方法要么从随机去噪转移拼轨迹似然,要么用 ELBO 近似端点似然,代价是额外计算与算法复杂度,而换来的信号依然只挂在端点上。两篇的解法各走一边:DiffusionOPSD 往「中间监督」走,用 reward 梯度在冻结 behavior policy 提供的 anchor 周围直接构造出有界的正负目标,让每一步的 clean-output 预测都有明确的去处;RVM 往「原生表示」走,干脆不要轨迹、不要似然,直接在速度场上做 reward 加权回归,并顺手把 RAM 与 DiffusionNFT 收成特例。省下来的算力是实打实的:DiffusionOPSD 相比 DiffusionNFT 减 40%~63% GPU-hours,RVM 在 Wan2.1-1.3B 上 525 GPU-h 就跑完,DanceGRPO/TaRoS 要 6,171。更值得留意的是 DiffusionOPSD 那个负面发现——目标构造增益更大,不代表一次拟合后的实现增益更大,HPSv2.1 的目标序在 62.3% 的 prompt 上会反转。这提示扩散 RL 的下一个瓶颈可能不在「怎么定目标」,而在「一步优化能吃进去多少」。 少步蒸馏已经不单独交付了,它和推理工程栈捆成了一个整体 — TurboT2VA 的数字拆解值得逐段看:LTX-2 19B 音视频联合模型,1024×1792、121 帧、单卡 NVIDIA H20 上,40 步教师 318.74 秒。先上 guarded W8A8 加算子融合,拿到 1.37×,降到 233.34 秒;再换成 4 步蒸馏学生,19.18×,降到 12.16 秒;最后叠一层模态感知稀疏注意力(SageSLA,ρ=0.3),再 2.08×,落到 5.83 秒。整体 54.67×。这条链条说明了一件事:单看蒸馏是 19.18×,单看工程栈是 1.37×2.08≈2.85×,但它们乘起来才是那个吓人的数字,任何一环单独宣传都会失真。另一个细节是稀疏化的边界——作者明确保留了跨模态与文本条件的 dense 路径,只对模态内注意力做稀疏。这不是保守,而是承认音画同步这件事经不起近似。反过来看 RVM 那篇也印证了同一件事:它测了从 16 步网格子采样到 5 步、4 步的鲁棒性,说明「少步」已经从加速技巧变成了模型必须自带的属性,而不是发布后再补的一层优化。 视觉 tokenizer 的竞争焦点,从「压得多」挪到了「压得让下游好学」 — AffineTok(复旦 + 阿里 Token Hub)和 KATok(Kakao)走的是同一个方向的两条腿。AffineTok 问的是语义该怎么组织:现有做法训一个 projector 从含噪 latent 直接预测语义,作者指出这预测的是「干净图语义的平均」,而扩散真正需要对齐的是「平均后干净 latent 的语义」——这两个东西不是一回事。他们把语义恢复误差做正交分解,识别出被忽略的一致性要求(Semantic Affine Consistency),并给出 tokenizer 侧代理指标 M_SAC,报告它与 SiT-XL 的 gFID 有 0.960 的 Pearson 相关。KATok 问的是比特该怎么分配:常规 VAE 用固定压缩率,静止镜头和剧烈运动被压成同样多的 token,前者浪费后者不够;它用 Gumbel-Softmax 给每个 token 学一个 keep-or-drop 概率,压缩率从 256²×16 帧的 133 一路涨到 512²×32 帧的 252,而 ElasticTok 固定在 102、OmniTokenizer 固定 96。一个管「语义排布」,一个管「码率分配」,共同点是都不再把 tokenizer 当成一个可以离线调好然后冻住的前置模块,而是当成对下游生成质量负直接责任的一环。AffineTok 的 GSCT 与 PMSA 都只在训练期存在、推理时丢弃,这个设计取向也很能说明问题——愿意为下游多付训练成本,但不肯多付一分部署开销。 世界模型的瓶颈正在从「模型」挪到「数据能不能直接用」 — Game2World 和 LAION-BVD 是今天的数据侧双响。前者盯的是一个很具体的脏活:游戏录屏是世界模型训练数据的规模化来源,但血条、小地图、任务提示这些 HUD 元素把游戏世界和屏幕空间界面纠缠在一起,模型会把 UI 的动态当成世界的动态学进去。G2WEngine 把这件事形式化成全栈流程——从 303 款游戏、65.72 小时录屏里抽出 5,132 个已验证 UI 元素(21 个分类),再把时序一致的 UI 覆盖层合成回干净录屏,造出 96K 配对视频用于训练、1,079 段野外片段用于评测,最后训一个免 mask 的 GameCleaner 擦干净。受控实验里,用去 UI 数据训练的世界模型整体 VideoReward 高 6.83%。后者走的是另一个极端:LAION-BVD 从 CommonCrawl 捞了 13 亿条视频 URL,下载 8,000 万个视频共 1,000 万小时,切片后派生出 BVD-V-55M、BVD-I-300M、BVD-A-10M 等一系列子集,ViCLIP 上 BVD-V-50M 的平均检索约 56.9、平均分类约 68.4,都高过 DataComp-1B 与 InternVid-10M。两篇合起来的信号是:视频生成这条线上,「有没有数据」的问题正在被「数据里有多少是能直接喂的」取代。也要留一句冷水——LAION-BVD 的 caption 是模型合成的伪标签,它的天花板就是那个 captioner 的天花板;而它诚实地报告了 ImageNet 零样本分类仍弱于网页 alt-text 基线,说明视频帧的分布优势偏检索、不利分类。 人工智能炼丹君 整理 | 2026-08-27 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月27日
6 阅读
0 评论
0 点赞
2026-08-22
AIGC 每日速读|2026-08-22|阿里6B小模型编辑分反超20B的Swift-Image
今日 AIGC 论文速览 今日共 10 篇 · 统一图像生成与编辑 3 篇 · 视频生成与世界模型 1 篇 · 4D 人体与数字人 2 篇 · 3D 生成加速 1 篇 · 音频与动作生成 2 篇 · 生成评测 1 篇 重点论文标题列表 Swift-Image(阿里巴巴集团):6B编辑分4.33反超20B模型 Stream4D(UCLA、清华大学):3DGS奖励会奖励画面冻结 4DAnyone(浙江大学 CAD&CG 国家重点实验室、Robbyant、港中文、蚂蚁集团):手机随手拍重建4D人体 WithEveryone(复旦大学、腾讯混元、香港大学):十人合影身份不互串 ear-VAE2(阿里巴巴通义千问团队、Monash University):波形自编码器缺一根频率轴 今日论文速览 1. Swift-Image:6B编辑分4.33反超20B模型 Swift-Image: Exploring the Performance Frontier of Compact Unified Image Generation Models | 阿里巴巴集团 | arXiv:2608.20334 关键词:统一图像生成,图像编辑,单流DiT,多教师蒸馏,少步生成,DiffusionNFT 前序问题:统一图像生成模型(同时做文生图、单图编辑、多图编辑)目前的主流路线是把参数量往上堆,20B 级别已经是常态。但对大多数团队来说,这个规模既训不起也推不动。真正的问题是:在受限的计算预算下,一个相对小的视觉生成器到底能被系统性的训练工程推到什么位置?这里有两重困难。一是三类任务的目标彼此干扰——文生图要的是语义覆盖与美学,编辑要的是身份/布局保持,直接混合训练会互相拖累。二是要做少步推理就得蒸馏,而蒸馏一个已经在多任务上打了折扣的模型,误差会继续累积。所以「小而全」在实践中通常意味着「小而每项都差一点」。 本文贡献:Swift-Image 用 6B 的单流 DiT 打底,架构上把 Qwen3-VL 作为文本/图像理解侧的编码器,VAE embedding 与加噪 VAE embedding 分别经 projector 进入主干;每个 Single-Stream Parallel Block 内部把注意力和 MLP 并行放置,Q/K 各带 RmsNorm 与 RoPE,出口用一个受时间步 t 调制的 Zero-Init Gate 控制残差写入,Scale&Shift 也由 t 驱动。训练侧是渐进式管线:从广覆盖语义起步,逐步提高分辨率、强化视觉质量,最后加入生成-编辑统一监督。后训练是这篇的重头戏,共四段。第一段用任务专属教师(T2I-RL 与 Edit-RL,均为 6B 多步)分别做多步强化学习,提供互补监督;第二段做任务专属 few-step 蒸馏,以 DMD2 为骨架并叠加动态反向模拟、后期偏置停止、解耦噪声匹配、教师锚定对抗损失四个机制,把两个多步专家各自压成 6B few-step 专家;第三段是多教师 on-policy 蒸馏(OPD),让统一学生在自己的策略下同时向 T2I 专家和 Edit 专家学习,从而把两个专家合成一个模型而不是简单加权;第四段用 DiffusionNFT 做 few-step 强化学习,混合 T2I 奖励(对齐、质量)与编辑奖励(身份、布局)做 MixRL 精修。整套设计的核心思路是「先让专家各自强,再在学生策略下合并,最后混合奖励收口」,用流程隔离替代损失加权来缓解目标干扰。 Unified visual backbone for T2I generation and image editing. Semantic conditions from Qwen3-VL and image latents from FLUX.2 AE are jointly processed by parallel single-stream Transformer blocks. 实验效果:参数量-编辑得分的帕累托图给出的对比最直接:Swift-Image-6B-PE 的 Overall Edit Score 为 4.33,3B-PE 为 4.32,而横轴 20B 附近的 FireRed-Image-Edit 是 4.11、Qwen-Image-Edit-2511 是 4.07,9B 的 FLUX.2-klein 为 4.06、4B 版本为 3.89,15.7B 左右的 JoyAI-Image-Edit-Plus 只有 3.72。也就是说 3B/6B 两档都稳定位于图的左上角,用约三分之一到七分之一的参数量取得更高的编辑分。3B 与 6B 几乎打平这一点尤其值得注意——说明在这套后训练管线下,收益主要来自训练策略而非模型容量。 Comparison for parameter and overall edit score with open-source models. The overall edit score is computed as the average across three public editing benchmarks and our benchmarks. 本方法 achieves leading performance with only 6B and 3B parameters. 批判点评:这篇的价值在于它把「小模型能不能靠训练工程赢」这个问题做成了一个可复现的配方,而不是又一次架构宣称。四段式后训练里最有意思的是 OPD:用 on-policy 蒸馏来合并两个任务专家,比传统的多任务损失加权更能规避「学生在教师分布外的行为无人监督」这个老问题,思路是对的。帕累托图也画得诚实,把同期主要开源模型都摆进来了。但几点要保留。第一,Overall Edit Score 是论文自选的综合指标,4.33 与 4.11 的差距落在 5 分制里只有 0.22,缺少置信区间或多次评测的方差,很难判断这是稳定领先还是评测噪声——尤其 3B 的 4.32 与 6B 的 4.33 相差 0.01,几乎不可能是真实差异,反过来也提示这个指标在高分段的分辨力有限。第二,图上只有编辑分一个维度,文生图能力与多图编辑能力没有在同一张图里对照,「统一模型」的另两条腿表现如何需要翻正文。第三,四段后训练每一段都引入了额外的教师模型与奖励模型,总训练成本很可能远超「受限算力预算」的字面印象,论文若不给出与 20B 直接训练的总 FLOPs 对比,「省算力」的结论就只对推理侧成立。第四,DMD2 叠四个机制、DiffusionNFT 再叠 MixRL,组件数量偏多而消融只能覆盖其中一部分,哪几个是真正的关键路径并不清楚,复现者容易在超参上踩坑。 2. Stream4D:3DGS奖励会奖励画面冻结 Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models | UCLA、清华大学 | arXiv:2608.19556 关键词:流式自回归扩散,长视频生成,4D一致性,3DGS奖励,几何漂移,reward hacking 前序问题:流式自回归扩散模型是实时长视频生成的主流路线,但它的训练目标优化的是局部帧预测,而不是一个连贯世界的几何与动力学。后果是长 rollout 会累积几何漂移,最终退化成静止或不自然的运动。近期有一类双向方法试图用 3D Gaussian Splatting 重建构造的奖励来解决这个问题——让模型生成的视频能被 3DGS 稳定重建,间接逼它学会几何一致。作者指出这条路有一个根本性缺陷:单个刚性 3D 重建无法建模动态场景,于是这个 critic 会把真实的物体运动当成重建误差来惩罚,而它的最大化解恰恰是「把视频冻住」。在自回归设定下这个捷径尤其危险,因为每个 chunk 都可能把上一个 chunk 已经衰减的运动继续传播放大。 本文贡献:论文的第一贡献是把这个 reward hacking 模式明确暴露出来,并给出跨场景的可视化证据:在机甲战斗、赛车穿行、水下鱼群三个动态强度差异很大的场景里,逐帧对比 Base、VideoGPA、World-R1 与本方法在 t=0/0.50/1.00 的输出,用 MOVES / FROZEN / KEEPS MOTION 三个标签直接标注运动状态。同时也给了另一组更长时程(t=0s 到 10s,间隔 2.5s)的猫叼鱼跑动对比,可以看到 World-R1 与 VideoGPA 在后半段几乎不再有位移,而本方法保持了跑动姿态的连续变化。方法层面,Stream4D 的思路是把奖励从「静态刚性重建」升级到「4D 一致性」,即在允许场景本身随时间演化的前提下约束几何与动力学的连贯,从而让 critic 不再把合法运动误判为误差,同时保留对几何漂移的惩罚能力。这也让约束能适配自回归的分块推进结构,而不是只能在双向全序列设定下使用。 Static-3D rewards freeze the scene; a 4D reward keeps it moving. Five uniformly-spaced frames from a $10.3$,s LongLive rollout (“a cat running away with a fish while people chase behind”). The distilled base contains large motion but the cat and fish drift across frames; the static-3DGS rewards World-R1 and VideoGPA reduce the scene to a more rigid, low-motion configuration. Stream4D keeps the cat running with clear forward motion while preserving a coherent subject and scene. 实验效果:定性结果是这篇最有力的部分:三场景 × 三时刻的对比图里,两个基于 3DGS 奖励的基线(VideoGPA、World-R1)在全部三个场景都被判定为 FROZEN,而 Stream4D 在全部场景保持 KEEPS MOTION;十秒时长的长程对比进一步显示基线在 t=5s 之后主体位移基本停滞。原始 Base 模型虽然 MOVES,但可以看到画面结构在后续帧出现明显漂移与内容突变。也就是说 Base 有运动但没有几何一致性,3DGS 奖励方法有一致性但杀掉了运动,Stream4D 试图同时拿住两者。 批判点评:这篇最值得记的不是方法而是那张 FROZEN 标签图。它把「用静态重建指标当动态生成 critic」这个设计错误做成了可以一眼看懂的反例,而这类奖励设计在过去一年的世界模型工作里被大量采用——凡是拿单次 3D 重建误差当监督的方案,都应该拿这张图自查一遍。与昨天 DynaForcing 揭示的 DMD 反向 KL 偏好静止放在一起看,可以归纳出一条更一般的规律:动态生成任务里任何不显式建模时间演化的奖励,静止都是合法捷径。但要清醒几点。第一,论文给出的主要证据是定性对比图,MOVES/FROZEN/KEEPS MOTION 这三个标签是作者判定的,缺少像 Dynamic Degree、光流幅度这类可量化的运动指标表格来支撑「基线冻结、我们不冻结」的强论断,读者只能相信示例的代表性。第二,示例场景都是运动幅度较大的(战斗、赛车、鱼群),恰恰是最容易凸显冻结问题的设定;在运动本就轻微的场景里,4D 一致性约束是否会反过来引入不必要的抖动,论文没有讨论。第三,作者团队没有公开 comment 信息(无会议接收、无项目页),代码与权重是否开放不明,而这类涉及奖励设计细节的工作可复现性高度依赖实现细节。第四,「4D 一致性」如何具体参数化、计算开销相对 3DGS 奖励增加多少,是评估这套方案能否落到实际训练里的关键,需要读正文确认。 3. 4DAnyone:手机随手拍重建4D人体 4DAnyone: Create Anyone in 4D from a Casual Monocular Video | 浙江大学 CAD&CG 国家重点实验室、Robbyant、港中文、蚂蚁集团 | arXiv:2608.20335 关键词:4D人体重建,单目视频,多视角一致性,视频扩散,4DGS,有界注意力上下文 前序问题:从一段没有标定的手机随手拍视频里重建出可自由换视角的 4D 人体,最自然的路径是先用相机可控的视频扩散模型合成多个新视角视频,再把它们抬到 4D Gaussian Splatting。但这条路在实践中卡住了:现有的相机可控视频扩散能生成看起来合理的新视角视频,一旦把目标视角数量扩到 4DGS 重建所需要的数十个,一致性就崩了。作者把这个失效精确归因为「有界注意力上下文」问题——当目标视角数超过单次 DiT 前向能容纳的容量,就必须把视角分成若干组分批生成,而这一分组同时打开了两个互相耦合的瓶颈:参考上下文侧,如果让每一组都以此前生成的全部视角为条件,代价随视角数呈 O(N²) 增长;不这么做,则组与组之间失去共同参照,跨组一致性无从保证。 本文贡献:4DAnyone 的框架从源视频出发,一路 VAE 编码得到 Src Tokens,另一路过 HMR 模型估计人体,把目标视角的骨架渲染图经可训练的 Skel Enc 编码为 Skeleton Tokens。参考上下文侧维护一组 Ref Tokens 并配合 Pack Ref Context 机制压缩,与 Noise Tokens、Skeleton Tokens 一起拼接后送入 Diffusion Transformer。主干里每个 block 包含三种注意力,其中 Video Attention 与 Cross Attention 保持冻结、只有 Multiview Attention 可训练,作用维度上前者按 v(f h w) d 组织、后者按 f(v h w) d 组织——也就是说把「同一视角内跨帧」和「同一帧内跨视角」两种一致性显式分离到不同的注意力上,训练成本集中在真正需要新增的多视角一致性上。生成的多组目标视角视频最后统一用来训练 4DGS,得到可自由视角渲染的动态人体。 Overview of 本方法. Given a source video, we extract a 3D skeleton sequence via GVHMR and render skeleton videos and skeleton depths for $v$ target viewpoints. The 3D-aware skeleton encoder injects skeleton tokens into the DiT via residual addition. The source video is encoded by the pretrained VAE and concatenated with noisy target latents along the view dimension. The DiT denoises the target latents via Target Context Routing and the decoded target videos are packed into the Reference Context Packing module as references for subsequent generation rounds. The final 4DGS model is reconstructed from the generated multi-view videos using FreeTimeGS. 实验效果:论文的定位是生成「重建级别」的多视角一致视频,即质量足以直接支撑 4DGS 优化,而不只是看起来合理。配套的定性素材覆盖较广:既有工作室级的舞蹈/戏服序列,也有十余段真实户外手机视频(wild_demo)以及游戏角色多视角样本(supp_mvgamehuman),另有专门的挑战性案例与失败案例分析。核心主张是在目标视角数扩展到数十个的规模下,跨组一致性不再随视角数增加而崩溃,从而让单目随手拍视频到 4D 可渲染人体这条链路真正跑通。 Qualitative comparison with baselines. We show target-view generated videos (Gen.) and their corresponding 4DGS renderings (Rend.) across diverse human-centric videos. 本方法 produces geometrically accurate and visually detailed results across viewpoints, while the baselines suffer from inaccurate camera control (our fine-tuned ReCamMaster$^\dagger$) or geometric distortions (MV-Performer). See the project page for dynamic results. 批判点评:把问题归因到「有界注意力上下文」是这篇最扎实的部分——它不满足于说「一致性不够好」,而是指出根因是单次前向容量限制迫使分组,并把分组带来的两个瓶颈(参考上下文 O(N²)、跨组失参照)明确拆开,这种诊断方式让后续工作有明确的攻击面。架构上冻结 Video/Cross Attention、只训 Multiview Attention 也是有品位的选择:既复用了预训练视频先验,又把新增能力限定在真正缺失的维度上。但要注意几点。第一,整条链路对 HMR 人体估计的精度有硬依赖——骨架 token 是多视角生成的主要几何条件,一旦源视频里出现严重自遮挡或快速运动导致 HMR 失准,误差会直接传导到所有目标视角,论文提供了 failure case 但未量化这一依赖的敏感度。第二,casual monocular video(随手拍)的边界很模糊:wild_demo 里的素材多为竖屏高分辨率、主体居中、光照良好的短片段,与真正随手拍摄的抖动、遮挡、逆光场景差距不小。第三,工程成本不透明——生成数十个视角视频再优化 4DGS,单个对象的端到端耗时与显存需求是决定这套方案能否实用的关键,摘要与图里都没有交代。第四,方法涉及浙大、Robbyant、港中文、蚂蚁四方合作且投向 ACM 会议格式,属工程完成度较高的工作,但也意味着复现需要相当规模的算力与数据。 4. WithEveryone:十人合影身份不互串 WithEveryone: Unified Planning and Identity Grounding for Group Image Generation | 复旦大学、腾讯混元、香港大学 | arXiv:2608.20336 关键词:身份保持生成,群体图像,布局规划,身份接地,ID Loss,统一骨干 前序问题:身份保持的图像生成在单人场景已经比较成熟,但一旦场景里要出现多个指定的人,可靠性就迅速下降。难点不止是「每张脸都要像」,还要把每个参考身份绑定到画面里一个特定的人和特定的位置——模型很容易把 A 的脸特征渗到 B 身上,或者干脆漏掉某个参考。更棘手的是训练侧:常用的身份损失需要在若干张噪声预测出来的人脸之间建立对应关系,而在多人场景下这个对应本身就是模糊的,监督信号会被错配稀释,等于用一个不可靠的目标去训一个本就困难的任务。 本文贡献:WithEveryone 支持最多十个参考身份,把整件事组织成统一骨干上的一条多阶段序列。流程按阶段推进:先读用户提示与参考图,Reason 阶段做语义理解并输出 NTP 损失;接着 ID_IN 把身份 embedding 注入,Rep Forcing 阶段用 pred_emb 与 id_emb 之间的表征强制损失确保身份信息被真正吸收(而非被主干忽略);然后再一次 Reason 与 Layout Reason 阶段,以离散坐标 token(形如 <|x_130|><|y_288|>)的形式预测结构化的身份-布局规划;Layout Render 把这份规划渲染成一张可视条件图;最后 Denoise 阶段在 Flow Matching 与 ID Loss 联合监督下出图。关键设计是 Layout-Grounded ID Loss——利用标注的人脸区域,直接在正确的空间位置上监督对应的身份,绕开了多张噪声人脸之间建立对应关系这一模糊环节。整套方案把身份注入、布局规划、渲染约束串成一条链,每个环节都有明确的监督形态。 Overview of 本方法. The model loads selected reference identities as ID tokens, predicts structured Layout CoT, renders a visual layout condition, and predicts identity representations before generating the target group image. Modality-switch tokens that mark the boundaries between autoregressive reasoning and flow-based image generation are used in the sequence but omitted from the figure. 实验效果:方法支持最多十个参考身份的群体图像生成,配套的画廊素材(gallery1-3、quality)展示了多身份合影场景下的生成结果与质量对比,另有单步预测可视化与数据构造流程说明。消融部分覆盖较全:人脸尺寸的绝对/相对影响、高分辨率下的身份与规划表现、ID Loss 的布局项与权重设置、Rep Forcing 的余弦相似度与损失曲线,都各有独立分析图,说明作者对每个组件的作用边界做了系统检验。 Qualitative comparison with proprietary models. mark faces that reproduce a person already generated elsewhere in the image, that are not recognizable as their bound reference, and that appear transplanted without adapting to the pose, lighting, or viewpoint of the scene. These author annotations are illustrative; their quantitative counterparts are the duplicate rate, Sim(Ref), and Copy-Paste. 批判点评:这篇抓住的痛点很实在:多人身份保持的真正瓶颈不在人脸编码器强不强,而在「参考-人物-位置」这个三元绑定关系没有被显式监督。把布局作为中间产物先规划出来、再用人脸区域标注把 ID Loss 接地到具体位置,是对症的解法,比在损失里加更多身份约束更有希望。用离散坐标 token 让统一骨干直接输出布局规划,也避免了外挂一个布局模型带来的接口割裂。但几点需要保留判断。第一,整条链路依赖人脸区域标注来提供 Layout-Grounded ID Loss 的监督,这类标注在训练数据规模化时成本不低,且标注质量直接决定接地的准确性,论文的数据构造流程需要仔细看清楚这一步是人工还是自动、错误率多少。第二,「最多十个身份」是个上限声明而非能力曲线,实际效果在 2 人、5 人、10 人时大概率显著不同,摘要没有给出随身份数变化的量化衰减,而这恰恰是读者最关心的。第三,Rep Forcing 引入了额外的表征对齐损失,其权重与 ID Loss、NTP 损失、Flow Matching 损失之间的平衡是四项损失的调参问题,消融给了曲线但整体的调参难度可能被低估。第四,项目页与代码标注为「will be released」,当前无法验证,多阶段序列的实现细节(尤其坐标 token 的词表设计)对复现影响很大。 5. ear-VAE2:波形自编码器缺一根频率轴 Fourier is Frontier: Frequency-Aware Autoencoding for High-Fidelity Music Reconstruction | 阿里巴巴通义千问团队、Monash University | arXiv:2608.19843 关键词:音乐重建,复数STFT,音频自编码器,相位一致性,立体声,频段分工 前序问题:潜空间音乐生成模型的底座是连续潜表示的音频自编码器,而这些自编码器在高压缩率下普遍暴露三个失效:高频丢失、相位不连贯、立体声声像塌陷。以往这三个问题往往被分别当作独立缺陷来打补丁。作者提出一个结构性的共同根因:波形自编码器没有显式的频率轴,因此根本不存在一个可以做「按频段定向修正」的抓手——你想单独修高频或单独修相位,在波形域里没有对应的操作面。这个视角把三个看似不同的症状收敛到同一个表示选择问题上。 本文贡献:作者先在等预算条件下比较了五种表示,结论是复数 STFT 在全频带与高频谱距离上都最低,且能在每个频点上直接访问幅度与相位——也就是提供了那根缺失的频率轴。据此提出 ear-VAE2:立体声复谱经 Spec Encoder(Conv2d 与 Spec-Act 交替)压到 25 Hz 潜表示,Spec Decoder 还原出缺 Nyquist 的复谱,再由 Duplex-Aware Refiner 补齐为全频带复谱,最后 iSTFT 回到波形。两个核心部件各司其职:Spec-SnakeBeta 是频率相关的周期激活,对高/中/低频学习不同形状的非线性响应;Duplex-Aware Refiner 以 ConvNeXt-1D 为骨架,把输入复谱 X = M·e^{jφ} 按频段分工修正——高频(>4 kHz)只加幅度修正 δM,中频(1.5–4 kHz)同时加 δM 与相位修正 δφ,低频(<1.5 kHz)只加 δφ,并额外预测 Nyquist bin,整体带 bypass 残差。这个分工直接对应三个失效模式的物理成因:高频主要是幅度衰减,低频人耳对相位更敏感,中频两者都重要。 Architecture of 本方法. Stereo audio is transformed via STFT into a complex spectrogram; a Spec Encoder compresses it to a 25,Hz continuous latent and a Spec Decoder reconstructs a coarse complex spectrogram; the highest-frequency (Nyquist) STFT bin is removed to facilitate frequency downsampling. The subsequently applies band-specific complex corrections and restores the Nyquist bin to produce the full-bin spectrogram, which the iSTFT resynthesizes into a waveform. 实验效果:五种等预算表示的对比给出了方法选择的量化依据:复数 STFT 在全频带与高频谱距离两项上均为最低。系统层面的验证素材覆盖了各个组件的作用:输入表示的六面板频谱对比、潜空间频率探针、声学截止频率示例、STFT 漂移与波形对比、Spec-SnakeBeta 的二维响应可视化、refiner 前后对比,以及梯度范数稳定性与幅度损失的 A/B 消融曲线。训练在单节点 8 卡 A100 上完成,各阶段之间重置优化器状态。 Latent temporal-frequency probe for one track (Track 1004034; temporal split at 0.5). Rows (top to bottom): ground-truth audio; full reconstruction; low-temporal-frequency latent half decoded; high-temporal-frequency latent half decoded. Columns (left to right): 本方法, LeVo~2, SAME-L, and Stable Audio Open. For 本方法, the rapidly varying (high) latent half decodes to audio with a lower spectral centroid, matching Table. 批判点评:这篇的论证结构很干净:先指出三个症状共享一个结构性根因(没有频率轴),再用等预算的表示对比证明复数 STFT 是那根轴,最后按频段的物理特性设计分工修正。按频段拆分修正目标——高频补幅度、低频补相位、中频兼顾——是有听觉心理学依据的设计,不是拍脑袋的分段。作者来自通义千问团队,音乐生成底座的工程需求是真实的,方法的实用动机可信。但要注意几点。第一,摘要与配图里没有给出与主流音频自编码器(如 DAC、Encodec、Stable Audio VAE)在同一压缩率下的完整客观指标表格,「最低谱距离」只是五种表示之间的内部比较,跨方法的对照需要翻正文确认。第二,频段分工的三个边界(1.5 kHz、4 kHz)是硬编码的超参,不同音乐类型(电子、古典、人声)的能量分布差异很大,这套固定切分是否需要按内容自适应,论文未讨论。第三,25 Hz 潜帧率是个相当激进的压缩设定,在这个帧率下瞬态(鼓点、拨弦起振)的保真度是最容易出问题的地方,而给出的证据多为稳态频谱对比,缺少瞬态专项分析。第四,评估以客观谱距离为主,音乐重建的最终裁判是听觉,主观 MUSHRA 类测试的规模与结论需要核实。 6. VGI-Bench:27任务测视频模型会不会推理 VGI-BENCH: Probing Visual Intelligence in Video Generation Models | UIUC、清华大学、滑铁卢大学、MIT、UBC、Vector Institute、微软研究院 | arXiv:2608.19583 关键词:视频生成评测,视觉推理,零样本,任务分类体系,Seedance,MiniMax-H3 前序问题:已经有研究提示视频生成模型可能通过生成帧展现某种零样本视觉推理能力,但要可靠地评测这件事很难,原因有三。第一,输入必须与当前视频模型的视觉先验对齐,否则模型失败的原因是看不懂输入而不是不会推理。第二,评测必须要求一个有效的演化过程,而不是只看最终状态是否合理——否则模型可以靠猜一个看似正确的结果画面来蒙分。第三,任务难度需要标定在「有挑战但部分可行」的区间,太难则所有模型一起零分、太易则区分不出差异。这三条约束下的评测设计,比单纯堆任务数量困难得多。 本文贡献:VGI-Bench 包含 27 个任务、810 个实例,按「任务领域 × 技能标签」的两级分类体系组织,从而支持对视觉推理能力做细粒度拆解而非给一个总分。技能维度覆盖七项:规划(Planning)、空间(Spatial)、时序(Temporal)、属性接地(Attribute Grounding)、物理(Physics)、可供性(Affordance)、拓扑(Topology)。任务形态包括迷宫路径(线型迷宫、方格迷宫)等结构化推理场景,并配有专门的标注界面来保证判定一致。评测覆盖当前主要的商业与开源视频模型:Seedance-2.0、Kling-v3.0、MiniMax-H3、Gen-4.5、Sora-2、Wan2.7、Veo-3.1、Wan2.2 与 HY-1.5,商业模型走 API、开源模型本地在 H20 上跑,并给出了访问与算力预算说明。 Per-model performance across the skill tags. 实验效果:七维技能雷达图给出了清晰的能力画像:Affordance 是所有模型表现最好的维度,多数模型都能接近外圈;Topology 上 MiniMax-H3 反而领先 Seedance-2.0 与 Kling-v3.0;而 Spatial、Temporal、Attribute Grounding 三个维度整体收缩明显,多数模型落在 30 分以内的内圈。Seedance-2.0 与 Kling-v3.0 构成第一梯队且在 Planning 与 Physics 上拉开身位,Wan2.2 与 HY-1.5 作为较早的开源版本明显位于内圈。这幅图的信息量在于它显示当前视频模型的「视觉智能」是高度不均衡的——物体可供性这类偏静态语义的能力已经不错,而涉及多步空间/时序推演的维度仍是普遍短板。 Performance comparison in oracle prompting and in varying input visual styles. 批判点评:这份评测最有用的产出是那张雷达图,它把「视频模型会不会推理」这个含糊的问题拆成七个可分别观察的维度,并且直接暴露了能力结构的不均衡:Affordance 普遍高、Spatial/Temporal 普遍低。这个结构性结论比任何单一排行榜分数都更有指导意义——它告诉后续工作该往哪个维度投入。三条设计约束(对齐视觉先验、要求有效演化过程、难度标定在部分可行区间)也说明作者对评测方法学有认真思考,不是简单堆任务。但要保留几点。第一,810 个实例分摊到 27 个任务,平均每任务只有 30 例,而生成模型的输出方差很大,单任务 30 例的统计功效偏弱,雷达图上相近的两条线(如 Gen-4.5 与 Sora-2)差异是否显著难以判断。第二,视频生成模型的评测天然依赖判定器,迷宫这类任务尚可自动判定,但物理合理性、可供性这类维度的判定标准与判定者一致性论文需要交代清楚,否则维度间分数不可直接比较。第三,作者机构跨十家单位、参与者众多,评测规模与工程量可观,但也意味着不同任务的标注标准可能存在异质性。第四,商业模型走 API 意味着版本会持续变动,这份榜单的时效性有限,需要配套的持续更新机制才能长期有参考价值。 7. TextRefine:海报改字要避开商品主体 TextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters | 快手科技、中国科学院大学人工智能学院 | arXiv:2608.19637 关键词:文字编辑,商品海报,字形渲染,空间放置,奖励优化,罕见汉字 前序问题:商品海报里的文字编辑(插入新文字或替换已有文字)看着像通用图像编辑的子集,实际上有三个通用模型都做不好的具体要求:文字内容必须准确(不能漏字或写错,中文尤其困难)、放置位置必须合理(不能压在商品主体或已有内容上)、字形必须结构正确且与画面视觉一致(不能糊、不能变形、不能字重突变)。当前指令式编辑模型在这个场景下的失效是复合的:经常漏掉或错误渲染目标文字,把文字放到显著商品上,产出结构扭曲或视觉突兀的字形。三种失效原因不同,用一个笼统的编辑目标很难同时治。 本文贡献:TextRefine 是任务对齐的后训练框架,把监督微调与针对具体操作的奖励优化结合起来,分别对准上述三类失效。数据构造是这篇的重头,两条线并行。文字插入线:网络图像 → EasyOCR 检测文字 → Qwen-Image-Edit 移除文字 → 配对过滤与文字恢复(Qwen3VL-8B)→ 文字属性推断(相对位置、颜色效果、字体描述)→ 构造简单模板提示与描述式提示两种监督形态,形成训练对。文字替换线专门针对罕见汉字:同样先检测再移除,然后做罕见字替换与文字颜色推断(Qwen3VL-8B),从 50 种中文字体库中选字体,把目标文字渲染出来,再生成两种替换指令表述(「把『变』换成『蠹』」与「把『耐高温不变形』改成『耐高温不蠹形』」)。方法侧对插入操作采用基于文字跨度的奖励设计,配合有效跨度过滤与字形奖励信号;RL 阶段还做了难度感知的数据选择,优先挑信息量高的样本。训练用混合精度、全局 batch 8、学习率 1e-5,约 20 epoch,在 48 张 A800 上完成。 Overview of the data construction pipeline for text insertion and text replacement in OpenTextEdit. 实验效果:配套的验证素材覆盖了三类失效各自的改善情况:定性对比图、失败模式分析、SFT 训练样例,以及三组文字添加奖励曲线(FireRed、Qwen、TextRefine 各自一组)与两组文字替换对比(Qwen-FireRed 替换、TextRefine 替换),可以横向看到奖励优化在不同底座上的效果差异。评测样例图与有效跨度过滤、字形奖励信号的可视化则分别说明评测口径与奖励构造的合理性。 Comparison of binary OCR correctness and the proposed graded glyph signal. Whereas a binary reward retains only the final correctness decision, the target-glyph CTC posterior preserves continuous recognition evidence and provides a more informative signal for optimizing glyph fidelity. 批判点评:这是一篇工业味道很浓的论文,来自快手,解决的是电商海报本地化改字这个有明确商业价值的问题。它最扎实的地方是数据构造:用「检测→移除→恢复→属性推断→提示构造」这条流水线,从无标注网络图像里自动造出高质量训练对,而且专门为罕见汉字设计了字体渲染分支——中文文字编辑的长尾字形问题在英文为主的研究里几乎没人管,这个补位是实在的。把奖励按操作类型分开设计(插入用文字跨度奖励,字形另设信号)也比一个笼统的编辑奖励更对症。但几点需要注意。第一,整条数据流水线深度依赖 Qwen-Image-Edit 做文字移除、Qwen3VL-8B 做恢复与属性推断,这意味着训练数据的质量上限被这两个外部模型锁定,而且模型的失效模式可能被继承——如果 Qwen-Image-Edit 在某类背景上移除文字会留下痕迹,这些痕迹会作为「干净背景」进入训练集。第二,摘要与配图没有给出定量的文字准确率/位置合理率/字形质量三项指标表,改善程度只能从定性图判断。第三,48 张 A800 训 20 epoch 的成本对多数团队不现实,而论文没有交代更小规模下方法是否仍有效。第四,场景高度特化在商品海报,字体库限定 50 种中文字体,迁移到其他版式(如长图文、视频字幕)需要重新造数据,通用性有限。 8. Block3D:形状token切块自回归去噪 Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion | 浙江大学 ZipLab、西安交大、UC Berkeley、武汉大学、Monash、University of Adelaide | arXiv:2608.19567 关键词:文生3D,块状扩散,形状token,自回归,几何保真,生成加速 前序问题:文生 3D 已经推进得很快,但「高几何保真 + 低推理成本」这个组合仍然难拿。现有方法分两派,各有结构性缺陷。一派把离散形状 token 自回归解码出来,问题是严格串行、且一旦某个 token 错了就没有修正机会。另一派用扩散或流匹配迭代精修一个全局 3D 表示,问题是每一步都要处理完整表示,想要更高质量就得付更多步数,成本随质量线性甚至更快地涨上去。两派的共同困境是:生成粒度要么太细(逐 token 串行)要么太粗(全表示反复迭代),都没有落在效率与质量的合适折中点上。 本文贡献:Block3D 的做法是重新选择生成粒度:把离散形状 token 序列切成若干连续的块,块之间按自回归顺序生成、块内部联合去噪。这样既保留了自回归带来的顺序条件性(后面的块能看到前面已定的几何),又在块内获得了扩散的并行修正能力(一个块里的 token 可以互相纠错,不再是一锤定音)。相比逐 token 自回归,串行步数从 token 数降到块数;相比全表示扩散,每步只需处理一个块而不是整个表示,单步成本大幅下降。作者还给出了注意力可见性的可视化来说明块内/块间的信息流组织方式。 Block3D overview. Text and optional bounding-box conditions guide left-to-right block generation. Completed blocks form a frozen causal prefix, while M2T and T2T edit only the active block before the frozen decoder maps the completed codes to a mesh. 实验效果:端到端生成时间在 100 条 TRELLIS-500K 提示上测量,硬件为单张 A100 80GB,对照方法包括 ShapeLLM-Omni 与 TRELLIS 系列。生成质量方面给出了较丰富的定性素材:人形雕像、维纳斯像、王座人物、戒指、棋子、卡通角色、双头狮鹫、穹甲龟等多类几何,每个都配有原始文字描述并展示多视角结果,可以看出对复杂结构描述(「三颗八边形宝石对称镶嵌的戒指」「两个头、两条脖子、两条后腿、两条前腿和两条长尾的双头狮鹫」)有较好的服从度。另有场景级的复合结果(栅栏围合的院落)与大批量资产网格展示(40+ 个独立生成资产),说明方法在批量资产生成场景下的可用性。 Additional Block3D text-to-shape results. Each group contains multiple viewpoints of a single generated mesh, with its complete text prompt shown directly below. 批判点评:块状生成这个思路本身很自然——它就是在「逐 token 串行」和「全表示并行」这两个极端之间插入一个可调的中间点,用块大小当旋钮同时控制串行深度和单步成本。从工程角度这是个稳妥的改进,也容易与现有的形状 token 化方案组合。定性结果里对复杂组合描述(多部件、对称约束、计数约束如「两个头两条尾」)的服从度看起来不错,这类计数与对称约束恰恰是纯自回归容易翻车的地方,块内联合去噪的纠错能力在这里应该确实有帮助。但要保留几点。第一,块大小是核心超参,它直接决定效率-质量权衡的位置,论文若不给出块大小扫描曲线,读者无法判断报告的结果是在一个精心挑选的甜点上还是普遍成立。第二,效率对比表只给了端到端生成时间,缺少显存占用与质量指标的同表对照——单看时间快了但质量掉了多少,需要交叉验证。第三,块间自回归意味着误差仍会沿块序列累积,只是粒度变粗了,长序列(高分辨率形状)下这个累积是否可控,论文未专门检验。第四,作者机构跨六家单位,实验在单张 A100 上完成,规模适中;与工业级 3D 生成系统(如商业 3D 资产工具)的差距如何,缺少对照。 9. EfficientSync:口型编辑别再重绘整张下半脸 EfficientSync: Real-Time Lip Synchronization via Deformation-Based Reference Texture Mixing | 华南理工大学、罗切斯特大学 | arXiv:2608.18832 关键词:唇形同步,实时推理,参考纹理混合,形变对齐,口内细节,数字人 前序问题:音频驱动的唇形同步任务是把说话视频的嘴部区域改成匹配驱动音频,同时保持头部姿态、身份和背景不变。这在定义上是一个局部编辑任务,但主流做法却是用重型的 GAN 或扩散解码器把整个下半脸重建出来。代价有两层:一是延迟高,难以实时;二是更要紧的,重建式解码器会「幻觉」出口内细节——牙齿、唇纹这些高频结构被生成器凭先验编出来,而不是保留原视频里真实存在的纹理,结果是身份感和真实感都受损。作者的判断是,身份保持的瓶颈并不在参考帧数量不够,而在缺一个能把参考帧里已有的真实纹理忠实搬运过来的机制。 本文贡献:EfficientSync 由三个部件组成。STAR 采样(图中标注为 STAR Sampling)在拓扑特征空间 F_topo 里为当前目标选取合适的参考帧——驱动音频经 F_a 得到 e_a、源图像经 E_s 得到 e_s 与特征 F_s,参考图像经 F_r 编码后由注意力引导的 Warp 做形变对齐得到 F_r。动态纹理混合器(Dynamic Texture Mixer)把参考纹理 e_w 与 e_a、e_s 一起过自注意力,再在通道维度上学习一组打分曲线 R_1..R_N,据此对通道做加权混合,得到融合特征 F_mix——这一步是「混合真实纹理」而非「生成纹理」的关键。STAM 策略处理背景与遮罩的训练-推理差异:训练时用邻近帧配自适应遮罩,推理时用源帧配自适应遮罩,背景经 F_bg 与 Conv/Warp 分支处理后与 F_mix 相加,最后由 Spade 出图。整体是形变+混合的路线,绕开了重解码器。 The framework or our EfficientSync. (a) STAR Sampling first selects, from the source video, a reference pool that is both sharp and topologically diverse, supplying high-quality material for deformation at no inference cost. (b) The Dynamic Texture Mixer then aggregates the spatially aligned references into a high-fidelity mouth feature through a context-aware, channel-wise selection mechanism. (c) The Spatio-Temporal Shifted Adaptive Masking strategy finally composites the synthesized mouth back into the source frame, blending it seamlessly with the preserved background. 实验效果:效率对比在单张 A100 上进行,给出 FPS 等指标的完整表格,与主流唇形同步方法横向对照,主张达到实时。质量侧配有与 SOTA 的定性对比(vssota)、路由策略对比(comparison_routing)、动态纹理混合器的动机说明(dtm_motivation)与用户研究结果。核心主张是:在保持实时性的同时,口内细节来自真实参考纹理而非生成幻觉,因此在身份保真与真实感上优于重建式方法。这篇为期刊格式(含作者简介),实验组织相对完整。 Qualitative comparisons with state-of-the-art works under the cross-audio setting. EfficientSync preserves sharp, identity-consistent intra-oral textures, whereas competing methods either blur the mouth region or hallucinate teeth that deviate from the source identity. 批判点评:这篇的问题重述很有价值:把「口型同步身份不像」从「参考信息不足」重新归因为「缺少纹理搬运机制」,进而否掉了「重建整个下半脸」这条主流路径。用形变对齐加通道级纹理混合来替代生成式解码,在物理上更合理——真实牙齿纹理本来就在参考帧里,没必要让网络重新编一遍,这也顺带解释了为什么它能同时改善速度和真实感(不生成 = 不需要大解码器 = 更快)。三个部件(选帧、混合、训推一致)分别对准三个不同环节,设计不冗余。但几点要注意。第一,形变+混合路线的天花板受参考帧覆盖度限制:如果驱动音频要求的口型在所有参考帧里都没出现过(比如源视频从未张大嘴、或缺少特定音素口型),没有真实纹理可搬,这时方法要么退化要么产生不自然过渡,论文需要交代这个边界。第二,STAR 采样依赖拓扑特征空间的构造质量,这个空间怎么学、对新身份是否需要重新适配,是实用性的关键。第三,效率表是在 A100 上测的,「实时」在消费级显卡或移动端是否成立不明。第四,作者标注为 under review 的期刊投稿,方法组件较多(STAR/DTM/STAM 三件套加 Spade 解码),消融是否足以厘清各自贡献需要看正文;另外文中出现的 NVIDIA A100 仅为实验硬件,与机构归属无关。 10. DrumMotion:打鼓动作要精确到鼓面落点 Generalized Audio-Driven Synthesis of Precise Drummer Motion | Disney Research Studios、特拉维夫大学、ETH Zürich(SCA 2026 最佳论文) | arXiv:2608.19055 关键词:音频驱动动作生成,扩散模型,双目标损失,击打精度,SCA 2026 最佳论文,迪士尼 前序问题:音乐驱动的角色动画在娱乐与互动教育里有明确应用,但打鼓这个具体任务格外难:它要求高加速度的爆发式动作与极高的时空精度同时成立——鼓槌必须在正确的时刻落在正确的鼓面位置上,早几十毫秒或偏几厘米都会立刻显得假。现有方法多依赖动作匹配(motion matching)或 MIDI 输入,前者泛化到真实世界的多样音频很差,后者要求结构化输入而非原始音频。还有一个更基础的缺口:这个领域缺少能区分「精确打鼓」与「大致在动但不准」的标准化评测指标,导致方法之间无法有效比较。 本文贡献:系统分三段。数据获取段:动作捕捉采集鼓手动作,同时录 MIDI;数据增强用随机鼓组合成音频、再叠加随机音频滤波,从一份 MIDI 派生出多条音频(Audio 1..m),从而让模型见过大量音色与录音条件,这是「泛化到真实世界音频」的关键设计。动作合成段:音频先提取可解释音频特征(explainable audio features),与输入噪声 x_T 一起送入 Transformer Decoder 做扩散去噪,预测动作 x̂_0;姿态表示显式拆成 x = {r_body, r_sticks, p_sticks},即身体旋转、鼓槌旋转与鼓槌位置。核心是双目标损失 L(x, x̂) = L_body(r, r̂) + L_sticks(p_sticks, p̂_sticks),把「身体动作自然」与「鼓槌落点精确」两个诉求解耦到不同的监督项上——身体走旋转空间保自然,鼓槌单独走位置空间提精度。评测段提出两个新指标:Impact Point Deviation 衡量空间精度(鼓面落点偏差),Percussive Alignment Score 衡量时序对齐。长段落动作合成在推理时用滑动窗口拼接。训练用 Adam、学习率 3e-4、batch 128、6000 epoch,在单张 RTX 3090 上约 48 小时。 Overview. We augment the audio in our dataset resulting in motion sequences aligned with multiple audio variations to ensure generalization. Raw audio is then processed into explainable features to condition a diffusion-based Transformer Decoder. We employ a hybrid pose representation, using joint rotations for the body and Cartesian positions for drumsticks. The model is trained via a dual-objective loss to balance natural body dynamics with high-precision stick impacts. Finally, performance is evaluated using Impact Point Deviations and Percussive Alignment Scores to assess spatial and temporal fidelity. 实验效果:两个新指标给出的量化结果可以直接对照:Percussive Alignment Score 的小提琴图显示 GT 的平均 DAS 为 0.91,本方法 0.82,而仅旋转版本 0.69、两个消融档位分别为 0.59 与 0.80;数据增强的消融同样清楚——非增强版平均 DAS 0.70,增强版 0.84。也就是说双目标损失里的鼓槌位置项把 0.69 提到 0.82(向 GT 的 0.91 靠近),而随机鼓组+随机滤波的音频增强单独贡献了 0.70→0.84。另有击打点聚类影响分析、MIDI 对照、增益 0 vs -10dB 的鲁棒性测试、速度-加速度-MIDI 时序对照与用户研究。这篇获得第 25 届 ACM SIGGRAPH / Eurographics 计算机动画研讨会(SCA 2026)最佳论文奖。 Our model achieves temporal alignment comparable to ground-truth data. PAS distributions as violin plots for GT (leftmost, black), noisy GT (second and fourth, red), rotations-only model (middle, purple), and our model (rightmost, orange), when applied to our test dataset. Each sample is one-second long. Noisy GT is obtained by adding Gaussian noise with standard deviation $\sigma$=50 ms and $\sigma=25$ ms to every motion onset time. When noise is added to the data, PAS decreases, indicating that the metric successfully discriminates audio-motion alignment quality. 批判点评:这是今天最「小而完整」的一篇:问题定义清晰(高加速度 + 高时空精度的内在张力)、方法设计对症(双目标损失把自然性与精度解耦)、评测缺口自己补上(两个新指标)、消融给出了每个设计的独立贡献(位置项 0.69→0.82、音频增强 0.70→0.84)。用随机鼓组和随机滤波从一份 MIDI 派生多条音频这个增强设计尤其巧妙——它精准针对「泛化到真实录音」这个痛点,且成本极低。迪士尼研究院加 SCA 最佳论文的组合也说明工程完成度经得起图形学社区检验。要注意的是适用范围。第一,任务高度特化于打鼓,双目标损失的「身体走旋转、末端走位置」这个拆法虽然可以推广到其他需要末端精度的动作(弹奏、击剑、乒乓),但论文只验证了打鼓一种。第二,方法仍达不到 GT 水平(0.82 vs 0.91),这个差距在专业观众眼里是否可察觉,用户研究需要看具体设计。第三,训练依赖动捕数据加同步 MIDI,这类配对数据的采集成本很高,换一个乐器就要重新采集,数据门槛限制了推广速度。第四,48 小时单卡 3090 的训练成本很友好,但 6000 epoch 也提示数据量不大,泛化性主要靠音频增强撑起来,视觉侧(不同体型、不同鼓组布局)的泛化未见专门检验;文中提到的 RTX 3090 仅为实验硬件。 趋势观察 奖励函数写错了,模型就学会「什么都不做」 — 今天有两篇论文从完全不同的方向撞到了同一堵墙:当你用一个静态的重建指标去当动态生成的 critic,模型的最优策略往往是让画面停下来。Stream4D 把这件事说得最透——用 3D Gaussian Splatting 的重建误差当奖励,本意是逼视频模型学会几何一致,但单个刚性 3D 重建根本描述不了动态场景,于是真实的物体运动会被记成重建误差,而让整段视频冻结反倒能把这个 critic 刷满分。论文的对比图把三个场景摊开摆着:Base 模型 MOVES,VideoGPA 和 World-R1 两个用 3DGS 奖励训出来的方法双双标着 FROZEN,只有加了动态几何约束的版本 KEEPS MOTION。这个失效模式在自回归流式生成里尤其致命,因为每个 chunk 都会把上一个 chunk 的静止倾向继续放大。往回看昨天 DynaForcing 报告的「DMD 蒸馏后数字人变木头人」,会发现两者本质同源:一个是反向 KL 偏好低运动模式,一个是刚性重建 critic 惩罚真实运动,路径不同但都指向同一件事——凡是拿静态度量当动态目标的奖励设计,静止都是一个数学上合法的捷径。这也解释了为什么评测里必须单列动态幅度指标:只看画质分,两种崩塌都完全不可见。 小模型开始靠训练工程而不是参数量抢位置 — Swift-Image 的定位很直接:不比谁的参数多,比在受限算力预算下能把一个小生成器推到什么位置。它的 6B 单流 DiT 在统一编辑得分上拿到 4.33,而 20B 的 FireRed-Image-Edit 是 4.11、Qwen-Image-Edit-2511 是 4.07;更极端的是 3B 版本也有 4.32,几乎和 6B 打平。真正撑起这个结果的不是架构创新,而是一条堆到四层的后训练管线:任务专属教师做多步 RL、few-step 蒸馏、多教师 on-policy 蒸馏把 T2I 和编辑两个专家合成一个学生、最后再用 DiffusionNFT 做混合奖励精修。Block3D 走的是另一条省算力的路——把离散形状 token 序列切成块,块间自回归、块内联合去噪,避开了全表示反复迭代的开销。两篇放一起看,信号是清楚的:在开源生成模型这一层,参数规模的边际收益正在快速衰减,而蒸馏链路设计、专家合并策略、生成粒度切分这些「工程」变量的杠杆反而变大了。对算力有限的团队,这比追着堆参数更现实。 生成模型正在被拆开当几何编码器和信号处理器用 — 今天有几篇论文的共同动作是:不把生成模型当采样器,而是当一个特征提取或信号修正的组件。4DAnyone 把问题诊断为「有界注意力上下文」——当目标视角数超过单次 DiT 前向的容量,就必须分组,而分组会同时暴露参考上下文 O(N²) 增长和跨组不一致两个瓶颈;它的解法不是换模型,而是重新组织注意力的上下文结构,让视频扩散模型能稳定吐出数十个重建级一致视角,再抬到 4DGS。ear-VAE2 的思路更彻底:把音乐自编码器的失效(高频丢失、相位不连贯、立体声塌陷)归因到「波形自编码器根本没有显式频率轴」这个结构性缺陷,于是直接换到复数 STFT 表示,并按频段分工修正——高频只补幅度、中频补幅度和相位、低频只补相位。EfficientSync 则拒绝用重解码器重建整个下半脸,认为身份保持的瓶颈不是参考帧不够,而是缺一个把参考帧里已有真实纹理搬过来的机制。三篇的共性是把生成模型内部结构与任务的物理/几何先验对齐,而不是简单增大模型或加数据。 人工智能炼丹君 整理 | 2026-08-22 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月22日
21 阅读
0 评论
0 点赞
2026-08-07
AIGC 每日速读|2026-08-07|Meta实测视觉懒惰生成数据只留5%反而更强
今日 AIGC 论文速览 今日共 10 篇 · 统一多模态预训练与Tokenizer 2 篇 · 统一音视频生成 3 篇 · 生成后训练与奖励对齐 3 篇 · 自回归与长视频生成 2 篇 重点论文标题列表 MM-Pretraining Physics(Meta FAIR·Reality Labs·牛津大学):生成数据只留5%反而更强 Vorch-Omni(Vorch Team):一个模型吃下30种音视频配置 Vorch-Streamer(Vorch Team·同济大学·哈工大深圳·上海交大):27.12FPS边说边生成数字人 Vorch-Director(Vorch Team·浙江大学):22个镜头分钟级不掉线 KVAE(Kandinsky Lab):音图视三件套PSNR多涨1dB 今日论文速览 1. MM-Pretraining Physics:生成数据只留5%反而更强 Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes | Meta FAIR·Reality Labs·牛津大学 | arXiv:2608.05000 关键词:统一多模态预训练,视觉懒惰,MoE,数据配方,Meta FAIR 前序问题:统一多模态预训练已经成为共识路线,但语言、视觉理解、视觉生成三种能力在联合训练时到底怎么互相传递知识、什么时候协同什么时候打架、视觉数据该在训练的哪一刻加入,业界基本靠经验和直觉,公开的对照实验很少。 本文贡献:用严格的单变量控制实验系统拆解统一预训练,给出四条结论:一是知识流动高度不对称,语言是万能助推器、视觉理解是生成的强先验,而生成几乎不反哺前两者;二是数据复杂度决定模态是协同还是竞争,共享注意力与归一化、拆开前馈层的架构最有利于协同,且换视觉 tokenizer 结论不变;三是必须早期统一、同步联训,晚接视觉会触发作者命名的「视觉懒惰」;四是把这些结论合成非对称数据配方 L70/U25/G5(语言 70%、理解 25%、生成 5%)。 实验效果:在 13.5B MoE(256 专家、每 token 激活 16 个、其中 2 个模态专属,激活参数 1.5B)上用 2T token 做单变量对照:非对称配方相比均衡配方 L50/U25/G25,语言准确率 54.31% 对 52.86%,视觉理解均值 43.08 对 41.42,GenEval 从 0.467 升到 0.482、DPG 从 0.676 升到 0.689——生成 token 少了五倍,文图对齐反而更好,5 万张图的 FID 5.234 与均衡配方的 5.131 基本持平。视觉懒惰有四路机械证据:语言预热从 0B 拉到 800B token 后,视觉 FFN 的训练态与推理态激活幅度、图像包裹 token 的嵌入范数、推理时落在图像 token 上的注意力占比全线下滑。 批判点评:这类「控制变量做到底」的实证研究比又一个新架构更稀缺,尤其「生成数据只给 5%、生成指标反而更好」直接冲击了「想让模型会画就多喂图」的直觉,而视觉懒惰给「强 LLM 接视觉后仍然看图犯低级错误」提供了可测量的解释。局限也明显:结论建立在 Meta 自有数据与 RAE 编码器体系上,2T token 的对照跑一次成本极高,外部团队几乎无法复现;L70/U25/G5 是在这套设定下搜出来的,换数据分布未必照搬;GenEval 0.482 本身离商用文生图还有距离,说明配方优化的是预训练起点而非最终生成力。 2. Vorch-Omni:一个模型吃下30种音视频配置 Vorch-Omni: Multi-Task Orchestration of Sight and Sound | Vorch Team | arXiv:2608.05803 关键词:统一音视频生成,任意条件到任意输出,LTX-2.3,流匹配DiT,多任务 前序问题:文生视频、参考图生成、视频续写、指令编辑、视频配音这些能力今天大多各自训一个模型。一旦把目标视频、源视频、参考图、参考音频塞进同一条序列,模型就分不清哪段该生成、哪段要原样保留、哪段只提供身份或风格;加上音频既可能是条件又可能是输出,任务空间会成倍膨胀。 本文贡献:把所有任务统一成「任意条件到任意输出」的一次条件去噪:每个任务由视频目标、视频条件、音频目标、音频条件四个集合描述,token 级条件掩码决定谁保持干净、谁被去噪,任务标识区分目标/源/主体参考/音频参考/编辑条件,位置类型再区分「与目标共享连续时间轴」(如续写)和「独立参考网格」。视觉条件走两条互补通路——视觉语言模型读采样帧加文本指令给语义,视频 VAE 把完整条件编码成干净 latent 保结构。底座是单个 LTX-2.3 音视频流匹配 DiT(48 层,视频流 32 头×128 维、音频流 32 头×64 维),新任务只改配置不改结构。 实验效果:同一套权重覆盖 10 类以上任务、30 多种条件—输出组合,包括文生视频、文生音视频、图像与参考驱动生成、时间续写、音频驱动生成、视频转换以及单模态和跨模态编辑。人评部分组织 527 组样本、11361 条维度级判断与 Wan 2.7 盲测:81.4% 的判断认为两者相当,Good 与 Bad 各占 7.7% 和 8.0%,总体净胜率 -1.9%;但在最考验统一能力的维度上净胜率为正——音频指令遵循 +7.1%、参考一致性 +6.6%、音画同步 +5.9%、音频质量 +3.3%。 批判点评:把任务差异全部下沉到「token 角色 + 位置类型」的配置层、而不是每个任务加一个分支,是目前统一音视频模型里比较干净的一种抽象,作者也没有粉饰总体净胜率是负的这一点。但代价同样清楚:底座是别人的 LTX-2.3,全参数微调 5 万步,单卡 batch 只有 1;总体 -1.9% 意味着「统一」眼下换来的是特定维度的优势而非全面超越;作者自己也承认长时程一致性、精细局部编辑和多语言多说话人语音仍未解决。Vorch Team 未公开所属机构,权重与代码也没给出时间表。 3. Vorch-Streamer:27.12FPS边说边生成数字人 Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming | Vorch Team·同济大学·哈工大深圳·上海交大 | arXiv:2608.05663 关键词:实时流式生成,数字人,Self Forcing,DMD蒸馏,语音规划token 前序问题:实时数字人要求边生成边播放,模型只能看历史不能看未来。把预训练的双向音视频扩散模型改成因果流式有两个坎:一是自回归复用自己生成的块会累积曝光偏差,几十秒后身份漂移、画面糊掉;二是给定一整段要说的话,因果生成器在只有局部上下文时并不知道当前这一块该说到哪一句。 本文贡献:在 22B 的 LTX2.3 音视频底座上做三阶段后训练。先用同一个底座合成 8 万条 12–21 秒的数字人音视频语料,保证监督信号与初始化同源;再以样本级混合 Teacher Forcing 与 Diffusion Forcing 训出 20 步因果短流式模型;最后做长时程 Self Forcing,让因果学生在完整 12–21 秒时域上自我 rollout,冻结的原双向模型作为 real-score 教师做 DMD 蒸馏,把双向模型的画质迁移到因果长轨迹上,同时把去噪压到 4 步。语音进度用外部语言模型预测 25 Hz 的离散「说话规划 token」——与 LTX 音频 latent 同频率,因此每个因果块都能拿到属于自己那一秒的语音内容。 实验效果:768×512、24 FPS 设定下,单张 H200 上端到端 DiT 吞吐 27.12 FPS,是评测中唯一越过 24 FPS 实时播放线的原生 T2AV 方法,且不需要外部音频或参考首帧。约两分钟的连续 rollout 在 0/30/60/90 秒采样帧上仍保持身份与场景一致,音唇同步 Sync-C/Sync-D、词错率、VBench2 身份与人体结构指标均有竞争力。推理用 3+1 因果窗口(三个常驻前缀块加最近一块)。训练侧第二阶段 64 张 H200 跑 6000 步,第三阶段 32 张 H200 跑 1000 步。 批判点评:「实时」这次是有明确定义的:24 FPS 播放线、单卡、四步去噪、有界上下文,比笼统说加速可信得多,25 Hz 说话规划 token 也确实解决了因果生成器不知道该说哪句的具体问题。但 27.12 FPS 建立在 H200 和 768×512 这个不算高的分辨率上,换消费级显卡或上 1080p 结论就不成立;训练语料是底座自己合成的 8 万条,风格和多样性都受限于教师,真人视频上的泛化没有验证;两分钟的 rollout 也还不是「无限长」。 4. Vorch-Director:22个镜头分钟级不掉线 Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification | Vorch Team·浙江大学 | arXiv:2608.05776 关键词:长视频续写,曝光偏差,噪声感知残差,多镜头故事,ST-Bench 前序问题:分钟级音视频靠自回归续写实现:把长视频切段,第 t 段以前面已生成的画面和声音为条件。但训练时喂的是干净的真值历史,推理时喂的是模型自己带着漂移、模糊和音画错位的输出,误差一段段滚雪球,最终身份跑偏、画面变平、声画不同步。已有做法把预测残差当作合成噪声注入历史来缩小这个落差,但都用一个与噪声水平无关的固定强度。 本文贡献:作者观察到残差修正是否有效,关键取决于残差是在流匹配的哪个噪声水平上产生的。于是把每条残差连同它产生时的噪声水平 σ 一起存下来,训练某个 σ 步时只采样同一噪声区间的残差并缩放到该区间,让注入的错误和去噪过程真正对齐;这样既保留了 teacher forcing 的训练效率,又造出接近推理分布的历史。配套设计包括始终不加噪的干净锚定窗口(clean sink),以及区分历史视频、参考图像、目标视频的任务嵌入,支持多镜头、多主体、参考引导的长时音视频生成。 实验效果:在 30 个用例、每例约 10 个镜头的多镜头故事基准 ST-Bench 上,用统一评测器重跑全部方法(不混用已发表数字),四项跨镜头一致性指标全面领先,ViCLIP 达 0.7887 而最强基线只有 0.5900,两项长程指标 ARC 与 Reappear 同样领先;对比对象包括 StoryDiffusion+Wan、StoryMem、HoloCine、Memento。另在 200 例的 UnityShots 上跑了 T2V 与 R2V 两种设定,并自建带同步语音、音乐和音效的长音视频基准,每例连续 22 个镜头达到分钟级,配套提出质量漂移和锚定相对一致性两个长程退化指标。 批判点评:「残差要按噪声水平配对注入」是个很具体也很容易被忽略的细节,作者还老老实实用同一评测器重跑所有基线,避免了各家用各自设定报数字的常见问题,新增的长程漂移指标也补上了平均分掩盖退化的缺口。但基线的画质与文本一致性其实并不输,领先主要集中在跨镜头一致性这一类指标上;ViCLIP 0.7887 对 0.5900 的巨大差距有多少来自方法本身、多少来自 LTX-2 底座与基线不同,论文没有拆开;自建基准由自己定义、自己评测,说服力要等第三方复现。 5. KVAE:音图视三件套PSNR多涨1dB KVAE: Family of Tokenizers for Multimodal Generative Models | Kandinsky Lab | arXiv:2608.05798 关键词:视觉tokenizer,VAE,音频编解码,因果压缩,开源 前序问题:潜空间扩散的天花板一半压在 tokenizer 上:压缩率、通道数、因果性直接决定生成模型的学习速度和最终画质。但开源社区里 tokenizer 的训练细节、选型方法和设计取舍几乎都藏在大模型报告的角落,后来者只能反复踩坑。 本文贡献:一次性放出覆盖三种模态的 KVAE 全家桶并开源:KVAE-Audio 是 48 kHz 全带宽连续音频 tokenizer,latent 帧率 50 Hz、64 通道;KVAE-3D 是两个因果视频 tokenizer,压缩率分别为 4×16×16(64 通道)和 4×8×8(16 通道);KVAE-2D 是空间 8 倍压缩、32 通道的图像模型。视频侧刻意做成无注意力的纯 Conv3D 结构,配合缓存机制可以处理任意长序列,归一化用空间 RMSNorm 以便推理时调整分段大小,上下采样把时间和空间操作拆成先后两步。编码器解码器故意不对称:4×8×8 的解码器约为编码器的 1.3 倍,4×16×16 直接做到 5.3 倍,把容量押在需要生成能力的解码侧。 实验效果:在 MCL-JCV 720p 重建评测上,同压缩率分组内平均比 Wan-2.1(PSNR 34.3)、Wan-2.2(34.2)和 HunyuanVideo 高出 1 dB 以上 PSNR,LPIPS 损失可以忽略。生成侧用统一的 2B CrossDiT(Qwen-2.5VL 文本编码器、流匹配损失、同一批数亿图文数据和超参)只换 tokenizer 做对照:KVAE-4×16×16 与指标完全一致,相比 Wan-2.2 让出一点视觉观感换来更好的提示词遵循,对 HunyuanVideo-1.5 则在全部类别上被更多人选中;有意思的是 KVAE-4×8×8 出现客观指标与人评打架的情况——PSNR 不占优,盲测却名列前茅。整体对标 Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio、MMAudio,代码已在 GitHub 公开。 批判点评:肯把训练细节、选型方法和消融一起交出来的 tokenizer 报告非常少,这份等于给中小团队省掉一轮昂贵的试错,「客观指标与人评打架」的坦白也比一味报 PSNR 有价值。但要注意重建指标只在 MCL-JCV 一个数据集上测,生成对照又只用 2B 模型和数亿量级图文数据,能否外推到十亿级视频数据和更大生成骨干是未知数;1 dB PSNR 的领先在下游生成里究竟折算成多少可感知收益,论文自己的人评已经说明关系并不线性。 6. Latent Reward Register:寄存器读奖励省33倍GPU时 Latent Reward Registers for Diffusion Preference Alignment | 快手可灵Kling Team·中科大 | arXiv:2608.03929 关键词:偏好对齐,latent奖励模型,寄存器token,on-policy蒸馏,可灵 前序问题:扩散模型对齐人类偏好,通常只在最终生成图上算一个稀疏的终点奖励,几十步去噪要共享这一个分数,时序信用分配极其困难。想改成稠密奖励,又绕不开把中间 latent 解码回像素空间的高昂代价。 本文贡献:提出 Latent Reward Register:在冻结的 DiT 输入序列前面挂一串可学习、无位置的寄存器 token(实验用 K=32),让它们从中间带噪 latent 里直接读出终点偏好。关键在于这是一条独立读出通路,不改动生成器的隐藏状态和速度场,因此拿到的是贯穿整个去噪过程、可微分的稠密奖励。基于它给出两种用法:训练侧的 RG-OPD 沿 on-policy 轨迹蒸馏奖励引导的更新,绕开标准策略梯度里昂贵的完整 rollout;推理侧的 RGS 用量级匹配的奖励梯度直接引导采样轨迹,一个参数都不用改。 实验效果:在 ImageReward、HPDv2、HPDv3、GenAI-Bench 合计 54170 对样本上,把 latent 前向加噪到高噪声区 u=0.8 打分,寄存器在所有 latent 奖励模型中成对偏好准确率最高。训练侧 SD3-Medium 上 RG-OPD 的 HPSv3 达 11.57,高于 AlignProp 的 11.20、ReFL 的 10.84 和 Flow-GRPO 的 10.26,MUSIQ 74.9、CLIP-IQA 0.726 同时领先,GPU 时最多省到原来的三十三分之一;FLUX.1-dev 上 HPSv3 12.38 同样第一。推理侧 RGS 在免训练方法里刷新 SOTA,SD3-Medium 上 HPSv3 10.70 对 DNO 的 8.85、Demon 的 9.09,且 MUSIQ 与 CLIP-IQA 一并提升而非以画质换分数。代码与权重已开源。 批判点评:「不动生成器、只挂一串寄存器 token 去读奖励」是个很轻的接口设计,33 倍 GPU 时的差距对预算有限的团队几乎是能不能做在线对齐的分水岭,而且训练和免训练两条路复用同一套读出器。需要警惕的是奖励是从生成器自己的特征里读出来的,两者共享盲区时容易一起自我强化,论文报的 MUSIQ 与 CLIP-IQA 都是无参考指标,扛不扛得住长时间优化下的奖励攻击没有给出曲线;实验也集中在 SD3-Medium 和 FLUX.1-dev 两个文生图骨干,视频扩散上还是空白。 7. SURE:让奖励先说自己有多不确定 Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training | 中国电信TeleAI·上海交大 | arXiv:2608.06125 关键词:latent奖励,不确定度,奖励攻击,扩散后训练,TeleAI 前序问题:latent 奖励模型能在不解码回像素的前提下监督扩散模型,效率很高,但它们只吐一个标量分数。生成器无从判断这次反馈到底可不可信,一旦在模型本就没把握的样本上照单全收,优化方向就会跑偏,进而演变成奖励攻击。 本文贡献:让奖励模型同时输出「打多少分」和「这个分有多不确定」。SURE-LRM 为每个带噪 latent 预测一个高斯效用:均值是奖励分数,方差是预测的不确定度,且完全从成对偏好中学出来,不需要额外人工标注。SURE-REFL 再把这份不确定度用起来——在选定的去噪转移点上查询冻结的 SURE-LRM,把 detach 后的方差换算成同一转移点内样本之间的可信度权重,每个加权奖励只沿本地转移回传。整条链路留在 latent 空间,既不需要像素解码,也不需要展开完整去噪图。 实验效果:偏好预测上跨三个骨干的均值从 DiNa-LRM 的 70.51 提升到 72.14,FLUX.1-dev 上单点最大提升 2.30。不确定度确实有信息量:排错的样本残差方差平均高 24.26%,用方差识别排序错误的 AUROC 为 0.6941,只保留方差最低的一半样本可把成对准确率从 79.40% 抬到 90.10%。视频侧 VisionRewardDB 72.31%、T2V Ranking 71.70%,均为最好。图像后训练在三个生成器、九个骨干—指标组合里拿下八项第一;视频用 Wan2.1-480P-T2V-14B 后训练,VBench 质量、语义、总分均为评测中最高。作者还给出对照曲线:DiNa-LRM-REFL 的优化奖励持续上升而独立的 HPSv3 已经开始下跌(典型奖励攻击),SURE-REFL 两条曲线则能同步更久。 批判点评:把「奖励可不可信」显式建模出来,比事后加正则更对症,方差—错误率的诊断也做得实在。但不确定度是无监督学出来的,AUROC 0.6941 说明它只是弱信号,离可靠的置信度校准还有距离;作者自己也承认「保留低方差一半准确率涨到 90.10%」这组样本训练时见过,属于分布内诊断而非留出校准。更根本的是,可信度只在同一转移点内做相对比较,如果整个时间步的奖励模型集体偏了,加权也救不回来。 8. LC-GRPO:动态度从12.5救回45.8 LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction | 普林斯顿大学·加州大学圣地亚哥分校 | arXiv:2608.05600 关键词:Flow-GRPO,Langevin修正,训练推理错配,奖励攻击,强化学习 前序问题:流匹配模型推理时解确定性 ODE,而在线强化学习需要随机 rollout 来探索,于是现有 GRPO 训练时把 ODE 换成 SDE。连续时间下两者边缘分布相同,但有限步离散化后差别很大:探索噪声一大,SDE rollout 就发糊,拿这些糊掉的样本算奖励去训练,和最终 ODE 采样器生成的东西对不上号。 本文贡献:每一步 rollout 先走一步与推理对齐的 ODE Euler,再补一步针对该时刻边缘分布的随机 Langevin 修正。修正需要的 score 直接从流速度里换算出来,不用额外训练 score 模型;修正后的转移仍是各向同性高斯,似然可解析,能直接喂给策略优化。理论上作者证明:在合适条件下一步 Langevin 修正能降低不完美 ODE Euler 步的 Wasserstein 误差;在随机性水平匹配时,该转移比反向 SDE 的标准 Euler–Maruyama 离散更准确。 实验效果:SD3.5-Medium 上文字渲染 OCR 奖励做到 0.960,高于 Flow-GRPO 的 0.914 和 CPS 的 0.935,且 ImageReward 1.00、CLIP 0.291 等旁路质量指标不掉;人类偏好对齐 HPS-v2.1 达 0.393 对 0.381。FLUX.1-Dev 上 HPS-v2.1 0.384、PickScore 23.28 均第一。最刺眼的是视频:HunyuanVideo 用 VideoAlign 视觉质量做奖励,DanceGRPO 把 VBench 动态程度从原模型的 52.8 压到 12.5(画面几乎不动来骗高分),LC-GRPO 保住 45.8,同时 VideoAlign 视觉质量从 -0.205 提到 0.063、VBench 总分 79.10。计算上并不占便宜:Langevin 每步两次前向,作者让基线跑同样和两倍的 rollout 步数取更好结果。 批判点评:指出「训练用 SDE、推理用 ODE」这个人人默认却没人细究的错配,还给了 Wasserstein 误差的理论支撑,而不是纯经验 trick,视频那组动态程度 12.5 对 45.8 更是把奖励攻击拍在明面上——很多 GRPO 的涨分其实是靠画面变静态换来的。要留意每步两次前向的开销是实打实的,作者靠给基线加倍步数来对齐算力,但这不完全等价于同等 wall-clock;实验只覆盖 512×512 分辨率和 HPS、CLIP、OCR 这几类可打分奖励,更主观的美学或叙事奖励是否同样受益尚不清楚。 9. In-Context Forcing:上下文加噪反而提速82% In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion | 上海科技大学·腾讯优图·浙江大学 | arXiv:2608.05237 关键词:自回归视频扩散,噪声上下文,跨帧并行,推理加速,Self Forcing 前序问题:少步自回归视频扩散在生成当前帧的每一个去噪步时,都拿前面已经彻底去噪的干净帧当上下文。干净帧泄露了太多局部细节,模型顺手抄过来就行,结果时序语义被削弱、画面越生成越静止。而如果简单地给上下文加同样强度的噪声,引导又不够,时序一致性会崩。 本文贡献:借「扩散即掩码」的视角重新设计上下文:让上下文帧带上递减的噪声水平——离得远的帧掩得少、紧挨着的帧掩得多,形成渐进式自回归范式,既保住时序一致性又留出帧间动态。更实际的收益是,一旦不再严格依赖「前面必须是干净帧」,跨帧就能并行去噪,推理不再是一条串行长链。训练上以 Wan2.1-T2V-14B 为教师、其因果版 1.3B 为学生,batch 64 跑 1900 步。 实验效果:VBench 上视觉保真度和推理速度双双超过现有方法。逐帧设定下吞吐从 Self Forcing 的 8.9 FPS 提到 16.2 FPS,相对提速 82%,总推理时间减少 45.1%;即便在本已优化过的分块设定下也还能再省 9.3% 时间。30 秒长视频差距最明显:动态程度 86.40 对 Rolling Forcing 的 40.63——后者训练测试不一致的问题会随着滚动窗口反复传播,越长越静止。盲测 A/B 用户研究中相对 Wan2.1、CausVid、Self Forcing 三个基线均获偏好。 批判点评:「给上下文加噪反而更好」违反直觉但解释得通:干净帧提供的是模型可以偷懒复制的捷径。更漂亮的是解开干净帧依赖后顺带解锁跨帧并行,质量和速度不再是二选一。不过 82% 提速是在逐帧这个本身效率最差的设定下取得的,切到实际常用的分块设定就只剩 9.3%,标题数字有挑好看的成分;学生模型只有 1.3B,是否能迁移到 14B 级别未验证;动态程度高也不等于运动合理,86.40 里有多少是有意义的运动仍需人眼确认。 10. Diff-VF:免训练把短视频拉长4倍 Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model | 上海交大·上海人工智能实验室 | arXiv:2608.05976 关键词:免训练长视频,窗口融合,噪声初始化,VBench-Long,即插即用 前序问题:现有视频扩散模型基本都用 10 秒以内的短视频训练,直接外推到长视频就会崩:要么长程语义漂移,要么为了保一致性把画面拍成几乎静止。而重新训练长视频模型既缺数据也缺算力。 本文贡献:提出免训练、即插即用、与骨干无关的 Diff-VF,全部操作只在噪声 latent 上做,因此不挑空间时间建模方式。三招配合:混合噪声初始化用第一段噪声锚定全局语义、后续段追加噪声补充内容多样性;加权窗口采样给每个窗口内的帧按到窗口中心的距离分配权重,让重叠区平滑过渡而不是简单平均出接缝;时间扩展采样把视频按固定间隔抽成若干等距子片段分别去噪再还原顺序,用随时间步变化的融合建立长程依赖。此外用跳跃残差引导把框架扩展到长视频增强,在保真与真实感之间做时间步相关的平衡。 实验效果:在 LaVie 上做 VBench-Long 评测,相比基座模型(主体一致性 0.8546、动态程度 0.9722)和免训练基线,Diff-VF 主体一致性升到 0.9164、动态程度 0.7208,高于 FreeNoise 的 0.6958 和 FreeLong 的 0.5625;整体一致性 0.2795 与人物动作 0.9580 均为最好,运动平滑度 0.9529 也居首。换到 HunyuanVideo 同样有效,说明对 2D+1D 与 3D 注意力两种结构都适用,生成长度是基座原生输出的 4 倍。对比对象包括 FreeNoise、FreeLong 和 RIFLEx。 批判点评:一行权重都不改就把短视频骨干拉长 4 倍,这类方法的部署成本几乎为零,权重函数和等距采样的设计也确实比简单平均更讲究,作者跨两种注意力结构验证了通用性。但要看清代价:基座原本 0.9722 的动态程度被压到 0.7208,只是压得比 FreeLong 的 0.5625 少而已,「一致性—动态性」的跷跷板并没有被打破,只是挪了个位置;评测停在 LaVie 和 HunyuanVideo,没碰 Wan、CogVideoX 这些主流骨干;4 倍长度对分钟级叙事而言仍然偏短。 趋势观察 统一多模态预训练开始有可复现的经验定律 — Meta 用 13.5B MoE、2T token 做单变量对照,得出语言 70%、理解 25%、生成 5% 的非对称配方,生成 token 少五倍反而把 GenEval 从 0.467 抬到 0.482;早期统一还是晚期对齐也不再是口味问题,晚接视觉会留下可测量的「视觉懒惰」。 音视频不再是先出画面再配音,而是同一条序列里的角色分配 — Vorch 三连发把目标、源、参考、历史统一成 token 角色与位置类型:Omni 一套权重覆盖 30 多种条件—输出组合,Director 用噪声配对的残差注入把 22 镜头的分钟级故事撑住,Streamer 在单张 H200 上把文本直出音视频推到 27.12 FPS。 奖励模型集体搬进 latent 空间,并开始交代自己的可信度 — 可灵的 Latent Reward Register 在冻结 DiT 上挂 32 个寄存器 token 直接读奖励,GPU 时最多省 33 倍;TeleAI 的 SURE 让奖励同时输出方差,把不确定的反馈自动降权。稠密、可微、带置信度的中间奖励,正在取代只看最终成图的稀疏打分。 强化学习和自回归都在补同一个洞:训练与推理不一致 — LC-GRPO 用 Langevin 修正让 rollout 与推理时的 ODE 采样对齐,把 DanceGRPO 压到 12.5 的 VBench 动态程度救回 45.8;In-Context Forcing 让上下文带递减噪声以匹配测试分布,30 秒长视频动态程度 86.40 对 Rolling Forcing 的 40.63。两者都说明:很多所谓的涨分,只是模型学会了让画面别动。 Tokenizer 和免训练技巧仍是被低估的杠杆 — Kandinsky Lab 把音频、图像、视频三套 tokenizer 连同训练细节与选型方法一起开源,重建 PSNR 平均比 Wan-2.2、HunyuanVideo 高 1 dB 以上;Diff-VF 不动一行权重,仅靠噪声初始化、加权窗口和等距采样就把短视频骨干拉长 4 倍。不是每个提升都需要重训一个大模型。 人工智能炼丹君 整理 | 2026-08-07 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月07日
13 阅读
0 评论
0 点赞
2026-08-06
AIGC 每日速读|2026-08-06|京东22B音画同修让百年老片复活OmniVR
今日 AIGC 论文速览 今日共 10 篇 · 音视频联合生成与修复 2 篇 · 实时与交互视频创作 2 篇 · 多模态Token高效压缩 2 篇 · 生成后训练与条件对齐 2 篇 · 评测与专业可控生成 2 篇 重点论文标题列表 OmniVR(中科大·京东探索研究院):22B让百年老片音画一起复活 JoyAI-Video-Edit(京东Joy Future Academy):16B单卡30FPS实时剪视频 ContextMaster(清华·南京大学·快手可灵·上科大·港科大):固定预算多镜头创作跑16.74FPS OmniPack(西北工业大学·北大·阿里·清华):无训练6.8%算力保住92.9% STEP-OPD(上海交大·阿里):蒸馏学生越过教师得分0.961 今日论文速览 1. OmniVR:22B让百年老片音画一起复活 OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films | 中科大·京东探索研究院 | arXiv:2608.04224 关键词:音视频联合修复,历史影像,LTX-2,多模态DiT,京东 前序问题:历史影像往往同时存在模糊、噪声、闪烁、曝光不足,以及嘶声、削波、掉音和带宽缺失。现有修复器通常把视频与音频拆开处理,不仅留下单模态质量短板,还可能破坏口型、动作和声音之间的同步。 本文贡献:提出首个音视频联合生成式老片修复模型 OmniVR。系统从 22B 参数 LTX-2 音视频骨干出发,把低质音频和视频编码成联合条件,在统一多模态 DiT 中同步去噪;以联合退化管线模拟真实老片损伤,用近零初始化通道拼接与提示词退火把 T2AV 平滑改造成 AV2AV,再以首帧锚定、模态损失重加权和波形监督支持跨 121 帧窗口的长视频修复。 实验效果:在 200 段真实历史片组成的 OmniVRBench 上,真实轨 MUSIQ 达 61.87,显著高于次优 RealBasicVSR 的 52.38;DNSMOS 从退化输入的 2.04 提升至 2.43,FAD 从 15.93 降至 8.32。12 名标注者给出 80.0% 综合偏好。模型输出 1920×1088,作者还报告在独立 RTN 老片基准的六项无参考视觉指标上全部第一。 批判点评:把“修画面”和“修声音”变成一次联合条件生成,方向比串联两个修复器更完整,指标和人评也有说服力。但 22B 骨干以 rank-384 LoRA 在 64 张 H200 上训练约 5 天,成本很高;强生成先验可能补出原片不存在的纹理与颜色,历史档案、司法取证等场景仍需要真实性约束。代码和权重目前只是承诺公开。 2. JoyAI-Video-Edit:16B单卡30FPS实时剪视频 JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion | 京东Joy Future Academy | arXiv:2608.03974 关键词:实时视频编辑,自回归扩散,两步蒸馏,720p,京东 前序问题:直播和视频通话中的编辑必须边接收边输出,不能偷看未来帧,也不能让显存和计算随视频时长不断增长。把离线编辑器简单切成小段会产生边界跳变,自回归地反复使用生成历史又会累积色偏、身份漂移和背景幻觉。 本文贡献:提出 16B 自回归扩散编辑框架:MLLM 条件编码器理解指令和参考,因果 VAE 与分块双向、跨块因果注意力负责流式输出,滑动窗口加首块全局 sink 把历史状态限制在固定预算。Source-Anchored DMD 将多步扩散蒸馏为两步,并用当前源视频块约束教师目标;长程自回归蒸馏则在分段 rollout 上直接学习累积误差。 实验效果:结合两步生成、固定历史 KV 缓存、FP8 量化和优化 VAE 管线,完整系统在单张 NVIDIA B200 上实现端到端 720p 约 30 FPS。自动指标和人评均显著超过现有流式编辑器,在短视频与长视频上可与强离线系统竞争;代码已经公开。 批判点评:这是今日最硬的工业数字:16B 模型把开放式编辑真正推到实时帧率,而且处理时无需预知视频总长度。但单卡指的是昂贵的 B200,30 FPS 不能外推到消费显卡;两步扩散和 FP8 的细节损失、长达数小时的稳定性以及输入输出延迟分布,还需要独立复现。 3. ContextMaster:固定预算多镜头创作跑16.74FPS ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing | 清华·南京大学·快手可灵·上科大·港科大 | arXiv:2608.04956 关键词:多镜头视频,交互创作,稀疏路由,上下文缓存,可灵 前序问题:真实视频创作会在多轮中交替生成新镜头、引用人物或场景、编辑已有素材,并持续继承历史。若每个去噪步都密集读取不断增长的上下文,延迟会随会话变长;若只保留短窗口,又会忘掉早期角色与约束。 本文贡献:提出交互式多镜头视频创作 IMVC 与统一模型 ContextMaster。角色感知 RoPE 区分参考图、历史镜头、源视频和待生成目标;可缓存的干净上下文只预填一次,块稀疏路由在固定预算内检索相关历史,ConstraintSink 强制保留参考和逐帧编辑约束。两阶段特权上下文蒸馏先用稠密教师做一致性蒸馏,再用分布匹配修复少步 rollout 的细节。 实验效果:在单张 H200、匹配分辨率与帧数的设置下,五镜头任务平均达到 16.74 FPS;跨镜头一致性由强基线的 0.808 提升到 0.836,并在文本生成、参考生成和视频编辑三类任务中取得最强综合表现。固定 6-FE 读取预算接近质量与速度最佳点。 批判点评:这项工作把多镜头创作从一次性提示升级为有状态工作流,并让每轮上下文读取保持定额,产品形态很清晰。但 16.74 FPS 仍依赖 H200;路由器漏掉关键旧镜头会造成不可逆遗忘,角色一致性也不等于剧情因果一致。训练阶段还使用 64 张 H200,复现门槛不低。 4. OmniPack:无训练6.8%算力保住92.9% OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models | 西北工业大学·北大·阿里·清华 | arXiv:2608.03812 关键词:全模态大模型,Token压缩,免训练,音视频理解,推理加速 前序问题:全模态大模型同时接收长视频与音频时,视觉和声音 token 数远超文本。现有压缩要么在进入 LLM 前过早丢掉分散在长时间轴上的证据,要么进入 LLM 后只听文本指令,没有充分利用已经对齐的音视频交互。 本文贡献:提出免训练两阶段压缩框架 OmniPack。LLM 前按模态重要性、全局覆盖和相似度合并结构冗余,把被删除信息回收到代表 token;多模态充分交互后,再用文本问题引导和音视频协作做第二次语义压缩。不同阶段分别处理“结构重复”和“任务相关性”,无需改权重。 实验效果:在 Qwen2.5-Omni-7B 上仅用原始 16.7% FLOPs 即保留 98.0% 性能;极限设置只用 6.8% FLOPs 仍保留 92.9%。15%/7.5% 两阶段保留率下,FLOPs 降低 10 倍、prefill 加速 4.5 倍,同时保留 95.6% 性能,并跨三种骨干、五项基准保持最佳效率折中。 批判点评:无需训练且跨 Qwen 与 MiniCPM 骨干有效,工程接入成本很低;把“先保全局结构、后按问题精炼”拆开也比统一打分更合理。不过结果主要来自 H20 上的 prefill,端到端对话延迟和 KV 缓存收益未完全等同;极低预算仍损失约 7% 综合性能,稀有短暂事件可能最先被压掉。 5. STEP-OPD:蒸馏学生越过教师得分0.961 STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models | 上海交大·阿里 | arXiv:2608.04887 关键词:扩散蒸馏,On-policy,超越教师,表示对齐,图像生成 前序问题:扩散模型的 on-policy 蒸馏通常只让学生在自己的去噪轨迹上拟合教师速度,理论最优点就是“和教师一样”,无法主动超过教师;只看最终输出还会放任各 Transformer Block 的内部表示以错误方式相互抵消。 本文贡献:提出 STEP-OPD:把任务教师相对共享基础模型的速度差视为能力提升方向,将缩放后的差值继续加到教师目标上,构造“教师之外”的输出外推目标;同时不直接硬对齐隐藏状态,而是匹配相邻 Block 表示变化的方向和幅度,让学生学习能力在网络内部如何逐层形成。 实验效果:在组合对齐、文字渲染与人类偏好三组能力上统一超过标准 DiffusionOPD,并使 GenEval 从 0.927 提升到 0.961;统一学生在三类能力上分别超过对应的单任务教师,证明多教师能力整合不必以教师上限为终点。 批判点评:“教师减基础模型”的差向量能否稳定代表可继续外推的能力,是很有启发性的假设,内部变化对齐也补上了只看终点的盲区。但外推系数依赖任务调参,走得太远可能放大教师偏差;目前只验证图像生成,扩展到视频等更长序列后,中间层监督的显存和计算成本会更突出。 6. TD-V2A:帧间差分让视频配音FAD降至0.53 Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation | 清华·南洋理工等 | arXiv:2608.04902 关键词:视频配音,帧间差分,音频扩散,时间对齐,视觉表征 前序问题:视频配音区别于看图配音的核心不是多看几张静态图,而是捕捉帧间运动变化。现有方法常外挂音视频对比模型、声学结构预测器或多模态大模型,系统复杂,且可能把真正决定声音时机的低层运动细节压掉。 本文贡献:提出 TD-V2A,直接把相邻帧差分作为额外视觉条件。作者比较像素帧差与编码后特征差,发现编码前差分保留的细粒度运动更有效;训练时以文本到音频预训练、原始视频条件、差分增强条件三阶段持续学习,采样时用退火差分引导在早期先确定全局声音动态,后期逐渐回到原始视觉语义。 实验效果:在约 1.5 万段 VGGSound 测试片上,FAD 达 0.53,优于 MMAudio 的 0.81;IS 达 16.9、ImageBind Score 达 33.8,均明显高于对比方法,时间对齐准确率 89.1。它甚至超过需要额外训练的 CAVP 音视频表示,且没有新增预测网络。 批判点评:把“视频比图片多出来的信息”直接定义为帧差,简单而有效,指标也说明低层运动不应过早被语义编码器抹掉。但逐帧差分对镜头切换、抖动和光照闪烁同样敏感,可能把无关变化误当声源;其时间对齐 89.1 仍略低于专门以对齐目标训练的 Diff-Foley 89.9。 7. CAPE-T2V:训练推理两头对齐提示词 CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation | 复旦·快手可灵 | arXiv:2608.03046 关键词:文生视频,提示增强,训练推理对齐,Caption,可灵 前序问题:视频 DiT 训练时看到的是详尽视频 caption,线上却由 Prompt Enhancer 把用户短句改写后再喂给模型。即使双方使用同一字段模板,细节选择、组织方式、粒度和措辞仍不同,形成残余 PE-Caption 分布缺口。 本文贡献:提出两步 Captioner-Anchored 对齐:先用外部视频描述器产生统一目标,把简短描述、详细描述和伪用户提示都训练成同一种 Anchored PE 输出;再让这个已经冻结的 PE 重写视频训练 caption 并微调 DiT,部署时仍由同一个 PE 改写用户提示,使训练侧与推理侧真正共享同一文本算子。 实验效果:在 Wan2.2 与 LTX-2.3、StoryEval/VBench-2.0/T2V-CompBench 的六个组合上全部超过只做 schema 对齐的基线。Wan2.2 分别提升 1.6、1.12、0.30 分,LTX-2.3 提升 1.4、0.92、0.65 分;caption 到推理改写的 MMD² 从 0.0764 降至 0.0682。 批判点评:工作指出“字段相同不等于分布相同”,并把 Prompt Enhancer 正式视作生成模型接口,诊断很贴近真实部署。但绝对增益多数只有 0.3–1.6 分,StoryEval 又使用 GPT-5.5 判定;一旦线上 PE 更新,就要重新改写训练 caption 并适配 DiT,维护成本仍然存在。 8. Two-Stage Token Pruning:只留10%视频Token还涨7分 Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models | Amazon | arXiv:2608.03112 关键词:视频语言模型,Token剪枝,免训练,自适应预算,Amazon 前序问题:视频语言模型每帧可产生数百视觉 token,数分钟视频很快进入万 token 区间。现有图像剪枝方法既忽略跨帧重复,又对所有视频使用固定保留率;静态访谈和高速运动显然不该被压成相同预算。 本文贡献:提出完全后处理的两阶段自适应剪枝:先在时间轴选择差异最大的代表帧,再在保留帧内做 token 级裁剪。第二阶段对 token 相关矩阵做特征值分解,用谱衰减速度估计当前视频冗余度,并据此动态决定保留比例,无需训练或微调原模型。 实验效果:在三种 VLM、五项视频基准上持续增益;平均仅保留 10% token 时,VideoDC 准确率达到 76.75%,比同预算 DivPrune 的 68.47% 高 8.28 分,论文摘要按跨设置概括为约 +7%;同时 TFLOPs 降低约 95%,其他问答基准基本保持。 批判点评:把“删哪些帧”和“每帧删多少 token”分开,并让谱结构决定预算,符合视频冗余的实际差异。代价是特征值分解本身有额外开销,当前实验以短视频理解基准为主;突发但关键的一帧或小目标,仍可能在两轮剪枝中被不可逆丢失。 9. OmniEdit-Bench:五赛道揭穿视频编辑假高分 OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing | 港大·阿里通义万相·浙大·北大 | arXiv:2608.05049 关键词:视频编辑评测,音频编辑,时间编辑,推理编辑,通义万相 前序问题:很多视频编辑评测沿用图像编辑任务,只看逐帧空间变化;模型即使没有执行指令,只要保留原视频的高画质和一致性,也可能得到高分。音频、时间操作、参考条件和隐式推理因此长期缺席。 本文贡献:构建覆盖空间 240、时间 200、参考 200、音频 100、推理 50 个案例的五赛道基准,并区分显式与隐式指令。评测把质量拆成准确性、保留度、真实感和一致性,再以准确率作为门控缩放后三项,避免“看起来很好但改错了”获得虚高总分。 实验效果:商业与开源模型整体都远未过关:KlingV3-Omni 综合最高也仅 38.3/100,Seedance 2.0 为 37.3;时间赛道最好 Wan2.7-Edit 只有 29.0,推理赛道最好 Seedance 2.0 也只有 29.8。商业模型在空间编辑领先,但优势在音频、时间和推理任务明显收窄。 批判点评:把准确性设为其他质量分的前提,能有效纠正原视频先验造成的假高分;五赛道也比图像式评测更接近真实需求。不过大量评分仍依赖 VLM,门控权重是人为设计;部分商业模型因功能或版权限制没有覆盖全部赛道,横向平均并非完全同条件。 10. CSGen:2.4万样本守住血管道路裂缝 CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion | ACM MM 2026·海南大学·广东海洋大学 | arXiv:2608.04655 关键词:可控生成,曲线结构,拓扑保持,专业数据,ACM MM 前序问题:血管、道路、叶脉和裂缝只占图像极少像素,却要求细长分支持续连通。通用扩散模型更擅长生成大物体,普通 MSE 又被背景像素主导,容易把这些稀疏结构画断或偏离控制图。 本文贡献:提出基于 SD3.5 的层次多模态扩散模型 CSGen,并汇集 24678 个样本,覆盖血管、冠脉、混凝土裂缝、叶脉和道路五域及七类标注。分阶段注入 CLIP 拓扑属性与 T5 场景描述,先锁定结构再补环境;稀疏感知损失按等效直径提高细小脆弱分支的权重。 实验效果:相同提示下 FID 达 98.525,优于 SD3.5-ControlNet 的 131.256;完整模型将拓扑 clDice 从基线 0.628 提升到 0.766。合成数据用于下游分割时,道路域 mIoU 最高增加 4.73 分,说明生成结果不只视觉像真,也能补充结构学习。 批判点评:这是 ACM MM 2026 已接收工作,数据、代码和结构指标较完整,说明专业生成不能只看通用审美分。但五个领域仍共享相对简单的二值拓扑先验,跨域统一性有限;合成图提升分割不等于临床或基础设施诊断可靠,专业场景还需真实分布验证。 趋势观察 音视频联合模型开始从内容生成反向进入修复 — OmniVR 直接复用 22B 音视频生成骨干,同时恢复老片画面、声音与同步关系;统一生成先验正在吞并过去彼此独立的增强管线。 视频编辑从固定短片走向实时、有状态和开放时长 — JoyAI 用两步自回归扩散在单 B200 达到 720p 约 30 FPS,ContextMaster 则以固定预算上下文支撑多轮多镜头创作,视频模型正从一次生成器变成持续工作的创作系统。 Token压缩从固定比例升级为内容与问题共同决定 — OmniPack 先保全局音视频结构、再按问题做语义精炼,Amazon 两阶段方案先删重复帧、再按谱冗余决定每帧预算;高效推理正在告别一刀切剪枝。 生成后训练不再满足于复刻教师或单边修补接口 — STEP-OPD 沿教师相对基础模型的能力方向继续外推,CAPE-T2V 则让同一个 Prompt Enhancer 同时定义训练与推理文本分布,优化目标从局部模仿转向端到端系统对齐。 视频能力评测开始补齐时间、声音与隐式推理 — OmniEdit-Bench 的五赛道显示最强商业编辑模型综合仍不足 40 分;TD-V2A 也证明只看语义无法评价配音,时间差分与同步指标将成为音视频系统的基本维度。 人工智能炼丹君 整理 | 2026-08-06 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月06日
15 阅读
0 评论
0 点赞
2026-07-21
AIGC 每日速读|2026-07-21|腾讯混元4步视频胜50步强化扩散MeanFlowNFT
今日 AIGC 论文速览 今日共 5 篇 · 生成强化学习与少步加速 1 篇 · 视频DiT系统加速 1 篇 · 世界模型与科学多模态生成 2 篇 · 多模态智能体安全 1 篇 重点论文标题列表 MeanFlowNFT(腾讯混元·港科大):4步视频胜50步强化扩散 FVAttn(腾讯微信·中山大学·北大):稀疏注意力提速4.41倍 Orbis 2(弗赖堡大学):分层世界模型兼顾远景细节 S1-Omni(ScienceOne AI·文歌科技):统一200类科学任务推理生成 Lucid(UC Irvine):不可见扰动毒化智能体记忆 今日论文速览 1. MeanFlowNFT:4步视频胜50步强化扩散 MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators | 腾讯混元·港科大 | arXiv:2607.15273 关键词:视频生成,MeanFlow,强化学习,少步采样,奖励对齐 前序问题:MeanFlow 通过预测时间区间平均速度实现少步生成,但现有 DiffusionNFT 前向过程强化学习优化的是瞬时速度,两者目标不匹配;如何在保留 MeanFlow 少步采样优势的同时做可靠奖励对齐,仍未解决。 本文贡献:提出 MeanFlowNFT:利用连接平均速度与瞬时速度的 MeanFlow 恒等式,构造诱导瞬时速度预测器,再把 DiffusionNFT 目标施加到该预测器上,使奖励优化在数学上成立;实际采样仍走平均速度,因此保留快速少步生成,并证明继承 DiffusionNFT 的严格策略改进保证。 实验效果:图像与视频生成均稳定提升基线;SD3.5-M 的 8 项指标中 6 项超过此前 SOTA 少步 RL 生成器。Wan2.1 上仅 4 步即获 VBench 84.33,超过 50 步 LongCat-Video RL 的 82.57。 批判点评:把瞬时速度 RL 桥接到平均速度生成器,既有理论保证又拿出「4 步胜 50 步」的工业级数字,腾讯混元背景也很接近落地。但仍依赖 DiffusionNFT 的奖励与训练设定,少步模型在复杂长视频、细粒度运动上的稳定性,以及不同奖励下是否都能保持严格改进仍需扩验。 2. FVAttn:稀疏注意力提速4.41倍 FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation | 腾讯微信·中山大学·北大 | arXiv:2607.16190 关键词:视频DiT,稀疏注意力,负载均衡,多GPU,推理加速 前序问题:高分辨率视频 DiT 的长时空序列让自注意力成为主瓶颈;免训练 Top-p 稀疏注意力虽省计算,却在多 GPU 序列并行下造成各注意力头负载不均,最慢 rank 拖住全局同步,稀疏收益被等待开销吃掉。 本文贡献:提出 FVAttn 免训练稀疏注意力系统:以 Top-p 路由、Top-k 安全下限和视频感知分块构造稀疏前端,再按当前真实 mask 在运行时修复调度。运行时负载均衡通过 P2P 迁移少量重头缩短关键路径;Slack-Aware Sparse Augmentation 用额外高价值块填充非关键 rank 的空闲,并将调度与迁移开销同计算重叠。 实验效果:在步蒸馏 Wan2.2 I2V 上把平均负载不均衡从 1.34 降至 1.08;相对 FlashAttention,注意力提速 4.41×、DiT 推理提速 2.02–2.11×,同时保持有竞争力的视频质量。 批判点评:抓住「稀疏了却被最慢 GPU 拖死」这一系统瓶颈,运行时搬重头+用高价值块填空闲的设计很工程化,4.41× 注意力提速也扎实。但收益依赖多 GPU 序列并行、专用调度与 P2P 拓扑,单卡无红利;跨模型、不同显卡互联与更长视频下的迁移开销边界仍待验证。 3. Orbis 2:分层世界模型兼顾远景细节 Orbis 2: A Hierarchical World Model for Driving | 弗赖堡大学 | arXiv:2607.15898 关键词:驾驶世界模型,分层预测,Diffusion Forcing,DINOv2,长时生成 前序问题:现有驾驶世界模型通常只在单一抽象层预测:要么追求像素保真却缺空间推理与语义理解,要么长时滚动误差不断累积,难同时服务真实下游规划与高质量生成。 本文贡献:提出分层驾驶世界模型,将未来预测拆成两个时间与抽象尺度:高层预测器在压缩 DINOv2 语义潜空间中预测长时粗场景结构和子目标;低层生成器在 VAE 潜空间中受高层输出条件约束,生成短时精细画面。训练上先用 diffusion forcing 获得更丰富表征,再用 teacher forcing 微调以稳定自回归滚动。 实验效果:在标准驾驶世界模型评测上全面达到 SOTA,覆盖长时生成保真、反事实场景下的转向响应,以及内部表征质量;兼得高感知保真与更强空间、语义表示。 批判点评:「高层管远景语义、低层补近景细节」符合驾驶规划的天然层级,两阶段训练也把 diffusion forcing 的表征优势与 teacher forcing 的稳定性拼起来。但系统复杂、两级误差会相互传递,对极端交通事件和跨城市域偏移的可靠性,以及是否真能改善闭环驾驶安全仍需实车验证。 4. S1-Omni:统一200类科学任务推理生成 S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation | ScienceOne AI·文歌科技 | arXiv:2607.15686 关键词:AI4S,统一多模态,科学生成,分子生成,科学图像 前序问题:AI for Science 被领域模型、工具增强 LLM 与科学语言模型割裂,不同模型各管蛋白、分子、材料或图像,难在同一模型里联合建模异构数据、科学规律和专家知识。 本文贡献:提出 S1-Omni,以三部分统一科学理解、预测与生成:把自然语言、CIF、SMILES、蛋白序列、光谱和科学图像映入共享任务空间;在数据构造、验证与训练中注入科学定律和专家知识;按任务连接原生领域解码器,支持属性预测、光谱到分子生成、蛋白位点/结构预测、科学图像生成与编辑。S1-Omni-Corpus 覆盖 200 类科学任务和数百万推理样本。 实验效果:在 60 多个科学基准上评测,多数基准超过 GPT-5.5 与 Gemini-3.1-Pro,并在若干任务上匹敌或超过领域专用模型。 批判点评:将符号序列、科学图像与领域规律放进统一模型,200 类任务与 60+ 基准规模很有冲击力。但跨领域总榜容易掩盖单任务深度,科学定律是否真正进入推理而非数据相关性、闭源强基线的评测公平性,以及科学生成结果的实验可验证性都需独立复核。 5. Lucid:不可见扰动毒化智能体记忆 Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents | UC Irvine | arXiv:2607.15657 关键词:多模态智能体,长期记忆,视觉攻击,记忆投毒,安全 前序问题:多模态智能体把历史图文写进长期记忆并在未来检索,却默认视觉数据可信、没有语义完整性验证;攻击者若只改图片、不能碰文本与模型,是否仍能持续污染后续生成,尚未被系统研究。 本文贡献:提出 Lucid 黑盒视觉攻击框架,在不知道目标 MLLM、检索编码器或文本通道的严格图像边界威胁模型下,构造肉眼不可见扰动:有历史文本上下文时做 memory poisoning,替换被文本强化的良性图像并扭曲回忆;无上下文时做 memory injection,让图像直接注入攻击者叙事。覆盖图结构、LLM 摘要及商业系统等五种黑盒记忆架构。 实验效果:跨多种对话领域,记忆投毒攻击成功率达 61.6%,记忆注入达 58.4%,暴露出多模态长期记忆「检索相似即信任」的结构性漏洞。 批判点评:只靠不可见图片扰动、完全黑盒就能让错误记忆跨会话持续生效,攻击面比单轮越狱更危险,数字也足够醒目。但实验仍依赖代理视觉编码器的迁移性;现实平台的图片重压缩、重编码与人工审核可能削弱攻击,论文主要揭示风险,防御机制尚未闭环。 趋势观察 少步生成与强化学习开始真正合流 — MeanFlowNFT 用平均-瞬时速度恒等式把前向过程 RL 接进 MeanFlow,Wan2.1 四步 VBench 84.33 超过 50 步 RL 模型,奖励对齐不再必须牺牲采样效率。 视频加速从算法稀疏深入分布式调度 — FVAttn 不只剪注意力,还在运行时迁移重头、填平 GPU 空闲,把稀疏注意力的 rank 拖尾变成可优化的系统问题。 世界模型走向语义与细节分层 — Orbis 2 用 DINO 高层预测远期语义、VAE 低层生成近景细节,世界模型从单尺度像素预测转向面向规划的层级抽象。 统一多模态扩展到科学原生对象 — S1-Omni 将 CIF、SMILES、蛋白、光谱与科学图像纳入同一模型,统一生成理解正从通用图文扩到原生科学表示。 长期记忆成为多模态智能体新攻击面 — Lucid 证明肉眼不可见的图片扰动可在黑盒条件下持续污染跨会话记忆,安全边界正从当前提示扩展到历史视觉证据。 人工智能炼丹君 整理 | 2026-07-21 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月21日
25 阅读
0 评论
0 点赞
2026-07-10
AIGC 每日速读|2026-07-10|高通MobileWan让5B视频扩散上手机16FPS
今日 AIGC 论文速览 今日共 10 篇 · 生成加速与高效训练 3 篇 · 生成理解一体化 1 篇 · 视频修复与重打光 3 篇 · 音频与语音生成 2 篇 · 生成安全与对齐 1 篇 重点论文标题列表 MobileWan(高通(Qualcomm)):5B视频扩散首上手机16FPS Dynamic-in-Few-Step(西湖大学·vivo·浙大):少步蒸馏配动态稀疏30倍 FourTune(MIT·Stanford·CMU):全4bit后训练提速2.27倍 Gen4U(Google DeepMind):冻结视频扩散当通用编码器 LightCrafter(CMU·多伦多大学·博世):PBR代理视频重打光更可控 今日论文速览 1. MobileWan:5B视频扩散首上手机16FPS MobileWan: Closing the Quality Gap for Mobile Video Diffusion | 高通(Qualcomm) | arXiv:2607.06173 关键词:视频扩散,移动端部署,循环蒸馏,注意力剪枝,VBench 前序问题:视频扩散靠把 Transformer 扩到数十亿参数换质量,但手机端模型受限于 0.4-1.8B 小参数预算、生成质量上不去;难点是如何在内存受限的移动硬件上跑服务器级大模型。 本文贡献:证明高质量移动端视频生成不必用小模型——把服务器级 5B 视频扩散 Transformer 高效部署到手机。以 Wan2.2-5B 为起点,用循环蒸馏把视频生成改造成分块自回归、常数内存注意力;配合因果线性注意力让模型推理时像 RNN 运行且跨块保持时序一致;再提出可学习注意力头剪枝(二值化逐头门控+噪声偏置稀疏目标端到端优化+蒸馏微调),叠加采样步蒸馏与内存优化 VAE 解码。 实验效果:成为首个可部署到商用手机的 5B 级视频扩散模型;在 Qualcomm Snapdragon 8 Gen 5 NPU 上以 20 秒端到端延迟生成 5 秒 480×832、16 FPS 视频,VBench 得分 83.79,刷新移动端视频生成 SOTA。 批判点评:用「循环重构+因果线性注意力+逐头剪枝+步蒸馏」组合拳把 5B 大模型压进手机 NPU,是移动端视频生成的一次实打实突破,高通自家 NPU 落地也很硬核。但 480×832/5 秒/16 FPS 仍是受限规格、20 秒延迟离交互式实时尚有距离,多重压缩(剪枝+线性注意力+步蒸馏)对复杂运动/长视频的质量损失、以及对非骁龙硬件的可迁移性仍待观察。 2. Dynamic-in-Few-Step:少步蒸馏配动态稀疏30倍 Dynamic-in-Few-Step: Unifying Dynamic Computation and Few-Step Distillation for Efficient Video Generation | 西湖大学·vivo·浙大 | arXiv:2607.06631 关键词:视频扩散,少步蒸馏,动态稀疏,模型混合,后训练加速 前序问题:视频扩散质量高但算力昂贵;少步蒸馏虽提速,却对所有去噪阶段强制统一的静态结构,忽视了不同噪声水平天然不同的算力需求。 本文贡献:提出后训练加速框架,把动态结构稀疏化直接融进蒸馏过程:不同于对固定管线做事后压缩,它联合优化去噪步数与结构稀疏度,把预训练视频扩散变成紧凑的、逐步专用的模型混合(Mixture-of-Models, MoM);并用渐进训练策略+输出回滚机制解决联合优化的训练不稳定,配套专用推理引擎高效部署。 实验效果:与现有加速技术正交且高效:在 Wan-14B 上,在 4 步蒸馏基础上再去掉 24% 的每步 FLOPs、额外带来 1.2× 墙钟加速,相对 50 步教师达到 30× 提速,同时保持有竞争力的生成质量。 批判点评:抓住「不同噪声步算力需求不同」这一被少步蒸馏忽视的冗余,用逐步专用 MoM 把动态稀疏与蒸馏联合优化、且与其它加速正交,思路精准、30× 提速实在。但 MoM 带来路由与部署复杂度、需专用推理引擎,「4 步基础上再省 24% FLOPs」的绝对增益有限,训练稳定性靠渐进策略+回滚机制维持、调参成本与更大规模泛化仍待看。 3. FourTune:全4bit后训练提速2.27倍 FourTune: Towards Fully 4-Bit Efficient Post-Training for Diffusion Models | MIT·Stanford·CMU | arXiv:2607.05711 关键词:扩散模型,4-bit量化,后训练,LoRA,FLUX 前序问题:大扩散模型后训练受显存占用大、训练慢制约,现有参数高效微调(PEFT)只能部分缓解,始终困在「省显存却不省算力」的内存-速度权衡里(如 LoRA 全精度骨干仍占大量显存、QLoRA 频繁在线反量化反增开销)。 本文贡献:提出 FourTune,基于端到端 W4A4G4(权重/激活/梯度全 4-bit)的高效后训练框架:三分支混合管线在标准 LoRA 上增设冻结的数值稳定器,隔离对量化敏感的离群值,从而在原生 4-bit 计算下稳定训练;并用硬件友好的分块量化与定制融合算子支持高效量化反向传播、降低显存带宽开销。 实验效果:在定制化、强化学习、蒸馏三类任务上均可匹配全精度微调质量;在 FLUX.1-dev(12B)上,相比 BF16 LoRA 显存开销降低 2.25×、端到端训练吞吐提升 2.27×。 批判点评:把量化从推理推进到「后训练全 4-bit(含梯度)」,用冻结数值稳定器隔离离群值破解 4-bit 训练不稳定,配定制融合算子拿到 2.25× 显存/2.27× 吞吐,MIT/Stanford/CMU 这套量化天团工程含金量高。但 W4A4G4 依赖特定硬件与定制 kernel、通用性受限,数值稳定器额外分支的开销、以及更大模型/更长训练下 4-bit 梯度的精度累积误差仍需更多验证。 4. Gen4U:冻结视频扩散当通用编码器 Gen4U: Unifying Video Generation and Understanding via Diffusion | Google DeepMind | arXiv:2607.06856 关键词:视频扩散,生成理解一体化,表征探测,视频编码器,零样本 前序问题:以往认为扩散表征只擅长低层几何、拙于高层语义,生成与理解被割裂看待;能否让同一个视频扩散模型既生成又理解,缺乏系统证据。 本文贡献:用互近邻(mutual-kNN)对齐度量系统探测 SOTA 视频扩散(Veo3、Wan2.2)的中间激活,揭示其潜空间沿网络深度与噪声水平高度结构化:中等噪声给出线性可分的全局语义,低噪声保留细粒度细节但空间分散、需注意力解码。据此提出 Gen4U,用单次前向复用这些生成表征,把冻结的大规模视频扩散直接当作强视频编码器。 实验效果:冻结、免微调的视频扩散在视频分类、深度估计、相机位姿估计、图像/视频描述等一系列语义与非语义任务上都极具竞争力,在保留原模型高质量生成能力的同时统一了生成与理解两大范式。 批判点评:用对齐度量把「视频扩散潜空间怎样编码语义」讲清楚,并证明冻结模型免微调即是强编码器,是对「生成即理解」的漂亮实证,DeepMind 用 Veo3 背书说服力强。但探针依赖对 mutual-kNN 等度量与噪声/层位的精心选点,下游任务用简单读出头、与专用微调 SOTA 仍有差距,且强依赖顶级视频扩散(Veo3 闭源),可复现与在更弱模型上的普适性存疑。 5. LightCrafter:PBR代理视频重打光更可控 LightCrafter: PBR-Conditioned Video Diffusion Refinement for Controllable and Consistent Relighting | CMU·多伦多大学·博世 | arXiv:2607.08016 关键词:视频重打光,PBR渲染,视频翻译,时序一致,CogVideoX 前序问题:视频重打光要同时兼顾长时时序一致与基于物理的光传输,依赖对材质/几何/光照等本征属性的准确估计。已有两条路都不理想:逆渲染+正渲染重建噪声大、难处理全局光照;生成式视频到视频翻译则可控性差、时序不稳、且受配对训练数据限制。 本文贡献:提出 LightCrafter 混合管线,把视频重打光重构为「对一段代理视频做视频翻译」:不直接翻译输入视频,而是把「输入在目标光照下的 PBR 渲染」翻译为最终结果——将光照目标烘焙进 PBR 代理,免去教扩散模型理解环境贴图等光照概念,既能实现更精细的光照控制、又天然带来长时时序一致。为补足 PBR 难建模的全局光照,在合成配对视频+真实无配对视频上后训练 CogVideoX 以调用视频生成模型的光度先验。 实验效果:在真实世界重打光基准上超越此前 SOTA,并贡献了一个用于深入分析的合成基准;将开源数据集、基准、指标与代码。 批判点评:用「PBR 代理+视频翻译」把光照控制从难教的生成条件变成可烘焙的物理渲染,兼得可控性与时序一致,思路巧妙、实测超 SOTA。但方案质量受前置 PBR 渲染(依赖本征估计)的上限约束,全局光照仍要靠后训练 CogVideoX 兜底,两阶段管线的复杂度、以及对复杂材质/强动态场景的泛化仍待检验。 6. FADRA:频率感知扩散修复视频人脸 FADRA: Frequency-Aware Diffusion with Residual Adaptation for Video Face Restoration | UAE大学·中国海洋大学·MBZUAI | arXiv:2607.06389 关键词:视频人脸修复,频率感知,扩散模型,残差自适应,时序一致 前序问题:视频人脸修复(VFR)要从严重退化的视频里恢复高质量且时序一致的面部细节,现有方法难以在空间保真与时序连贯间取得平衡。 本文贡献:提出 FADRA,频率感知+迭代残差自适应的扩散框架:借预训练文生视频扩散的强时序一致性,用轻量 LoRA 适配器+低质(LQ)像素对齐特征融合高效迁移冻结生成先验;再引入重复残差自适应头(RRAH)在骨干后做逐步残差精修——RRAH 把 LQ 潜变量与当前速度预测一起作输入,在每个流匹配步反复回看 LQ 线索、预测残差更新;另设频率感知损失在多个频段显式监督、强调对感知质量关键且易时序抖动的频率分量。 实验效果:恢复出更好的面部结构、产出比 SOTA 更时序一致的视频,在定量指标与主观感知上均有明显提升。 批判点评:用「LoRA 迁移生成先验+RRAH 逐步残差回看 LQ+频率感知损失」三招治 VFR 的空间-时序权衡,把频域监督用在易抖动分量上很对症。但方法叠了多个模块、对预训练文生视频先验依赖强,RRAH 重复精修的推理开销、以及在极端退化或大姿态/遮挡人脸上的鲁棒性仍需更多验证。 7. DiffCVE:编码先验引导压缩视频增强 DiffCVE: Diffusion-based Compressed Video Enhancement | 武汉大学 | arXiv:2607.07195 关键词:压缩视频增强,编码先验,扩散模型,QP条件,VAE解码 前序问题:严重压缩视频的感知质量增强很难:伪影模式复杂、信息损失大;直接套用扩散模型往往忽视压缩退化特性,还可能引入与结构不一致的幻觉。 本文贡献:提出 DiffCVE:用编码先验增强的双条件(CPDC)分支联合建模压缩视频与编码先验,让残差、运动矢量等编码先验在去噪过程中提供互补的结构与运动引导;用压缩退化语义提示(CDSP)以 QP 条件文本提示+LoRA 微调让扩散过程感知压缩严重程度;再在 VAE 解码器里加入编码先验引导的加权融合(CPWF),用 QP 预测的权重融合 VAE 编码器与编码先验编码器特征。 实验效果:在提升感知质量上效果显著,尤其在严重压缩设置下优势明显;项目页提供了增强视频演示。 批判点评:把「编码先验(残差/运动矢量/QP)」这一压缩视频独有信息喂进扩散去噪与解码,对症「忽视退化特性+幻觉」两大痛点,充分利用视频编码域知识很务实。但强依赖可拿到的编码先验(需解码端配合)、QP 条件与三模块叠加的复杂度,以及在跨编码标准/未知码率下的泛化仍待验证。 8. Flowley:端到端单阶段视频配音 Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space | FPT Software·NVIDIA | arXiv:2607.06405 关键词:视频到音频,端到端,交叉注意力,音视频同步,VGGSound 前序问题:视频到音频(V2A)要为无声视频合成语义一致且时序同步的声音,但许多方法靠多阶段训练(算力高、耗时长),或把视觉转成文本以借用文生音频模型(牺牲细粒度时序线索)。 本文贡献:提出 Flowley,端到端单阶段训练架构,融合视觉特征与文本提示生成配音;核心是渐进软掩码交叉注意力,把音视频同步直接嵌进注意力机制、相较标准注意力零额外算力;并提出即插即用的 SoundCap 管线,为视频生成细粒度、声音导向的描述来引导模型(弥补现有 V2A 基准缺乏声音描述的问题)。 实验效果:不集成任何预训练音视频对齐模块,Flowley 在 VGGSound 多项指标上达到 SOTA;引入 SoundCap 后,零样本设置下音频质量进一步超过最强的闭源方法。 批判点评:用「软掩码交叉注意力零成本内建同步+SoundCap 补声音描述」把 V2A 做成单阶段端到端,免掉专用对齐模块还拿 SOTA,简洁高效。但收益部分来自 SoundCap 描述质量(引入额外描述管线),VGGSound 之外更开放场景的时序精准同步、以及对无明显声源/复杂多声源视频的泛化仍待验证。 9. SR-FD:分布正则降少步TTS错字36% Fréchet Distance Loss on Speech Representations for Text-to-Speech Synthesis | 台湾大学·华盛顿大学 | arXiv:2607.06027 关键词:语音合成,流匹配,Fréchet距离,分布正则,少步采样 前序问题:少步扩散/流匹配 TTS 通常用条件流匹配、重建、停止预测等局部目标训练,优化稳定却从不追问「采样出的语音是否服从高质量语音的分布」。 本文贡献:提出语音表征 Fréchet 距离损失(SR-FD),一种面向免 tokenizer 流匹配自回归 TTS 的训练期分布正则:微调时模型用与部署一致的少步采样器合成语音,SR-FD 把该语音的冻结 Whisper 与 CTC 特征的均值和协方差,对齐到离线从三种互补内容目标算好的参考统计;无需判别器、也不增加推理期计算。 实验效果:在 Seed-TTS 英文上,四步 SR-FD 微调把 WER 从四步 VoxCPM2 基线的 2.2279% 降到 1.4147%(相对降 36.5%),还超过原十步基线的 1.7366%;说话人相似度与客观质量代理保持在十步水平。 批判点评:把「生成分布是否像真语音」用 Fréchet 距离显式约束、且无判别器/零推理开销,让四步 TTS 可懂度反超十步基线、WER 降 36.5% 很漂亮。但增益主要体现在可懂度(WER)、对音色/韵律等主观维度提升有限,依赖 Whisper/CTC 特征与离线参考统计的选取,跨语言/多说话人与更大模型上的迁移仍待验证。 10. AEGIS:定位注意力头防视觉同义越狱 AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models | 复旦·阿里 | arXiv:2607.06120 关键词:文生图,安全对齐,越狱防御,注意力头,推理期干预 前序问题:文生图扩散虽保真度高、应用广,却易被「视觉同义词攻击(VSA)」越狱——看似良性的提示通过隐式视觉联想诱导出违禁图像;现有防御大多围绕过滤/编辑时显式暴露的不安全概念,对 VSA 留有盲区,陷入「防不住 VSA 或误伤相似良性概念」的安全-效用两难。 本文贡献:从「静态压制预设不安全概念」转向「动态追踪不安全语义如何在生成中涌现」。机理分析发现:VSA 与显式不安全提示都通过稀疏的「语义注入注意力头」收敛,这些头是违禁视觉语义的推理期瓶颈。据此提出 AEGIS(经识别与引导的自适应规避防护),一种推理期防御,仅在被识别出的脆弱注意力头上施加相似度感知的排斥。 实验效果:对比 16 个基线,AEGIS 同时提升安全与效用:在 SD 1.4 上把域内暴力/裸露 VSA 的攻击成功率(ASR)降到 0.00/0.03、域外显式与对抗攻击 ASR≤0.09;保持良性图像保真、不误伤难负概念,并可在重识别关键头后迁移到 SD 2.1 与 FLUX.1。 批判点评:用机理分析锁定「语义注入注意力头」这一 VSA 瓶颈、只在少数脆弱头做定向排斥,既躲开全局压制的误伤又不需重训,把安全-效用两难做出正收益、还能跨模型迁移,思路犀利。但依赖对脆弱头的准确识别(每个骨干需重识别),面对自适应攻击者绕开这些头、或更强开源模型上的稳健性仍是开放问题,推理期干预对生成多样性的潜在影响也需观察。 趋势观察 视频生成加速冲向端侧与实时 — MobileWan 把 5B 视频扩散塞进手机 NPU、Dynamic-in-Few-Step 在 Wan-14B 上做到 30× 提速,视频扩散加速正从「云端少步」推进到「端侧部署+动态稀疏」,落地门槛快速下探。 量化从推理走进后训练全链路 — FourTune 把权重/激活/梯度全压到 4-bit 做后训练,在 FLUX 12B 上省 2.25× 显存,低比特正从推理阶段延伸到微调/强化学习/蒸馏的完整后训练闭环。 视频扩散正成为通用视觉基座 — Gen4U 证明冻结的视频扩散免微调即是强编码器,可同时做生成与分类/深度/位姿/描述,「生成即理解」让一个大模型统一多任务成为新范式。 视频修复复用生成先验+物理/编码先验 — LightCrafter 用 PBR 代理烘焙光照、FADRA 用频率感知残差修脸、DiffCVE 用编码先验补压缩视频,视频修复类工作普遍「借预训练生成先验+注入领域先验」提质。 多模态生成扩到音频且更重安全 — Flowley 单阶段视频配音、SR-FD 用分布正则提 TTS 可懂度,音频生成同步演进;AEGIS 则用机理定位注意力头防 T2I 越狱,安全从静态过滤转向生成期动态干预。 人工智能炼丹君 整理 | 2026-07-10 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月10日
24 阅读
0 评论
0 点赞
2026-05-28
AIGC 每日速读|2026-05-28|北大OSP-Next视频生成跨硬件加速
今日 AIGC 论文速览 今日共 11 篇 · 视频生成全栈加速 4 篇 · 视频生成新能力 2 篇 · 音频统一生成 2 篇 · 语音合成与编辑 2 篇 · 扩散模型对齐 1 篇 重点论文标题列表 OSP-Next:稀疏+量化+RL全栈视频生成1.64x PARE:视频DiT结构剪枝+动态路由 ⚡ Quantized Keys Steal Attention:KV缓存量化的Jensen偏差校正 SVDQuant-GPTQ:W4A4量化Wan2.2-I2V省内存59.3% Dasheng AudioGen:首个文生混合音频场景统一模型 今日论文速览 1. OSP-Next:稀疏+量化+RL全栈视频生成1.64x OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning | 北大袁粒组, 华为 | arXiv:2605.28691 关键词:视频生成·稀疏注意力·序列并行·HiF8·北大袁粒组 ⚠️ 前序问题:Diffusion Transformer 在视频生成上已经能出好东西,但 full attention 二次开销死死压住效率。前人方案各做一段(稀疏 / 量化 / 蒸馏),缺一套能同时打通通信、计算、精度的端到端方案——尤其在「多卡序列并行」上和「跨国产硬件」上 本文贡献:OSP-Next:把稀疏注意力 + 序列并行 + 量化 + RL 后训练全栈打通的高效 T2V 框架。Skiparse-2D Attention 在空间维做 token-wise + group-wise 稀疏并保留 FlashAttention 兼容;提出 Sparse Sequence Parallelism (SSP) 用一次 All-to-All 切换稀疏模式,相比 Ulysses SP 通信量降低 75%;HiF8 量化支持 8-bit 联合训练 + 稀疏 fine-tune;Mix-GRPO 后训练弥补稀疏模型的质量回退 实验效果:VBench 总分 83.73% 超越 Wan2.1 基线;5 秒 720P/768P 设置下,H200 单 GPU 加速 1.64×,8 GPU 加速 1.52×;OSP-Next-HiF8 仅掉 0.4% 分数即可在国产昇腾 Ascend 950PR 上拿到 1.69× 和 2.27× 加速——是少见的同时验证国际/国产硬件的视频生成加速方案 批判点评:「稀疏注意力 + 序列并行 + 量化 + RL」四件套全栈打通,每一件单独不算新,但 SSP 把通信量直接打掉 75% 是非常硬的工程数字;跨 H200 + 昇腾的双硬件验证为国产硬件视频生成提供了稀缺的实证。但 Skiparse-2D 是 fixed pattern,对极复杂运动场景的可适配性需要看;Mix-GRPO 与 SSP 联训的稳定性细节披露还可以更多 2. PARE:视频DiT结构剪枝+动态路由 PARE: Pruning and Adaptive Routing for Efficient Video Generation | 港中文 CUHK, 上海 AI Lab, 悉尼大学 | arXiv:2605.27336 关键词:视频 DiT·结构剪枝·动态路由·Wan2.1-14B·上海 AI Lab ⚠️ 前序问题:Video DiT 又宽(block 宽)又深(架构深)又要多步采样,部署成本极高。前人通过压宽/压深/压步数减成本,但都 commit 到固定架构——不能针对单个输入或不同去噪阶段动态调整 本文贡献:PARE:把宽度剪枝和深度自适应路由联合做。宽度上观察到 attention head 自然分化为空间 vs 时序角色,设计区分两类的 importance scoring 避免「运动关键的 temporal head」被过早剪掉;深度上训轻量 router 以 denoising timestep + 视觉内容为条件,动态选择每步执行哪些 block——实现「按输入动态计算」而非静态删除。两阶段 progressive pipeline 先用蒸馏修复宽度剪枝的质量损失,再联合优化 student + router 解耦学习目标 实验效果:在 Wan2.1-14B 上对 I2V 和 T2V 都大幅降低每步算力且保住 VBench 各维度质量;与 step 蒸馏天然可组合进一步加速——把「静态剪枝」时代翻篇成「动态路由按需算」 批判点评:「区分空间/时序 head 重要性 + denoising-step 条件的 block router」两个洞察都直击 Video DiT 的结构性冗余。动态路由实现「按输入按 timestep 算」是 efficient video gen 的下一阶段方向。但 router 本身的训练稳定性、推理时的额外 overhead、以及与 OSP-Next 类静态稀疏组合后的边际收益需要更细 ablation 3. Quantized Keys Steal Attention:KV缓存量化的Jensen偏差校正 Quantized Keys Steal Attention: Bias Correction for KV-Cache Compression in Video Diffusion | 慕尼黑工大 TUM, Tensordyne | arXiv:2605.26266 关键词:视频扩散·KV cache·INT2 量化·Jensen 偏差·长视频 ⚠️ 前序问题:chunk-wise 自回归视频扩散依赖前序 chunk 的 KV cache 避免重复计算,但视频越长 cache 越大,量化 KV 到低 bit 又会显著掉画质。掉画质的根因是什么?以前没人说清楚 本文贡献:首次明确指出根因:softmax 注意力中 exp 的凸性让量化噪声系统性放大「被 cache 的 keys」对注意力的贡献——作者命名为 Jensen bias(量化的 keys 会偷走当前 chunk 的注意力质量)。给出 per-attention-score 的解析修正项,在 expectation 上消除该 bias,只用量化 step size 和 query norm 即可在线算;用二阶 Taylor 近似让额外计算开销可忽略、无需额外显存 实验效果:在 MAGI-1 / SkyReels-V2 / HY-WorldPlay 三个长视频模型上 INT2 量化即可恢复大部分掉的质量、接近 BF16;用 50% 更少显存的 INT2 反而能超过 INT4——长视频 KV cache 压缩拿到新的帕累托前沿 批判点评:把「量化掉画质」从经验问题改写成「Jensen 偏差」这一可解析的统计现象是真正的科学贡献——一行公式校正、零额外显存就拿到 INT2 ≈ BF16 的质量。这种「找根因 + 闭式解」的工作含金量高。但局限在 chunk-wise AR 视频扩散,对非 AR 的全局扩散 KV 压缩不直接适用;与 SmoothQuant 等激活/权重路线的组合策略还可探索 4. SVDQuant-GPTQ:W4A4量化Wan2.2-I2V省内存59.3% Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V | 华中科技大学 HUST | arXiv:2605.27003 关键词:W4A4 量化·Wan2.2·MoE DiT·SVDQuant·华中科大 ⚠️ 前序问题:把大型视频 DiT 推到 W4A4 量化可以省一大块显存,但两道坎卡死:(1) 稀疏的「大幅激活 outlier」;(2) 不同去噪 timestep 的激活分布漂移很大。这两个问题在 Wan2.2-I2V 双专家 MoE DiT(高噪/低噪两个 expert 量化敏感度完全不同)下被进一步放大——单一全局校准策略根本拿不下 本文贡献:Timestep-Aware SVDQuant-GPTQ:(1) SVDQuant-based 低秩 outlier 补偿处理激活大幅 outlier;(2) GPTQ 重建感知残差权重量化;(3) timestep-bin-wise 逐层激活 clipping-ratio 搜索,对每个 MoE expert 独立完成。三件套合起来就是「按 expert + 按 timestep」精细化校准的 PTQ 框架 实验效果:在 OpenS2V-Eval 上相对 BF16 把峰值 GPU 内存降 59.3%,VBench 平均分仅掉 0.9%,Imaging Quality 仅掉 2.3%——证明「expert + timestep 双感知校准」是 MoE 视频 DiT 量化高保真的必要条件 批判点评:把 MoE DiT 量化从「全局校准」拉到「按 expert + 按 timestep」是正确的颗粒度切分——双专家的量化敏感度本来就不同,强行全局必然掉点。59.3% 内存降 + <1% 质量损是漂亮的工业数字。但 PTQ 路线天然依赖 calibration set 质量,长视频/复杂运动的覆盖度需要追踪;与昨天 RT-Lynx 类激活稀疏的组合潜力值得探索 5. Dasheng AudioGen:首个文生混合音频场景统一模型 Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text | 小米, 上海交大 | arXiv:2605.27838 关键词:音频场景生成·multi-view caption·flow matching·小米·DiT ⚠️ 前序问题:音频生成长期被「按域切分」——语音、音乐、音效各有独立模型——做不到从一句描述生成「同时包含人声 + 背景音乐 + 环境音效」的连贯混合音频场景。两大障碍:缺真实混合音频的细粒度监督;声学表示难以同时承载多个并发音频组件 本文贡献:Dasheng AudioGen:首个统一生成混合音频场景的端到端框架。两个核心:(i) structured multi-view captions——把复杂声学场景显式解耦成互补的描述视图,让每个音频层都有细粒度控制;(ii) 高维统一「语义-声学」表示作为共享 latent,注入语义先验加速跨模态训练收敛,同时高维特征空间提供解耦并发声音组件的容量。在此基础上一个简单的 flow-matching DiT 就能跑出端到端高质量音频场景生成 实验效果:在混合音频类别接近真实录音质量,单类型生成(speech/music/SFX)也与专用模型打平——首次把「视觉生成里图文统一」的思路真正落到音频场景上;配套建立音频场景生成的综合评测 pipeline 批判点评:「structured multi-view captions + 高维语义-声学统一 latent」是非常对症的两个设计——把音频域的「描述粒度」和「表示容量」都拉到能容纳混合场景的层次。flow-matching DiT 的工程极简性也很好。但 multi-view caption 的自动构造成本/质量、高维 latent 增加的 DiT 训练开销,以及与商用 ElevenLabs Sound Effect / Stable Audio 2 的端到端对比都需要更细评测 6. HarmoVid:视频肖像重打光和谐化稳定不闪烁 HarmoVid: Relightful Video Portrait Harmonization | Adobe Research, UNC | arXiv:2605.28811 关键词:视频肖像·relight 和谐化·deflicker·alpha mask·Adobe ⚠️ 前序问题:把人物前景视频和谐到目标背景场景(同步阴影、色调、光照强度——relightful harmonization)的硬伤是:视频域没法采集「同一动作不同光照」的成对标注数据。最直接的方案——「按帧调用图像和谐模型」——会带来严重时序抖动(flicker) 本文贡献:HarmoVid 给出整套视频和谐化方案:(i) 全新的 lighting deflickering 模型稳定全局和局部光照 flicker,把「逐帧 image-harmonization」的输出升级成可监督的 paired 视频数据;(ii) 视频扩散模型在 deflickered 真实 + 合成视频上学习;(iii) asymmetric alpha mask conditioning 让模型从真实视频里学到干净的边界 实验效果:在时序连贯、自然度、边界干净度、物理合理光照行为多个维度超越此前所有 image-based 和 video-based 和谐化方法;relighting 表现力也保住——人物视频合成 / 后期合成的标准工业链路被显著升级 批判点评:用「先 deflicker 再训练」绕开「无成对数据」的死结是非常聪明的——deflicker 把单帧图像和谐输出转化成可用监督,是真正的杠杆点。asymmetric alpha mask 也很实用。但 deflicker 模型本身的失败模式(强光/复杂阴影)会传导到下游;与 Adobe 自家的商业级合成工具的真实对比需要更细评测 7. SmartDirector:多关键帧条件电影级视频叙事控制 SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control | 国内视频生成团队 | arXiv:2605.27891 关键词:电影级视频·多关键帧·叙事节奏·两阶段·Director-Gen/SR ⚠️ 前序问题:视频的「叙事质量」决定感知价值,但现有视频生成方法主要靠 text prompt 或首尾帧这类稀疏 condition——对叙事结构和时序节奏的精确控制非常有限,导出不了真正「有 pacing 的电影感视频」 本文贡献:SmartDirector:以多关键帧增强视频生成的叙事能力。支持单镜头、多镜头叙事合成、视频延展三类场景。两阶段:(i) Director-Gen 在低分辨率上以关键帧为条件生成;(ii) Director-SR 利用高分辨率关键帧作为语义锚点把细粒度细节补回来。配套数据管线从电影中精选单镜头/多镜头序列以支撑多关键帧训练 实验效果:在多个评测上大幅超越 SOTA,把视频生成从「按 prompt 出 5 秒片段」升级到「按多关键帧出有节奏的多镜头序列」——电影级视频生成的可控性接近真实创作工作流 批判点评:「多关键帧 + 两阶段先粗后细」直击「电影级叙事控制」的实际痛点——单 prompt / 首尾帧确实远远不够。两阶段把分辨率 vs 叙事控制解耦是合理设计。但「关键帧」的获取成本(人工/AI辅助)和叙事节奏的可量化评测仍是模糊地带;多镜头切换的时空一致性细节需要更深 ablation 8. LoSATok:1280维语义压缩到128维统一audio LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation | 清华深圳, 面壁智能 | arXiv:2605.27840 关键词:audio tokenizer·128 维·语义瓶颈·清华深圳·面壁 ⚠️ 前序问题:音频 tokenizer 是统一「音频理解」和「音频生成」的根基。理解需要高层语义;生成需要语义 + 声学细节。现有统一 tokenizer 在高维连续 latent 里同时编码——这增加了 DiT 生成端的建模负担 本文贡献:LoSATok:观察到 1280 维语义 encoder 特征是可压缩的,引入 Semantic Bottleneck 压到 128 维,并用 time-relation loss 保时序特征一致性;再用「双层级语义监督」同时利用高维/低维语义信号——让 tokenizer 在紧凑 latent 空间里同时承载语义和声学细节 实验效果:在 speech / music / 通用 audio 上 SemBo 保住强低维语义容量,LoSATok 与多个语义表示比较 understanding 性能仍有竞争力;在 DiT 端的 speech / music / audio 生成上一致改进——证明「低维 audio 表示也能同时支撑理解与生成」 批判点评:把「audio 统一 tokenizer」的维度从 1280 砍到 128 是非常硬的容量压缩——若真的不掉理解还能提升生成,那就解掉了「audio 统一表示卡 DiT」的关键梗。time-relation loss + 双层级语义监督是合理工程。但 128 维下声学细节的极限(音乐复杂混音、长 reverb)需要更细测试;与 Dasheng AudioGen 高维路线的端到端比较是行业级议题 9. CosyEdit2:GRPO语音编辑反哺零样本TTS CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS | 南开大学 | arXiv:2605.25930 关键词:语音编辑·GRPO·zero-shot TTS·南开大学·post-training ⚠️ 前序问题:语音编辑和 zero-shot TTS 同源于「prompt 驱动的语音生成」,但语音编辑对「与周围未编辑内容的局部声学一致性」要求严苛得多。SFT 让 TTS 模型获得编辑能力的路线被卡在「成对编辑数据不完美 + 优化信号粗粒度」 本文贡献:CosyEdit2:建立「先 SFT 初始化 → 再 editing-oriented GRPO 后训练」的两阶段框架。GRPO 阶段在「无目标语音」的数据上做,把语音编辑当作 RL 任务优化,让模型从粗粒度匹配走向精细局部声学一致 实验效果:不仅在语音编辑上显著提升,还反哺 zero-shot TTS 能力——揭示「编辑任务 ↔ 合成任务」之间隐藏的相互增益;GRPO 在 audio 域被验证是有效的 post-training 范式 批判点评:把 GRPO 引入 audio 域、并用「编辑反哺合成」这个新角度证明两个任务的深层互助,是非常聪明的科学故事。无目标语音的 RL 设计也比依赖成对数据更可扩展。但 GRPO 的 reward 设计细节、跨语种/多说话人鲁棒性、以及对 prosody 细节的影响需要更系统评测 10. PilotTTS:高德200K小时开源TTS竞品级 PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis | 高德 AMAP | arXiv:2605.27258 关键词:TTS·200K 小时·开源·Q-Former·高德 AMAP ⚠️ 前序问题:SOTA TTS 系统通常需要数百万小时专有数据 + 多阶段复杂架构——这对资源受限的研究团队是几乎跨不过去的门槛。开源社区想自己训出竞品级 TTS 一直缺成熟 recipe 本文贡献:PilotTTS:高德 AMAP 用「最小化架构 + 严格数据工程」做出竞品级轻量自回归 TTS。仅用 200K 小时数据 + 全开源工具处理。两大贡献:(i) 可复现的多阶段数据处理 pipeline(质量评估 + 标签标注 + 过滤);(ii) Q-Former conditioning 紧凑模型架构,通过 cross-sample paired training 解耦说话人身份与说话风格。统一框架支持 zero-shot voice cloning / 11 类情感合成 / 4 类副语言合成 / 14 种中文方言 实验效果:在 Seed-TTS Eval 上 test-en WER 1.50%(最低)、test-zh CER 0.87%;两个测试集说话人相似度都最高(0.862 / 0.815)——超越使用大得多数据集训出来的系统。完整 data pipeline + 预训练权重 + 代码全开源 (AMAPVOICE/PilotTTS) 批判点评:「200K 小时 + 开源工具 + 极简架构」做出超越百万小时专有数据系统的 TTS——是非常有信号量的开源胜利,对中小团队意义重大。Q-Former 解耦说话人/风格的设计也是 clean。但 PilotTTS 主打数据工程而非架构创新,复现门槛仍在「数据处理 pipeline 的工程细节」;与昨天 LongCat-Avatar 类「audio + 视频联合」的下一步集成是开放问题 11. LAIR:扩散模型从成对偏好升级到列表对齐 Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models | 斯坦福, 加州理工 Caltech | arXiv:2605.26491 关键词:diffusion 对齐·listwise preference·advantage-weighted·Stanford·Ermon ⚠️ 前序问题:preference optimization 已成 RLHF 之外对齐 T2I 扩散的高效替代,但现有方法基本都把监督降到 binary pairwise——这在「同 prompt 有多张候选 + 有连续 reward 分数」时严重浪费信息(一个 winner-loser 标签远远没用上 reward 分布) 本文贡献:Diffusion LAIR:reward-aware listwise preference optimization。每个 prompt 把候选组的 reward 分数转成中心化 advantage 权重,再优化「advantage-weighted regression」目标——目标定义在 implicit reward(当前模型 vs 固定参考模型的 denoising-loss 改进量)上,配二次惩罚正则隐式 reward 幅度。结果是同时用所有候选而非选 pair,并保持保守。LAIR 目标在 implicit-reward 空间有 bounded closed-form 最优解,把正则强度 → 偏好更新幅度的关系写清楚 实验效果:在 SD1.5 / SDXL 上对 T2I 生成 / 组合生成 / 图像编辑 benchmark 都超越 strong pairwise preference optimization baseline;为 diffusion 对齐提供「更接近 RLHF reward 信息密度但不需在线 RL」的中间路线 批判点评:把 DPO 类 pairwise 升级到 listwise + 给出 closed-form 最优解的清晰表述是教科书级的方法工作——既保留 offline 偏好优化的稳定性,又用上了 reward score 的全部信息。但 listwise 数据采集成本高于 pairwise(要 N 张同 prompt 候选 + reward 分),实际落地的数据可得性是隐藏成本;与 in-context 在线 RL(GRPO 类)的端到端比较略浅 趋势观察 视频生成进入「全栈加速」时代:稀疏 + 量化 + 并行 + 路由 + RL 多管齐下 — OSP-Next 把稀疏注意力 + Sparse Sequence Parallelism(通信 -75%)+ HiF8 量化 + Mix-GRPO 一锅端,跨 H200 / 昇腾双硬件分别 1.64× / 2.27× 加速;PARE 联合宽度剪枝 + 动态深度路由,在 Wan2.1-14B 上按输入按 timestep 动态算;SVDQuant-GPTQ 把 Wan2.2 双专家 MoE DiT 推到 W4A4 显存降 59.3%——视频生成的工业部署正在被「全栈加速」改写 长视频 KV cache 压缩出现「找根因 + 闭式解」类突破 — Quantized Keys Steal Attention 首次把「量化 KV 掉画质」从经验现象写成 Jensen bias(exp 凸性放大 cache key 贡献)的可解析统计现象,一行公式校正零额外显存,让 MAGI-1 / SkyReels-V2 / HY-WorldPlay 在 INT2 上接近 BF16——把 chunk-wise AR 长视频的 KV 压缩从「玄学调参」推到「有理论的工程」 音频生成统一化:从「按域切分」走向「一句描述出混合场景」 — Dasheng AudioGen 是首个能从一句描述同时生成 speech + music + SFX 混合连贯场景的统一模型,关键是 structured multi-view captions + 高维语义-声学统一 latent;LoSATok 反过来把 1280 维语义压到 128 维统一 tokenizer 反哺 DiT 生成;CosyEdit2 在 audio 域用 GRPO 把「编辑」反哺「TTS」——audio 正在重走视觉「统一模型」的同一条路 视频生成的「叙事控制」与「视频后期」继续拓宽到工业链路 — SmartDirector 把视频生成从「按 prompt 出 5 秒片段」升级到「多关键帧 + 两阶段先粗后细」做电影级叙事节奏控制;HarmoVid 用 deflicker 模型破解「视频和谐化无成对数据」的死结,把视频肖像 relight 和谐化做到工业级稳定——视频生成的可控性从「内容」深入到「节奏」和「后期合成」 开源 TTS / 对齐方法补齐 audio + diffusion 的「最后一公里」 — 高德 PilotTTS 用 200K 小时 + 开源工具 + Q-Former 极简架构做出超越百万小时专有系统的开源 TTS(Seed-TTS Eval 第一);Diffusion LAIR 把 T2I 对齐从 pairwise 升级到 listwise,给出 implicit-reward 的 closed-form 最优解——开源社区在 audio 合成 + diffusion 对齐这两个长期被闭源霸占的方向同时迈出了「竞品级 + 理论级」的双台阶 人工智能炼丹君 整理 | 2026-05-28 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年05月28日
34 阅读
0 评论
0 点赞
2026-05-27
AIGC 每日速读|2026-05-27|美团LongCat-Avatar 1.5开源逼近闭源数…
今日 AIGC 论文速览 今日共 7 篇 · 工业级数字人开源对标闭源 1 篇 · 音视频联合生成评测体系 1 篇 · 视觉生成新范式:层级与通道级 2 篇 · DiT 推理加速与可控编辑 2 篇 · 原生多模态架构路线图 1 篇 重点论文标题列表 LongCat-Video-Avatar 1.5:美团数字人开源对标HeyGen LongAV-Compass:首个分钟级音视频生成评测基准 MRT:20B多层透明图像生成超Qwen CVQ:通道级VQ取代patch挑战传统 RT-Lynx:激活稀疏化让DiT GEMM加速1.55x 今日论文速览 1. LongCat-Video-Avatar 1.5:美团数字人开源对标HeyGen LongCat-Video-Avatar 1.5 Technical Report | 美团 LongCat Team | arXiv:2605.26486 关键词:数字人·美团 LongCat·8 NFE 蒸馏·RLHF·开源对标闭源 前序问题:音频驱动视频生成虽然进展飞快,但要做到「商业级稳定性」仍然难——商用场景下需要的不仅是「唇形对得上」,还要全身时序稳定、长视频身份不漂、多人交互/物体交互不崩,并且部署侧推理 budget 严苛 本文贡献:美团 LongCat-Video-Avatar 1.5:以「系统工程 + 生产就绪」而非架构创新为优先项的开源数字人框架。把 audio encoder 升级到 Whisper Large 并精修训练 recipe,做到准确唇形同步 + 全身时序稳定 + 长视频严格身份一致;通过严格数据清洗 + RLHF 训练,泛化到动漫/动物等风格化域,并原生处理多人交互和物体处理这类真实复杂场景;为工业部署引入 advanced step distillation 把推理压到 8 NFE 实验效果:在 500+ 多样测例 benchmark 上的定量指标 + 严格人评显示 v1.5 在 human-likeness 和专家级质量评估上与 HeyGen / OmniHuman 1.5 / Kling Avatar 2.0 等闭源系统打平甚至超越;开源发布拉近了「学术原型」与「商业级部署」的差距 批判点评:美团摆明用「工程优先」的姿态——Whisper Large + 严苛数据 + RLHF + 8 NFE 蒸馏这套组合拳是教科书级的工业打法,公开报告稀缺。但「commercial-grade」更多靠数据规模和清洗,单一架构 trick 不构成壁垒;对标 HeyGen / OmniHuman 1.5 的具体维度需要更详细的 ablation 才能说服业界,且 8 NFE 与 Kling Avatar 2.0 之间的真实人评差距值得追踪 2. LongAV-Compass:首个分钟级音视频生成评测基准 LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV | 北京大学, Kling, 南大, 上交, 港科广州, 上海 AI Lab | arXiv:2605.26244 关键词:音视频生成·minute-scale·评测基准·T2AV/I2AV/V2AV·北大 前序问题:音视频联合生成正在从「短片段」走向「分钟级长内容」,但现有评测协议几乎都还停留在 5-10 秒文本条件生成;很少支持文本/图像/视频三种条件统一评测,更没说清楚长时间下身份一致性、叙事连贯、音画对齐到底怎么退化 本文贡献:LongAV-Compass:首个面向 minute-long 音视频生成的系统化评测基准。284 个精选测例覆盖 T2AV / I2AV / V2AV 三种输入,按应用场景和生成复杂度组织;统一评测框架结合 MLLM 辅助评估和 DINO-v2 / ArcFace / CLIP / ImageBind 等感知指标,覆盖 20+ 细粒度维度——段内质量、跨段一致性、全局叙事连贯、语义对齐、音画同步全都评 实验效果:在 11 个代表性模型上跑 + 人对齐验证,把当前系统在「保持连贯、保持语义对齐、保持时序一致」上的瓶颈量化呈现;为分钟级音视频生成提供了首个诊断式 testbed——音视频联合生成的「评测短板」正式被补上 批判点评:把音视频联合生成的评测从 5-10s 短片推到分钟级是必要补位——评测落后一直是这个赛道的隐形天花板。20+ 细粒度维度 + MLLM 辅助 + 4 大经典感知模型组合非常综合。但 MLLM 评测本身的偏置是隐忧,DINO-v2/ArcFace/CLIP/ImageBind 的权重融合策略需要更多 ablation;分钟级测例 284 个对开源社区评测可行但工业级评测仍偏小 3. MRT:20B多层透明图像生成超Qwen MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale | 微软亚研 MSRA | arXiv:2605.27235 关键词:多层图像生成·20B·masked region·8 步实时·MSRA 前序问题:层级图像生成与编辑是图像生成走向「可复用 / 可重编辑 / 可组合」的关键能力——类比自然语言里的「逐词编辑」——但在大规模上一直是 underexplored 的空白。多层透明生成 + 多任务统一框架既缺数据也缺方法 本文贡献:MRT:20B 参数 masked region diffusion 模型,专为多层透明图像生成与编辑打造,在 10M+ 多语言设计样本上训练,支持多 aspect ratio 与多语言 prompt。两项核心贡献:(i) 把 text-to-layers / image-to-layers / layers-to-layers 三任务统一到「共享 masked region diffusion」框架,靠 selective token masking 灵活切换层级生成与编辑;(ii) overflow-aware canvas layer 处理边界 inconsistency 并支持半透明背景合成,做出可编辑且延伸至画布外的完整图层。配套 diffusion 蒸馏实现 8 步实时多层生成 实验效果:在三项任务上全面超越此前 SOTA 包括商业系统;user-study 显著优于同期 Qwen-Image-Layered 的 image-to-layers 质量,且推理快 10-100×,activation GPU 显存降低 50-90%——为多层透明图像生成立下新基准 批判点评:把多层图像生成做到 20B + 三任务统一 + 8 步实时是非常工业化的工作量;超越 Qwen-Image-Layered 的人评结果是强信号。但 10M+ 设计样本的语义/版权分布未明,多语言/多 ratio 的真实可控性需要更细 ablation;overflow-aware canvas layer 在极端 aspect ratio 下的稳定性也需要追踪 4. CVQ:通道级VQ取代patch挑战传统 Channel-wise Vector Quantization | 上海创新研究院, 西湖大学, 浙大, 复旦 | arXiv:2605.26089 关键词:视觉 tokenization·channel-wise VQ·CAR·next-channel·DPG 86.7 前序问题:传统视觉自回归(VAR)和 VQ-based 文生图都把图像分成 patch、给每个 patch 分配一个离散 token——但这种 patch 视角本质是「把图像当空间网格」,不太符合人类绘画「先勾结构再补细节」的层次过程。codebook 利用率上不去、增大 codebook 后 collapse 也是顽疾 本文贡献:Channel-wise Vector Quantization (CVQ):新视觉 tokenization 范式,离散化对象从 patch 换到 feature map 的每一个 channel——一张图被表示为「不同层级视觉细节的离散等级」而不是「空间 patch 网格」。基于 CVQ 提出 Channel-wise Autoregressive (CAR):next-channel prediction 替代 next-patch prediction,先勾全局结构再渐进精修细粒度属性 实验效果:CVQ 在 16K+ codebook 规模下实现 100% codebook 利用率(无任何 trick),重建质量显著超过传统 VQ;CAR 在文生图上拿到 DPG 86.7 / GenEval 0.79——证明「按 channel 分层渲染」是 patch-based 视觉自回归的现实替代品 批判点评:把 tokenization 从空间 patch 切换到 channel 维度是真正的范式 rethink——「先结构后细节」也与人类作画过程契合。100% codebook 利用率是很硬的数字。但 channel 抽象层次的物理含义不够清晰(哪个 channel 对应「结构」哪个对应「细节」依赖训练涌现),跨分辨率/跨模态时的稳定性需要进一步验证;与 latest DiT 路线的端到端比较略浅 5. RT-Lynx:激活稀疏化让DiT GEMM加速1.55x RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models | 国内系统研究团队 | arXiv:2605.26632 关键词:DiT 加速·激活稀疏化·N:M sparsity·CUDA kernel·1.55x 前序问题:DiT 推理太贵——量化和蒸馏已经被深挖,但能砍掉将近一半 FLOPs 的「半结构化稀疏(N:M sparsity)」一直 underexplored。原因是大家都在做 weight 稀疏化,但对 weight 做 50% 剪枝会拿掉关键模型容量,让生成质量崩坏 本文贡献:RT-Lynx:核心 insight 是「DiT 的激活本身天然稀疏,比 weight 更适合 N:M 半结构化稀疏化」。提出 paradigm shift——从 weight sparsification 转到 activation sparsification;配 error-compensation 缓解精度损失;并实现针对该场景高度优化的 CUDA kernel 实验效果:线性层平均 1.55× speedup,多个扩散模型上保留原生生成质量同时显著加速;为 DiT 部署提供「除量化和蒸馏外的第三条加速路线」 批判点评:把「稀疏化目标」从 weight 切到 activation 是非常对的洞察——activation 在 inference 时本来就动态出现 zero,强制 N:M 模式损失更小。1.55× 加速 + 不掉质量在 DiT 推理优化里属于实打实的硬增量。但 N:M 模式需要硬件配合(Ampere/Hopper 的 sparse tensor core),消费级 GPU 上的实际收益要打折;激活稀疏化对极长 token 序列(高分辨率视频)下的可扩展性需评测 6. ControlLight:Flow Matching做连续强度可控低光增强 ControlLight: Towards Controllable, Consistent, and Generalizable Low-Light Enhancement | 中科院深圳, StepFun | arXiv:2605.25569 关键词:低光增强·flow matching·连续可控·一致性·中科院深圳 前序问题:现有深度学习低光增强方法都在「有限数据集 + 单一增强目标」上训练——既泛化差又不可控。真实场景里同一张暗图,不同用户/不同场景需要不同的增强强度,但现有方法把它当作一个固定函数 fit 本文贡献:ControlLight:「可控 + 一致 + 可泛化」的低光增强框架。先建大规模真实退化图像数据集,对每张图给出「连续光照强度」标签作为监督;引入 misalignment-aware weighted flow matching loss,让模型在不同控制强度下输出仍然保持图像结构一致——用户可以连续滑动「增强强度」拿到不同结果而不撕裂 实验效果:在多个 benchmark 上超过现有低光增强 SOTA,同时具备「连续强度可控」+ 「真实场景泛化」能力,把低光增强从「一锤子函数」改造成「可调节工具」 批判点评:把 flow matching 用到低光增强 + 连续条件标签 + misalignment-aware loss 三件套是非常 clean 的设计——其中「misalignment-aware」直接 attack 不同强度下结构一致的根因。但「连续光照强度标签」如何从真实退化数据获取本身是个隐藏难题;与最近基于 diffusion 的图像 restoration 在极端低光场景的比较需要更全面 7. Native MM Roadmap:原生多模态架构路线图三分类 Toward Native Multimodal Modeling: A Roadmap | 华威大学, Monash, 港理工, 腾讯优图 | arXiv:2605.25343 关键词:原生多模态·NMM·路线图·three-class taxonomy·腾讯优图 前序问题:多模态建模正在从 modality-agnostic 推理走向 world modeling。早期 late-fusion(拼 encoder + frozen LLM + 输出头)已显疲态,最近转向 Native Multimodal Modeling (NMM)——把各模态从根上集成进同一个 transformer 拿到更强性能。但 NMM 的设计空间目前仍未系统化 本文贡献:为社区提供形式化的 NMM 路线图:(1) 形式化定义「架构原生性」,区分 mid-fusion / early-fusion 与非原生范式;(2) 从「输入-输出对偶」角度把现有 native 模型组织成三类——Multi-to-Text(跨模态理解,纯文本输出)/ Multi-to-Target(场景化生成,如图像/音频/视频生成)/ Multi-to-Multi(对称输入输出的统一建模);(3) 全栈式工业视角剖析从架构协调、海量数据 curation、训练 recipe 到推理部署和评测的端到端 pipeline 实验效果:把当前散乱的「统一多模态架构」研究归结成一份可被工程师和研究员同时参考的路线图——理解和生成在「统一 transformer 范式」下无缝共存是 NMM 的目标终态。对走向 GPT-4o / Gemini 1.5 级原生多模态的开源工作给出系统化方法学 批判点评:「形式化 architectural nativity + 输入输出对偶三分类 + 全栈工业视角」三个层次组织得很清晰——是社区急需的概念清理。但综述类天然有「分类强、实证少」的局限,三类边界(特别是 Multi-to-Target 和 Multi-to-Multi)在最新模型上可能交叉;对未来 1-2 年具体技术抉择的指导力度需要在落地 case 中验证 趋势观察 工业级开源数字人 / 视觉基础模型加速对标闭源 — 美团 LongCat-Video-Avatar 1.5 用 Whisper Large + RLHF + 8 NFE 蒸馏的工业打法,在 500+ 测例上与 HeyGen / OmniHuman 1.5 / Kling Avatar 2.0 等闭源系统打平甚至超越——昨天百度 ERNIE-Image 是文生图,今天美团 LongCat-Avatar 是数字人——国内大厂正在多个垂类同时按下「开源对标闭源」按钮 音视频联合生成评测从「短片」推到「分钟级」 — LongAV-Compass 提供首个 minute-scale 音视频生成评测基准——284 个测例覆盖 T2AV / I2AV / V2AV、20+ 细粒度维度(段内质量 + 跨段一致 + 全局叙事 + 语义对齐 + 音画同步)。和最近 Baton / SpongeBob / StreamChar 等音视频联合生成模型一起,把「短片评测」时代正式翻篇 视觉生成 tokenization / 架构范式正在被 rethink — MRT 把「图像生成」从单层 RGB 推到「多层透明 + 三任务统一 + 8 步实时」;CVQ 把视觉 tokenization 从 patch-wise 切换到 channel-wise,重提「先结构后细节」的人类作画过程并拿到 100% codebook 利用率与 GenEval 0.79——patch + 单层这两个长期假设都在被挑战 DiT 推理加速的第三条路:从「weight 稀疏」转向「activation 稀疏」 — RT-Lynx 指出 DiT 激活本身就稀疏,对 N:M 半结构化稀疏化远比 weight 鲁棒,配合错误补偿和定制 CUDA kernel 拿到 1.55× 线性层加速且不掉质量——量化、蒸馏之外,「激活稀疏化」正式成为 DiT 部署的第三条加速路线 Native 多模态架构走向系统化,可控生成成为最后一公里 — Toward Native Multimodal Modeling 把原生多模态架构形式化为「Multi-to-Text / Multi-to-Target / Multi-to-Multi」三分类,给出从架构到训练到部署的全栈 roadmap;ControlLight 用 misalignment-aware flow matching 把低光增强做成「连续强度可控」工具——「统一架构 + 可控生成」正在收敛成下一代生成模型的双轨 人工智能炼丹君 整理 | 2026-05-27 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年05月27日
58 阅读
0 评论
0 点赞
2026-05-25
AIGC 每日速读|2026-05-25|字节Bernini让MLLM规划DiT渲染视频
今日 AIGC 论文速览 今日共 11 篇 · 统一视频生成与编辑 2 篇 · Unified Audio 与音乐生成 2 篇 · 文生图基础架构与高清解码 3 篇 · 视频世界模型与可控生成 2 篇 · 高效推理与长上下文 2 篇 重点论文标题列表 Bernini:MLLM做语义规划DiT做像素渲染 StepAudio 2.5:单一音频基础模型三任务全SOTA ⚡ PiD:512潜变量→2048图像 <1秒解码 SCOPE:首个跨游戏FPS世界模型zero-shot迁移 DecQ:8个查询+3.9%算力把RAE重建拉满 今日论文速览 1. Bernini:MLLM做语义规划DiT做像素渲染 Bernini: Latent Semantic Planning for Video Diffusion | 字节跳动 Bernini Team | arXiv:2605.22344 关键词:统一视频生成·MLLM 规划·DiT 渲染·SA-3D RoPE·CoT ⚠️ 前序问题:MLLM 擅长跨模态推理与语义对齐,扩散模型擅长高保真像素合成——但目前两条路线要么混入一个端到端 unified model(损失各自强项),要么靠 adapter 松耦合(语义传递不充分)。视频生成与编辑亟需一种新分工,能把 MLLM 的语义规划能力和 DiT 的像素渲染能力同时榨干 本文贡献:提出 Bernini 统一视频生成与编辑框架:MLLM 规划器直接在 ViT embedding 空间预测目标语义表征(不是文本),DiT 渲染器以这个语义 plan 为主条件,文本特征 + 编辑场景下的源视频 VAE 特征做辅助引导。规划器和渲染器分开训练 + 轻量协同微调,保住各自预训练能力。引入 SA-3D RoPE(Segment-Aware 3D RoPE)处理多视觉输入,并在规划器中引入 CoT reasoning 把「理解」翻译成「生成指令」 实验效果:在多项视频生成与视频编辑 benchmark 上达到 SOTA;编辑任务上 MLLM 的预训练理解力可直接迁移为强泛化能力——挑战性编辑场景下尤其明显 批判点评:「MLLM 当规划器、扩散模型当渲染器」是非常合理的下一代统一架构分工——既避免了端到端 unified model 的能力打架,也比 adapter 路线传递了更丰富的语义。但论文用 ViT embedding 而非文本作为接口让组件互换性变差,规划器换到其他 MLLM 需要重新对齐;SA-3D RoPE 在多视觉输入场景的扩展上限(如 5+ 参考图)未充分测试 2. StepAudio 2.5:单一音频基础模型三任务全SOTA StepAudio 2.5 Technical Report | 阶跃星辰 StepFun | arXiv:2605.23463 关键词:Unified Audio·ASR·TTS·实时对话·RLHF ⚠️ 前序问题:Unified audio-language model 是大趋势,可现实是它们在 ASR/TTS/实时对话三件事上常常打不过专用系统——语义理解、生成合成、低延迟对话天生有结构与目标差异。如何让一个 backbone 同时压过三个专用 SOTA 是开放挑战 本文贡献:StepAudio 2.5 把「模态接口统一」与「目标分化」分两层处理:文本与音频共享多模态表征空间作为底座,任务特化由「数据构造 + 优化目标 + 解码策略」三件事决定。重头戏是把 post-training 从标准 SFT 升级为「任务定制 RLHF」——ASR 用可验证 multi-token decoding 提速、TTS 用 preference-based RLHF + context-rich supervision 保表现力、Realtime 用 generative reward modeling 框架优化人格一致与低延迟 实验效果:在 ASR / TTS / Realtime 三个方向的标准 benchmark 上同时达到 SOTA,证明「单一音频语言基础模型在三个目标上压过专用系统」是可行的——RLHF 是统一 backbone「分化部署」的关键钥匙 批判点评:把「目标分化交给 RLHF」是非常聪明的分工——既保住统一架构的训练效率,又给三个任务留出独立优化空间。但论文的 RLHF 训练成本巨大且对各任务的奖励信号设计依赖深,落地复现门槛高;与 GPT-4o / Gemini 这种闭源多模态对话模型的实时对话直接对比缺失 3. PiD:512潜变量→2048图像 <1秒解码 PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion | NVIDIA, 多伦多大学, Vector Institute | arXiv:2605.23902 关键词:Pixel Diffusion·高清解码·DMD2 蒸馏·6× 加速·RAE ⚠️ 前序问题:T2I 主流采用「潜空间扩散 + decoder 还原像素」两段式,但 decoder 是重建优化的——只学逆向 encoder,并不主动合成细节。当目标分辨率拉到百万级(megapixel),decoder 的计算变得非常昂贵,画质上限也被牢牢锁死 本文贡献:提出 PiD(Pixel Diffusion Decoder):把「latent → pixel」decoding 改写成「条件像素扩散」,统一了解码与超分两步。直接在高分辨率像素空间去噪,原生支持 4× / 8× 上采样;通过轻量 sigma-aware adapter 把含噪 latent 注入像素扩散 backbone,使 PiD 能在 latent 还没去噪完时提前接手,让上游 latent diffusion 提前停步。再用 DMD2 蒸馏把推理压到 4 步。同时支持普通 VAE latent 和语义 latent(SigLIP/DINOv2,给 RAE 模型用) 实验效果:512×512 latent 解码为 2048×2048 像素在消费级 RTX 5090 上 <1 秒(峰值 13GB),在 GB200 上最快 210ms——比 cascaded diffusion-based super-resolution 快约 6×,视觉保真度也更好。直接把「高清文生图」的推理成本拉到接近实用区间 批判点评:把 decoder 从「重建优化」改为「条件生成优化」是非常正确的方向——这是 RAE 路线之外又一条反思 latent decoding 的工作。<1 秒 2K 解码 + 6× 加速是少有的同时省时又提质的硬数字;但 PiD 与原生 pixel-space 扩散(如 PixArt-Σ pixel)之间的对比仍未完全展开,DMD2 4-step 蒸馏的稳定性如何随分辨率扩展仍需观察 4. SCOPE:首个跨游戏FPS世界模型zero-shot迁移 SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models | 国科大 UCAS-Terminus AI Lab, 新加坡国立 NUS, 浙江大学, 港科大广州 | arXiv:2605.23345 关键词:FPS 世界模型·视频扩散·跨游戏迁移·CrossFPS·per-pixel 条件 ⚠️ 前序问题:FPS(第一人称射击)游戏的可玩世界模型,每一帧都要响应高频重叠的多种操作信号,同时还不能扰动屏幕中无关区域。已有方案要么全图注入动作信号(粒度太粗),要么只在单款游戏上训(无法跨游戏迁移) 本文贡献:观察到 FPS 操作具有「空间选择性」:开火/换弹只影响武器周围的局部 scope,而镜头/移动指令影响全局背景。SCOPE 在预训练视频扩散 transformer 的每个 block 插入条件模块,把特征重塑成 per-pixel 时序序列,每个位置根据本地视觉内容计算自己的动作响应——不依赖任何分割标注就把 in-scope 效果与 out-of-scope 生成分开。同时构建 CrossFPS:首个多游戏 FPS 数据集(7 款游戏、69K 帧对齐 10-DoF 控制信号片段),让模型学到游戏无关的视觉-动作映射 实验效果:训得的世界模型在多个未见场景上 zero-shot 迁移成功,动作响应度强、scope 分离精确,跨游戏泛化效果优——首次让 FPS 世界模型走出「单游戏专门训」的范式 批判点评:「scope 局部 vs 全局」的解构是非常贴近 FPS 物理直觉的观察,per-pixel 时序条件注入比全图条件优雅得多。CrossFPS 数据集让 FPS 世界模型有了 ImageNet 时刻的基础;但 10-DoF 控制信号离真实玩家的复杂连招仍有距离,对长 horizon 一致性(数百帧战斗)效果论文未充分披露 5. DecQ:8个查询+3.9%算力把RAE重建拉满 DecQ: Detail-Condensing Queries for Enhanced Reconstruction and Generation in Representation Autoencoders | 复旦大学, 上海 AI Lab | arXiv:2605.22777 关键词:RAE·DINOv2·细节 Query·重建生成解耦·3.9% 算力 ⚠️ 前序问题:Representation Autoencoder(RAE,把视觉基础模型当 tokenizer encoder)能让 latent diffusion 收敛更快、生成更好——但 VFM 必须冻住,限制了细粒度重建能力。如果反过来微调 VFM 解锁重建,又会破坏预训练语义空间、拖累生成。重建 vs 生成长期是 trade-off 本文贡献:DecQ 思路简单优雅:用一组轻量「detail-condensing queries」通过 condenser 模块从中间层 VFM 特征里抽取细粒度信息,再把这些 query 拼到 decoder 端辅助重建,同时在生成建模阶段与 patch token 一起被预测。深浅两层信息都被聚合,无需碰 VFM 主权重,重建-生成 trade-off 被巧妙绕开 实验效果:DINOv2-based RAE 上仅加 8 个 query 和 3.9% 额外算力,PSNR 从 19.13 dB 提到 22.76 dB(重建端 +3.6dB);生成端比 RAE 收敛快 3.3×,无 guidance FID 1.41、有 guidance FID 1.05——重建与生成同时提升且开销可忽略 批判点评:「不碰冻结 VFM、只加一组 query 当辅助通道」是非常 ROI 高的设计,是「冻结 vs 微调」之外的第三条路。从 PSNR / FID 数字看是确凿的正向贡献;但 8 个 query 是否够撑起更大分辨率(512+)下的细节量级仍待验证,与最新 token-merging / FlexQuery 等类似工作的对比略浅 6. SEGA:DiT训练免微调按频段动态缩放注意力 SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers | 多伦多大学, Vector Institute | arXiv:2605.22668 关键词:DiT·分辨率外推·RoPE·训练免微调·频段自适应 ⚠️ 前序问题:DiT 在训练分辨率之外生成时画质显著掉,目前 training-free 方案常用 RoPE 外推 + 注意力 scaling 修正,但 scaling 都是一刀切——对 RoPE 各分量(含不同频段)施加同样的缩放,导致「全局结构 vs 细节恢复」此消彼长 本文贡献:提出 SEGA:完全 training-free,根据每个去噪步 latent 的空间-频段结构,动态地对 RoPE 不同分量分别 scaling。低频分量保结构、高频分量恢细节,按内容自适应分配——而不是固定常数 实验效果:多个目标分辨率上一致提升 DiT 高分辨率合成质量,超过现有 training-free 基线;不需要重训,可即插即用 批判点评:「不同频段差别 scaling 而不是常数」是经过谱分析后的小而正确的改进,对 DiT 高清生成是廉价收益。但论文主要在 SD3/FLUX 系列上验证,更激进外推倍率(如 4×)下是否仍稳健没充分展开;与 ScaleCrafter / FreeU 等同类训练免微调方案的端到端定量对比较少 7. Gated DeltaNet-2:线性注意力擦写解耦1.3B全面胜出 Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention | NVIDIA | arXiv:2605.22791 关键词:线性注意力·Gated DeltaNet·擦写解耦·长上下文·NVIDIA ⚠️ 前序问题:线性注意力把无界 softmax cache 压缩成固定 recurrent state,难点不在于「忘掉什么」而在于「怎么编辑这个压缩记忆而不打乱已有联系」。已有 Delta-rule 模型用 scalar gate 同时控制 key 端的擦除和 value 端的写入——一个标量做两件事,能力被绑死 本文贡献:Gated DeltaNet-2(GDN-2)泛化了 Gated DeltaNet 与 KDA:把 erase 与 write 解耦成两个 channel-wise gate(擦除门 b_t / 写入门 w_t);两者塌缩到同一 scalar 时退化为 KDA,再叠加 decay 塌缩则退化为 Gated DeltaNet。配套给出 fast-weight 更新视角、chunkwise WY 算法(channel-wise decay 吸收到非对称 erase 因子)、gate-aware backward——保住了高效并行训练 实验效果:1.3B 参数在 100B FineWeb-Edu tokens 上训完,在语言建模/常识推理/检索上综合超过 Mamba-2 / GDN / KDA / Mamba-3 变体;在 RULER 长上下文 needle-in-a-haystack 多 key retrieval 上优势最大,纯循环与混合架构都强。代码开源 批判点评:「擦除/写入解耦」是 linear attention 设计上一个本应早被做的细节修正——一个 gate 控两件事本来就是工程妥协。GDN-2 是少有「同时改写规则又保住并行训练」的设计;但论文聚焦语言建模,对视觉生成场景(视频扩散 / 多模态 backbone)线性注意力替换的实际收益尚需后续验证,1.3B 规模在 7B+ 是否仍领先 Mamba-3 也是开放问题 8. Geo-Align:首个相机控制视频生成RL几何奖励 Geo-Align: Video Generation Alignment via Metric Geometry Reward | 中科大, 上海 AI Lab, 浙大 | arXiv:2605.23903 关键词:相机控制视频·RL 对齐·metric 3D 奖励·video re-rendering ⚠️ 前序问题:相机控制视频生成(video-to-video re-rendering)此前几乎全靠合成数据上的 SFT,真实多视角同步视频极度稀缺,模型在真实 OOD 视频上对物理尺度与相机轨迹的遵循非常差——「能拍但不像」一直没解决 本文贡献:Geo-Align 首次为相机控制视频再渲染提出 RL 框架:基于预训练模型,用「尺度感知感知奖励」对齐。具体而言引入 metric 3D estimator 从生成视频中抽取精确相机轨迹,对 rotation / translation 偏差显式惩罚;数据 pipeline 精心设计——以真实条件视频 + 合成数据派生的目标相机轨迹训练,消除对 paired data 的依赖 实验效果:相机可控性与视觉保真度同时优于现有 SFT 基线,验证 metric geometry 奖励是补救「合成 → 真实」迁移损耗的有效手段——是 video re-rendering 的下一步 批判点评:把 video re-rendering 从 SFT 推进到 RL + 几何奖励是必然的下一步,metric 3D estimator 当 reward model 思路漂亮;但 metric 3D estimator 本身的精度上限直接决定奖励质量,对动态场景(人物快速运动、遮挡)的估计误差如何不被奖励放大需要后续验证 9. LMDM:消费级笔记本跑实时音乐扩散 Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators | UC San Diego, CMU, Mila, Northeastern | arXiv:2605.22717 关键词:音乐扩散·实时生成·KV Cache·ARC-Forcing·consumer GPU ⚠️ 前序问题:现在最强的「实时流式音乐生成」走的是 discrete-AR(离散自回归)路线,训练和推理都要工业级算力。开源社区强势的音频扩散是双向、非流式的——理论上不能做实时演奏 本文贡献:LMDM 重新审视 block-wise outpainting 扩散管线:识别出诸多推理瓶颈是它比 discrete-AR 慢的根因,提出 block-wise KV Caching 补回;进一步引入 ARC-Forcing post-training,无需 RL 或 reward model 就能稳健做对齐,缓解 error accumulation 实验效果:扩散模型首次在推理复杂度上反超离散 AR 路线,能在消费级游戏本上本地实时跑——支持文条件生成、草图条件音乐合成、jamming;论文还展示了 LMDM 作为「generative delay」在真人音乐家即兴演奏中的真实艺术家-AI 合作 批判点评:把扩散从「非流式」拉到「实时演奏」是开源社区音频生成的关键一步——把 KV Cache 思路从语言模型迁过来很合理。但和 Suno/Udio 这类闭源系统直接对比缺失,对极长(>10 分钟)持续演奏的稳定性论文未深入讨论;ARC-Forcing 替代 RLHF 的 robustness 在不同流派/复杂编曲下的表现仍需更多实验 10. ETCHR:图像编辑器即多模态推理助手 ETCHR: Editing To Clarify and Harness Reasoning | 上海 AI Lab, 港中文 | arXiv:2605.23897 关键词:Think with Images·图像编辑·推理增强·VLM 奖励·MLLM 解耦 ⚠️ 前序问题:MLLM「think with images」范式越来越火,但 toolkit 路线被固定动作束缚,unified 路线产生的中间图常常很噪。如果想用「专用图像编辑器」当 MLLM 的视觉推理助手,会遇到两个 gap:(1) language-side,被动指令跟随的编辑器无法把抽象问题映射成合适的视觉变换;(2) generation-side,推理深度增加时编辑正确性快速退化 本文贡献:ETCHR 提出一个「question-conditioned, reasoning-aware」图像编辑器,与下游 understanding model 完全解耦。两阶段训练:第一阶段 Reasoning Imitation(在编辑轨迹上 SFT),第二阶段 Reasoning Enhancement(用 VLM-derived 奖励同时优化编辑正确性 + 下游推理准确率)。解耦让 ETCHR 可以 plug into 任意开闭源 MLLM 而无需重训 实验效果:覆盖细粒度感知/图表理解/逻辑推理/拼图复原/3D 理解 5 类任务,Pass@1 平均提升:Qwen3-VL-8B +4.82(55.95→60.77)、Gemini-3.1-Flash-Lite +5.47(65.08→70.55)、1T MoE Kimi K2.5 +4.61(76.55→81.16)——证明 reasoning-aware editor 通用有效 批判点评:「编辑器作为 MLLM 的可插拔视觉推理助手」是非常正确的下一步分工,比 toolkit / unified 两条路线都更模块化。但 ETCHR 训练强依赖 VLM-derived rewards,奖励信号的偏差可能复制到编辑器;与最新 unified MLLM(如 GPT-4o Image / Bagel)端到端的 think-with-image 能力对比还需要更全面 11. Swift Sampling:泰勒展开找时序惊奇帧0.02倍开销 Swift Sampling: Selecting Temporal Surprises via Taylor Series | Microsoft Research India | arXiv:2605.22678 关键词:长视频·帧选择·预测编码·Taylor 展开·训练免微调 ⚠️ 前序问题:长视频里大部分帧冗余,关键信息藏在「时序惊奇」——视觉特征偏离了预测轨迹的瞬间。已有 training-free 帧选择要么靠辅助网络(额外算力),要么靠视频特化的超参(不通用) 本文贡献:受脑科学预测编码启发,Swift Sampling 把视频建模成视觉 latent 空间里可微的轨迹,计算 velocity 和 acceleration,用 Taylor 展开预测后续帧的「预期路径」。偏离预期最猛的帧 = 时序惊奇帧 = 应被采样的关键帧。训练免微调、几乎零额外开销 实验效果:比基线只多 0.02× 算力开销(比领先方法的 overhead 还低 30×)。3 个长视频 QA benchmark + 10 个下游任务上一致优于 uniform sampling 与其他 query-agnostic 基线;长视频小预算场景下提升最大(+12.5 分准确率) 批判点评:「预测编码 → Taylor 外推 → 惊奇帧」的链条简洁且物理直觉强,几乎零成本是工程上极少见的免费收益。但 Swift Sampling 是 query-agnostic 的——任务相关的关键帧(需要 query-conditional)仍是它的盲区,未来与 query-aware 方法的组合空间巨大 趋势观察 统一架构出现新分工:MLLM 当语义规划器,扩散/像素模型当渲染器 — Bernini 用 MLLM 在 ViT embedding 空间预测目标语义,DiT 拿这个 plan 当主条件渲染像素;ETCHR 把编辑器训成 MLLM 可插拔的视觉推理助手——「端到端 unified」之外,「语义规划 + 像素渲染」的分工路线正在成型。这条路线把各组件的预训练能力都榨干,比 adapter 更深、比端到端更模块化 像素空间扩散解码器替代传统 VAE:高清/高效解码的新范式 — PiD 把 latent→pixel 改成条件像素扩散,512 latent <1 秒解到 2048 像素(消费级 RTX 5090),比 cascaded SR 快 6× 且画质更好;DecQ 不动 RAE 冻结 VFM 只加 8 个 query + 3.9% 算力就让重建 PSNR +3.6dB、生成收敛快 3.3×——「decoder 该重建还是该生成」的争论开始让位给「decoder 应同时承担解码与上采样」的新范式 Unified Audio 模型靠任务定制 RLHF 同时压过专用系统 — StepAudio 2.5 把 ASR/TTS/Realtime 三件事架在共享 backbone 上,让任务分化交给「数据 + RLHF reward + 解码策略」三件套——ASR 用可验证 multi-token decoding、TTS 用 preference RLHF、Realtime 用 generative reward modeling,最终三项 benchmark 同时 SOTA。证明「unified 不必妥协」的关键钥匙是 RLHF 视频生成对齐从 SFT 走向几何/物理约束的强化学习 — Geo-Align 首次给相机可控视频再渲染加 RL:用 metric 3D estimator 抽取相机轨迹,对 rotation/translation 偏差显式给奖励,不再依赖稀缺的 paired 真实多视角数据。SCOPE 的 per-pixel 时序条件设计也隐含「空间选择性」的物理直觉——视频生成的对齐方式开始引入几何/物理约束 推理期免训练优化在文生图/长视频/长上下文遍地开花 — SEGA 给 DiT 做按频段自适应注意力 scaling 解决高分辨率外推;Swift Sampling 用 Taylor 展开找时序惊奇帧选关键帧(0.02× 开销 +12.5 分);GDN-2 把线性注意力的 erase/write 解耦改善长上下文检索——「免训练 + 信号利用」的范式从图像扩散扩到视频/语言全场景,给落地侧带来快速收益 人工智能炼丹君 整理 | 2026-05-25 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年05月25日
74 阅读
0 评论
0 点赞
1
2
粤ICP备2021042327号