首页
应用
关于
Search
1
Pytorch DDP
2,482 阅读
2
Pytorch 常见问题
1,515 阅读
3
视频时序切分
1,344 阅读
4
中文场景下的CLIP图文预训练
1,044 阅读
5
Semi-Supervised + Noisy Label
1,030 阅读
AIGC
AIGC Daily Papers
AIGC Fundamentals
其他
职场经验复盘
多模态理解
购房/投资
阅读
广告
Segmentation
LeetCode
Pytorch
Python
Shell
C++
常用链接
Search
标签搜索
AIGC
人工智能
论文速读
ai
视频生成
DiT
对齐
蒸馏
扩散模型
attention
transformer
图像生成
视频编辑
稀疏注意力
diffusion
基础知识
多模态
文生图
NVIDIA
llm
Jefxiong
累计撰写
207
篇文章
累计收到
8
条评论
首页
应用
栏目
AIGC
AIGC Daily Papers
AIGC Fundamentals
其他
职场经验复盘
多模态理解
购房/投资
阅读
广告
Segmentation
LeetCode
Pytorch
Python
Shell
C++
常用链接
页面
关于
搜索到
127
篇与
人工智能
的结果
2026-08-07
AIGC 每日速读|2026-08-07|Meta实测视觉懒惰生成数据只留5%反而更强
今日 AIGC 论文速览 今日共 10 篇 · 统一多模态预训练与Tokenizer 2 篇 · 统一音视频生成 3 篇 · 生成后训练与奖励对齐 3 篇 · 自回归与长视频生成 2 篇 重点论文标题列表 MM-Pretraining Physics(Meta FAIR·Reality Labs·牛津大学):生成数据只留5%反而更强 Vorch-Omni(Vorch Team):一个模型吃下30种音视频配置 Vorch-Streamer(Vorch Team·同济大学·哈工大深圳·上海交大):27.12FPS边说边生成数字人 Vorch-Director(Vorch Team·浙江大学):22个镜头分钟级不掉线 KVAE(Kandinsky Lab):音图视三件套PSNR多涨1dB 今日论文速览 1. MM-Pretraining Physics:生成数据只留5%反而更强 Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes | Meta FAIR·Reality Labs·牛津大学 | arXiv:2608.05000 关键词:统一多模态预训练,视觉懒惰,MoE,数据配方,Meta FAIR 前序问题:统一多模态预训练已经成为共识路线,但语言、视觉理解、视觉生成三种能力在联合训练时到底怎么互相传递知识、什么时候协同什么时候打架、视觉数据该在训练的哪一刻加入,业界基本靠经验和直觉,公开的对照实验很少。 本文贡献:用严格的单变量控制实验系统拆解统一预训练,给出四条结论:一是知识流动高度不对称,语言是万能助推器、视觉理解是生成的强先验,而生成几乎不反哺前两者;二是数据复杂度决定模态是协同还是竞争,共享注意力与归一化、拆开前馈层的架构最有利于协同,且换视觉 tokenizer 结论不变;三是必须早期统一、同步联训,晚接视觉会触发作者命名的「视觉懒惰」;四是把这些结论合成非对称数据配方 L70/U25/G5(语言 70%、理解 25%、生成 5%)。 实验效果:在 13.5B MoE(256 专家、每 token 激活 16 个、其中 2 个模态专属,激活参数 1.5B)上用 2T token 做单变量对照:非对称配方相比均衡配方 L50/U25/G25,语言准确率 54.31% 对 52.86%,视觉理解均值 43.08 对 41.42,GenEval 从 0.467 升到 0.482、DPG 从 0.676 升到 0.689——生成 token 少了五倍,文图对齐反而更好,5 万张图的 FID 5.234 与均衡配方的 5.131 基本持平。视觉懒惰有四路机械证据:语言预热从 0B 拉到 800B token 后,视觉 FFN 的训练态与推理态激活幅度、图像包裹 token 的嵌入范数、推理时落在图像 token 上的注意力占比全线下滑。 批判点评:这类「控制变量做到底」的实证研究比又一个新架构更稀缺,尤其「生成数据只给 5%、生成指标反而更好」直接冲击了「想让模型会画就多喂图」的直觉,而视觉懒惰给「强 LLM 接视觉后仍然看图犯低级错误」提供了可测量的解释。局限也明显:结论建立在 Meta 自有数据与 RAE 编码器体系上,2T token 的对照跑一次成本极高,外部团队几乎无法复现;L70/U25/G5 是在这套设定下搜出来的,换数据分布未必照搬;GenEval 0.482 本身离商用文生图还有距离,说明配方优化的是预训练起点而非最终生成力。 2. Vorch-Omni:一个模型吃下30种音视频配置 Vorch-Omni: Multi-Task Orchestration of Sight and Sound | Vorch Team | arXiv:2608.05803 关键词:统一音视频生成,任意条件到任意输出,LTX-2.3,流匹配DiT,多任务 前序问题:文生视频、参考图生成、视频续写、指令编辑、视频配音这些能力今天大多各自训一个模型。一旦把目标视频、源视频、参考图、参考音频塞进同一条序列,模型就分不清哪段该生成、哪段要原样保留、哪段只提供身份或风格;加上音频既可能是条件又可能是输出,任务空间会成倍膨胀。 本文贡献:把所有任务统一成「任意条件到任意输出」的一次条件去噪:每个任务由视频目标、视频条件、音频目标、音频条件四个集合描述,token 级条件掩码决定谁保持干净、谁被去噪,任务标识区分目标/源/主体参考/音频参考/编辑条件,位置类型再区分「与目标共享连续时间轴」(如续写)和「独立参考网格」。视觉条件走两条互补通路——视觉语言模型读采样帧加文本指令给语义,视频 VAE 把完整条件编码成干净 latent 保结构。底座是单个 LTX-2.3 音视频流匹配 DiT(48 层,视频流 32 头×128 维、音频流 32 头×64 维),新任务只改配置不改结构。 实验效果:同一套权重覆盖 10 类以上任务、30 多种条件—输出组合,包括文生视频、文生音视频、图像与参考驱动生成、时间续写、音频驱动生成、视频转换以及单模态和跨模态编辑。人评部分组织 527 组样本、11361 条维度级判断与 Wan 2.7 盲测:81.4% 的判断认为两者相当,Good 与 Bad 各占 7.7% 和 8.0%,总体净胜率 -1.9%;但在最考验统一能力的维度上净胜率为正——音频指令遵循 +7.1%、参考一致性 +6.6%、音画同步 +5.9%、音频质量 +3.3%。 批判点评:把任务差异全部下沉到「token 角色 + 位置类型」的配置层、而不是每个任务加一个分支,是目前统一音视频模型里比较干净的一种抽象,作者也没有粉饰总体净胜率是负的这一点。但代价同样清楚:底座是别人的 LTX-2.3,全参数微调 5 万步,单卡 batch 只有 1;总体 -1.9% 意味着「统一」眼下换来的是特定维度的优势而非全面超越;作者自己也承认长时程一致性、精细局部编辑和多语言多说话人语音仍未解决。Vorch Team 未公开所属机构,权重与代码也没给出时间表。 3. Vorch-Streamer:27.12FPS边说边生成数字人 Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming | Vorch Team·同济大学·哈工大深圳·上海交大 | arXiv:2608.05663 关键词:实时流式生成,数字人,Self Forcing,DMD蒸馏,语音规划token 前序问题:实时数字人要求边生成边播放,模型只能看历史不能看未来。把预训练的双向音视频扩散模型改成因果流式有两个坎:一是自回归复用自己生成的块会累积曝光偏差,几十秒后身份漂移、画面糊掉;二是给定一整段要说的话,因果生成器在只有局部上下文时并不知道当前这一块该说到哪一句。 本文贡献:在 22B 的 LTX2.3 音视频底座上做三阶段后训练。先用同一个底座合成 8 万条 12–21 秒的数字人音视频语料,保证监督信号与初始化同源;再以样本级混合 Teacher Forcing 与 Diffusion Forcing 训出 20 步因果短流式模型;最后做长时程 Self Forcing,让因果学生在完整 12–21 秒时域上自我 rollout,冻结的原双向模型作为 real-score 教师做 DMD 蒸馏,把双向模型的画质迁移到因果长轨迹上,同时把去噪压到 4 步。语音进度用外部语言模型预测 25 Hz 的离散「说话规划 token」——与 LTX 音频 latent 同频率,因此每个因果块都能拿到属于自己那一秒的语音内容。 实验效果:768×512、24 FPS 设定下,单张 H200 上端到端 DiT 吞吐 27.12 FPS,是评测中唯一越过 24 FPS 实时播放线的原生 T2AV 方法,且不需要外部音频或参考首帧。约两分钟的连续 rollout 在 0/30/60/90 秒采样帧上仍保持身份与场景一致,音唇同步 Sync-C/Sync-D、词错率、VBench2 身份与人体结构指标均有竞争力。推理用 3+1 因果窗口(三个常驻前缀块加最近一块)。训练侧第二阶段 64 张 H200 跑 6000 步,第三阶段 32 张 H200 跑 1000 步。 批判点评:「实时」这次是有明确定义的:24 FPS 播放线、单卡、四步去噪、有界上下文,比笼统说加速可信得多,25 Hz 说话规划 token 也确实解决了因果生成器不知道该说哪句的具体问题。但 27.12 FPS 建立在 H200 和 768×512 这个不算高的分辨率上,换消费级显卡或上 1080p 结论就不成立;训练语料是底座自己合成的 8 万条,风格和多样性都受限于教师,真人视频上的泛化没有验证;两分钟的 rollout 也还不是「无限长」。 4. Vorch-Director:22个镜头分钟级不掉线 Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification | Vorch Team·浙江大学 | arXiv:2608.05776 关键词:长视频续写,曝光偏差,噪声感知残差,多镜头故事,ST-Bench 前序问题:分钟级音视频靠自回归续写实现:把长视频切段,第 t 段以前面已生成的画面和声音为条件。但训练时喂的是干净的真值历史,推理时喂的是模型自己带着漂移、模糊和音画错位的输出,误差一段段滚雪球,最终身份跑偏、画面变平、声画不同步。已有做法把预测残差当作合成噪声注入历史来缩小这个落差,但都用一个与噪声水平无关的固定强度。 本文贡献:作者观察到残差修正是否有效,关键取决于残差是在流匹配的哪个噪声水平上产生的。于是把每条残差连同它产生时的噪声水平 σ 一起存下来,训练某个 σ 步时只采样同一噪声区间的残差并缩放到该区间,让注入的错误和去噪过程真正对齐;这样既保留了 teacher forcing 的训练效率,又造出接近推理分布的历史。配套设计包括始终不加噪的干净锚定窗口(clean sink),以及区分历史视频、参考图像、目标视频的任务嵌入,支持多镜头、多主体、参考引导的长时音视频生成。 实验效果:在 30 个用例、每例约 10 个镜头的多镜头故事基准 ST-Bench 上,用统一评测器重跑全部方法(不混用已发表数字),四项跨镜头一致性指标全面领先,ViCLIP 达 0.7887 而最强基线只有 0.5900,两项长程指标 ARC 与 Reappear 同样领先;对比对象包括 StoryDiffusion+Wan、StoryMem、HoloCine、Memento。另在 200 例的 UnityShots 上跑了 T2V 与 R2V 两种设定,并自建带同步语音、音乐和音效的长音视频基准,每例连续 22 个镜头达到分钟级,配套提出质量漂移和锚定相对一致性两个长程退化指标。 批判点评:「残差要按噪声水平配对注入」是个很具体也很容易被忽略的细节,作者还老老实实用同一评测器重跑所有基线,避免了各家用各自设定报数字的常见问题,新增的长程漂移指标也补上了平均分掩盖退化的缺口。但基线的画质与文本一致性其实并不输,领先主要集中在跨镜头一致性这一类指标上;ViCLIP 0.7887 对 0.5900 的巨大差距有多少来自方法本身、多少来自 LTX-2 底座与基线不同,论文没有拆开;自建基准由自己定义、自己评测,说服力要等第三方复现。 5. KVAE:音图视三件套PSNR多涨1dB KVAE: Family of Tokenizers for Multimodal Generative Models | Kandinsky Lab | arXiv:2608.05798 关键词:视觉tokenizer,VAE,音频编解码,因果压缩,开源 前序问题:潜空间扩散的天花板一半压在 tokenizer 上:压缩率、通道数、因果性直接决定生成模型的学习速度和最终画质。但开源社区里 tokenizer 的训练细节、选型方法和设计取舍几乎都藏在大模型报告的角落,后来者只能反复踩坑。 本文贡献:一次性放出覆盖三种模态的 KVAE 全家桶并开源:KVAE-Audio 是 48 kHz 全带宽连续音频 tokenizer,latent 帧率 50 Hz、64 通道;KVAE-3D 是两个因果视频 tokenizer,压缩率分别为 4×16×16(64 通道)和 4×8×8(16 通道);KVAE-2D 是空间 8 倍压缩、32 通道的图像模型。视频侧刻意做成无注意力的纯 Conv3D 结构,配合缓存机制可以处理任意长序列,归一化用空间 RMSNorm 以便推理时调整分段大小,上下采样把时间和空间操作拆成先后两步。编码器解码器故意不对称:4×8×8 的解码器约为编码器的 1.3 倍,4×16×16 直接做到 5.3 倍,把容量押在需要生成能力的解码侧。 实验效果:在 MCL-JCV 720p 重建评测上,同压缩率分组内平均比 Wan-2.1(PSNR 34.3)、Wan-2.2(34.2)和 HunyuanVideo 高出 1 dB 以上 PSNR,LPIPS 损失可以忽略。生成侧用统一的 2B CrossDiT(Qwen-2.5VL 文本编码器、流匹配损失、同一批数亿图文数据和超参)只换 tokenizer 做对照:KVAE-4×16×16 与指标完全一致,相比 Wan-2.2 让出一点视觉观感换来更好的提示词遵循,对 HunyuanVideo-1.5 则在全部类别上被更多人选中;有意思的是 KVAE-4×8×8 出现客观指标与人评打架的情况——PSNR 不占优,盲测却名列前茅。整体对标 Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio、MMAudio,代码已在 GitHub 公开。 批判点评:肯把训练细节、选型方法和消融一起交出来的 tokenizer 报告非常少,这份等于给中小团队省掉一轮昂贵的试错,「客观指标与人评打架」的坦白也比一味报 PSNR 有价值。但要注意重建指标只在 MCL-JCV 一个数据集上测,生成对照又只用 2B 模型和数亿量级图文数据,能否外推到十亿级视频数据和更大生成骨干是未知数;1 dB PSNR 的领先在下游生成里究竟折算成多少可感知收益,论文自己的人评已经说明关系并不线性。 6. Latent Reward Register:寄存器读奖励省33倍GPU时 Latent Reward Registers for Diffusion Preference Alignment | 快手可灵Kling Team·中科大 | arXiv:2608.03929 关键词:偏好对齐,latent奖励模型,寄存器token,on-policy蒸馏,可灵 前序问题:扩散模型对齐人类偏好,通常只在最终生成图上算一个稀疏的终点奖励,几十步去噪要共享这一个分数,时序信用分配极其困难。想改成稠密奖励,又绕不开把中间 latent 解码回像素空间的高昂代价。 本文贡献:提出 Latent Reward Register:在冻结的 DiT 输入序列前面挂一串可学习、无位置的寄存器 token(实验用 K=32),让它们从中间带噪 latent 里直接读出终点偏好。关键在于这是一条独立读出通路,不改动生成器的隐藏状态和速度场,因此拿到的是贯穿整个去噪过程、可微分的稠密奖励。基于它给出两种用法:训练侧的 RG-OPD 沿 on-policy 轨迹蒸馏奖励引导的更新,绕开标准策略梯度里昂贵的完整 rollout;推理侧的 RGS 用量级匹配的奖励梯度直接引导采样轨迹,一个参数都不用改。 实验效果:在 ImageReward、HPDv2、HPDv3、GenAI-Bench 合计 54170 对样本上,把 latent 前向加噪到高噪声区 u=0.8 打分,寄存器在所有 latent 奖励模型中成对偏好准确率最高。训练侧 SD3-Medium 上 RG-OPD 的 HPSv3 达 11.57,高于 AlignProp 的 11.20、ReFL 的 10.84 和 Flow-GRPO 的 10.26,MUSIQ 74.9、CLIP-IQA 0.726 同时领先,GPU 时最多省到原来的三十三分之一;FLUX.1-dev 上 HPSv3 12.38 同样第一。推理侧 RGS 在免训练方法里刷新 SOTA,SD3-Medium 上 HPSv3 10.70 对 DNO 的 8.85、Demon 的 9.09,且 MUSIQ 与 CLIP-IQA 一并提升而非以画质换分数。代码与权重已开源。 批判点评:「不动生成器、只挂一串寄存器 token 去读奖励」是个很轻的接口设计,33 倍 GPU 时的差距对预算有限的团队几乎是能不能做在线对齐的分水岭,而且训练和免训练两条路复用同一套读出器。需要警惕的是奖励是从生成器自己的特征里读出来的,两者共享盲区时容易一起自我强化,论文报的 MUSIQ 与 CLIP-IQA 都是无参考指标,扛不扛得住长时间优化下的奖励攻击没有给出曲线;实验也集中在 SD3-Medium 和 FLUX.1-dev 两个文生图骨干,视频扩散上还是空白。 7. SURE:让奖励先说自己有多不确定 Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training | 中国电信TeleAI·上海交大 | arXiv:2608.06125 关键词:latent奖励,不确定度,奖励攻击,扩散后训练,TeleAI 前序问题:latent 奖励模型能在不解码回像素的前提下监督扩散模型,效率很高,但它们只吐一个标量分数。生成器无从判断这次反馈到底可不可信,一旦在模型本就没把握的样本上照单全收,优化方向就会跑偏,进而演变成奖励攻击。 本文贡献:让奖励模型同时输出「打多少分」和「这个分有多不确定」。SURE-LRM 为每个带噪 latent 预测一个高斯效用:均值是奖励分数,方差是预测的不确定度,且完全从成对偏好中学出来,不需要额外人工标注。SURE-REFL 再把这份不确定度用起来——在选定的去噪转移点上查询冻结的 SURE-LRM,把 detach 后的方差换算成同一转移点内样本之间的可信度权重,每个加权奖励只沿本地转移回传。整条链路留在 latent 空间,既不需要像素解码,也不需要展开完整去噪图。 实验效果:偏好预测上跨三个骨干的均值从 DiNa-LRM 的 70.51 提升到 72.14,FLUX.1-dev 上单点最大提升 2.30。不确定度确实有信息量:排错的样本残差方差平均高 24.26%,用方差识别排序错误的 AUROC 为 0.6941,只保留方差最低的一半样本可把成对准确率从 79.40% 抬到 90.10%。视频侧 VisionRewardDB 72.31%、T2V Ranking 71.70%,均为最好。图像后训练在三个生成器、九个骨干—指标组合里拿下八项第一;视频用 Wan2.1-480P-T2V-14B 后训练,VBench 质量、语义、总分均为评测中最高。作者还给出对照曲线:DiNa-LRM-REFL 的优化奖励持续上升而独立的 HPSv3 已经开始下跌(典型奖励攻击),SURE-REFL 两条曲线则能同步更久。 批判点评:把「奖励可不可信」显式建模出来,比事后加正则更对症,方差—错误率的诊断也做得实在。但不确定度是无监督学出来的,AUROC 0.6941 说明它只是弱信号,离可靠的置信度校准还有距离;作者自己也承认「保留低方差一半准确率涨到 90.10%」这组样本训练时见过,属于分布内诊断而非留出校准。更根本的是,可信度只在同一转移点内做相对比较,如果整个时间步的奖励模型集体偏了,加权也救不回来。 8. LC-GRPO:动态度从12.5救回45.8 LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction | 普林斯顿大学·加州大学圣地亚哥分校 | arXiv:2608.05600 关键词:Flow-GRPO,Langevin修正,训练推理错配,奖励攻击,强化学习 前序问题:流匹配模型推理时解确定性 ODE,而在线强化学习需要随机 rollout 来探索,于是现有 GRPO 训练时把 ODE 换成 SDE。连续时间下两者边缘分布相同,但有限步离散化后差别很大:探索噪声一大,SDE rollout 就发糊,拿这些糊掉的样本算奖励去训练,和最终 ODE 采样器生成的东西对不上号。 本文贡献:每一步 rollout 先走一步与推理对齐的 ODE Euler,再补一步针对该时刻边缘分布的随机 Langevin 修正。修正需要的 score 直接从流速度里换算出来,不用额外训练 score 模型;修正后的转移仍是各向同性高斯,似然可解析,能直接喂给策略优化。理论上作者证明:在合适条件下一步 Langevin 修正能降低不完美 ODE Euler 步的 Wasserstein 误差;在随机性水平匹配时,该转移比反向 SDE 的标准 Euler–Maruyama 离散更准确。 实验效果:SD3.5-Medium 上文字渲染 OCR 奖励做到 0.960,高于 Flow-GRPO 的 0.914 和 CPS 的 0.935,且 ImageReward 1.00、CLIP 0.291 等旁路质量指标不掉;人类偏好对齐 HPS-v2.1 达 0.393 对 0.381。FLUX.1-Dev 上 HPS-v2.1 0.384、PickScore 23.28 均第一。最刺眼的是视频:HunyuanVideo 用 VideoAlign 视觉质量做奖励,DanceGRPO 把 VBench 动态程度从原模型的 52.8 压到 12.5(画面几乎不动来骗高分),LC-GRPO 保住 45.8,同时 VideoAlign 视觉质量从 -0.205 提到 0.063、VBench 总分 79.10。计算上并不占便宜:Langevin 每步两次前向,作者让基线跑同样和两倍的 rollout 步数取更好结果。 批判点评:指出「训练用 SDE、推理用 ODE」这个人人默认却没人细究的错配,还给了 Wasserstein 误差的理论支撑,而不是纯经验 trick,视频那组动态程度 12.5 对 45.8 更是把奖励攻击拍在明面上——很多 GRPO 的涨分其实是靠画面变静态换来的。要留意每步两次前向的开销是实打实的,作者靠给基线加倍步数来对齐算力,但这不完全等价于同等 wall-clock;实验只覆盖 512×512 分辨率和 HPS、CLIP、OCR 这几类可打分奖励,更主观的美学或叙事奖励是否同样受益尚不清楚。 9. In-Context Forcing:上下文加噪反而提速82% In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion | 上海科技大学·腾讯优图·浙江大学 | arXiv:2608.05237 关键词:自回归视频扩散,噪声上下文,跨帧并行,推理加速,Self Forcing 前序问题:少步自回归视频扩散在生成当前帧的每一个去噪步时,都拿前面已经彻底去噪的干净帧当上下文。干净帧泄露了太多局部细节,模型顺手抄过来就行,结果时序语义被削弱、画面越生成越静止。而如果简单地给上下文加同样强度的噪声,引导又不够,时序一致性会崩。 本文贡献:借「扩散即掩码」的视角重新设计上下文:让上下文帧带上递减的噪声水平——离得远的帧掩得少、紧挨着的帧掩得多,形成渐进式自回归范式,既保住时序一致性又留出帧间动态。更实际的收益是,一旦不再严格依赖「前面必须是干净帧」,跨帧就能并行去噪,推理不再是一条串行长链。训练上以 Wan2.1-T2V-14B 为教师、其因果版 1.3B 为学生,batch 64 跑 1900 步。 实验效果:VBench 上视觉保真度和推理速度双双超过现有方法。逐帧设定下吞吐从 Self Forcing 的 8.9 FPS 提到 16.2 FPS,相对提速 82%,总推理时间减少 45.1%;即便在本已优化过的分块设定下也还能再省 9.3% 时间。30 秒长视频差距最明显:动态程度 86.40 对 Rolling Forcing 的 40.63——后者训练测试不一致的问题会随着滚动窗口反复传播,越长越静止。盲测 A/B 用户研究中相对 Wan2.1、CausVid、Self Forcing 三个基线均获偏好。 批判点评:「给上下文加噪反而更好」违反直觉但解释得通:干净帧提供的是模型可以偷懒复制的捷径。更漂亮的是解开干净帧依赖后顺带解锁跨帧并行,质量和速度不再是二选一。不过 82% 提速是在逐帧这个本身效率最差的设定下取得的,切到实际常用的分块设定就只剩 9.3%,标题数字有挑好看的成分;学生模型只有 1.3B,是否能迁移到 14B 级别未验证;动态程度高也不等于运动合理,86.40 里有多少是有意义的运动仍需人眼确认。 10. Diff-VF:免训练把短视频拉长4倍 Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model | 上海交大·上海人工智能实验室 | arXiv:2608.05976 关键词:免训练长视频,窗口融合,噪声初始化,VBench-Long,即插即用 前序问题:现有视频扩散模型基本都用 10 秒以内的短视频训练,直接外推到长视频就会崩:要么长程语义漂移,要么为了保一致性把画面拍成几乎静止。而重新训练长视频模型既缺数据也缺算力。 本文贡献:提出免训练、即插即用、与骨干无关的 Diff-VF,全部操作只在噪声 latent 上做,因此不挑空间时间建模方式。三招配合:混合噪声初始化用第一段噪声锚定全局语义、后续段追加噪声补充内容多样性;加权窗口采样给每个窗口内的帧按到窗口中心的距离分配权重,让重叠区平滑过渡而不是简单平均出接缝;时间扩展采样把视频按固定间隔抽成若干等距子片段分别去噪再还原顺序,用随时间步变化的融合建立长程依赖。此外用跳跃残差引导把框架扩展到长视频增强,在保真与真实感之间做时间步相关的平衡。 实验效果:在 LaVie 上做 VBench-Long 评测,相比基座模型(主体一致性 0.8546、动态程度 0.9722)和免训练基线,Diff-VF 主体一致性升到 0.9164、动态程度 0.7208,高于 FreeNoise 的 0.6958 和 FreeLong 的 0.5625;整体一致性 0.2795 与人物动作 0.9580 均为最好,运动平滑度 0.9529 也居首。换到 HunyuanVideo 同样有效,说明对 2D+1D 与 3D 注意力两种结构都适用,生成长度是基座原生输出的 4 倍。对比对象包括 FreeNoise、FreeLong 和 RIFLEx。 批判点评:一行权重都不改就把短视频骨干拉长 4 倍,这类方法的部署成本几乎为零,权重函数和等距采样的设计也确实比简单平均更讲究,作者跨两种注意力结构验证了通用性。但要看清代价:基座原本 0.9722 的动态程度被压到 0.7208,只是压得比 FreeLong 的 0.5625 少而已,「一致性—动态性」的跷跷板并没有被打破,只是挪了个位置;评测停在 LaVie 和 HunyuanVideo,没碰 Wan、CogVideoX 这些主流骨干;4 倍长度对分钟级叙事而言仍然偏短。 趋势观察 统一多模态预训练开始有可复现的经验定律 — Meta 用 13.5B MoE、2T token 做单变量对照,得出语言 70%、理解 25%、生成 5% 的非对称配方,生成 token 少五倍反而把 GenEval 从 0.467 抬到 0.482;早期统一还是晚期对齐也不再是口味问题,晚接视觉会留下可测量的「视觉懒惰」。 音视频不再是先出画面再配音,而是同一条序列里的角色分配 — Vorch 三连发把目标、源、参考、历史统一成 token 角色与位置类型:Omni 一套权重覆盖 30 多种条件—输出组合,Director 用噪声配对的残差注入把 22 镜头的分钟级故事撑住,Streamer 在单张 H200 上把文本直出音视频推到 27.12 FPS。 奖励模型集体搬进 latent 空间,并开始交代自己的可信度 — 可灵的 Latent Reward Register 在冻结 DiT 上挂 32 个寄存器 token 直接读奖励,GPU 时最多省 33 倍;TeleAI 的 SURE 让奖励同时输出方差,把不确定的反馈自动降权。稠密、可微、带置信度的中间奖励,正在取代只看最终成图的稀疏打分。 强化学习和自回归都在补同一个洞:训练与推理不一致 — LC-GRPO 用 Langevin 修正让 rollout 与推理时的 ODE 采样对齐,把 DanceGRPO 压到 12.5 的 VBench 动态程度救回 45.8;In-Context Forcing 让上下文带递减噪声以匹配测试分布,30 秒长视频动态程度 86.40 对 Rolling Forcing 的 40.63。两者都说明:很多所谓的涨分,只是模型学会了让画面别动。 Tokenizer 和免训练技巧仍是被低估的杠杆 — Kandinsky Lab 把音频、图像、视频三套 tokenizer 连同训练细节与选型方法一起开源,重建 PSNR 平均比 Wan-2.2、HunyuanVideo 高 1 dB 以上;Diff-VF 不动一行权重,仅靠噪声初始化、加权窗口和等距采样就把短视频骨干拉长 4 倍。不是每个提升都需要重训一个大模型。 人工智能炼丹君 整理 | 2026-08-07 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月07日
13 阅读
0 评论
0 点赞
2026-08-06
AIGC 每日速读|2026-08-06|京东22B音画同修让百年老片复活OmniVR
今日 AIGC 论文速览 今日共 10 篇 · 音视频联合生成与修复 2 篇 · 实时与交互视频创作 2 篇 · 多模态Token高效压缩 2 篇 · 生成后训练与条件对齐 2 篇 · 评测与专业可控生成 2 篇 重点论文标题列表 OmniVR(中科大·京东探索研究院):22B让百年老片音画一起复活 JoyAI-Video-Edit(京东Joy Future Academy):16B单卡30FPS实时剪视频 ContextMaster(清华·南京大学·快手可灵·上科大·港科大):固定预算多镜头创作跑16.74FPS OmniPack(西北工业大学·北大·阿里·清华):无训练6.8%算力保住92.9% STEP-OPD(上海交大·阿里):蒸馏学生越过教师得分0.961 今日论文速览 1. OmniVR:22B让百年老片音画一起复活 OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films | 中科大·京东探索研究院 | arXiv:2608.04224 关键词:音视频联合修复,历史影像,LTX-2,多模态DiT,京东 前序问题:历史影像往往同时存在模糊、噪声、闪烁、曝光不足,以及嘶声、削波、掉音和带宽缺失。现有修复器通常把视频与音频拆开处理,不仅留下单模态质量短板,还可能破坏口型、动作和声音之间的同步。 本文贡献:提出首个音视频联合生成式老片修复模型 OmniVR。系统从 22B 参数 LTX-2 音视频骨干出发,把低质音频和视频编码成联合条件,在统一多模态 DiT 中同步去噪;以联合退化管线模拟真实老片损伤,用近零初始化通道拼接与提示词退火把 T2AV 平滑改造成 AV2AV,再以首帧锚定、模态损失重加权和波形监督支持跨 121 帧窗口的长视频修复。 实验效果:在 200 段真实历史片组成的 OmniVRBench 上,真实轨 MUSIQ 达 61.87,显著高于次优 RealBasicVSR 的 52.38;DNSMOS 从退化输入的 2.04 提升至 2.43,FAD 从 15.93 降至 8.32。12 名标注者给出 80.0% 综合偏好。模型输出 1920×1088,作者还报告在独立 RTN 老片基准的六项无参考视觉指标上全部第一。 批判点评:把“修画面”和“修声音”变成一次联合条件生成,方向比串联两个修复器更完整,指标和人评也有说服力。但 22B 骨干以 rank-384 LoRA 在 64 张 H200 上训练约 5 天,成本很高;强生成先验可能补出原片不存在的纹理与颜色,历史档案、司法取证等场景仍需要真实性约束。代码和权重目前只是承诺公开。 2. JoyAI-Video-Edit:16B单卡30FPS实时剪视频 JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion | 京东Joy Future Academy | arXiv:2608.03974 关键词:实时视频编辑,自回归扩散,两步蒸馏,720p,京东 前序问题:直播和视频通话中的编辑必须边接收边输出,不能偷看未来帧,也不能让显存和计算随视频时长不断增长。把离线编辑器简单切成小段会产生边界跳变,自回归地反复使用生成历史又会累积色偏、身份漂移和背景幻觉。 本文贡献:提出 16B 自回归扩散编辑框架:MLLM 条件编码器理解指令和参考,因果 VAE 与分块双向、跨块因果注意力负责流式输出,滑动窗口加首块全局 sink 把历史状态限制在固定预算。Source-Anchored DMD 将多步扩散蒸馏为两步,并用当前源视频块约束教师目标;长程自回归蒸馏则在分段 rollout 上直接学习累积误差。 实验效果:结合两步生成、固定历史 KV 缓存、FP8 量化和优化 VAE 管线,完整系统在单张 NVIDIA B200 上实现端到端 720p 约 30 FPS。自动指标和人评均显著超过现有流式编辑器,在短视频与长视频上可与强离线系统竞争;代码已经公开。 批判点评:这是今日最硬的工业数字:16B 模型把开放式编辑真正推到实时帧率,而且处理时无需预知视频总长度。但单卡指的是昂贵的 B200,30 FPS 不能外推到消费显卡;两步扩散和 FP8 的细节损失、长达数小时的稳定性以及输入输出延迟分布,还需要独立复现。 3. ContextMaster:固定预算多镜头创作跑16.74FPS ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing | 清华·南京大学·快手可灵·上科大·港科大 | arXiv:2608.04956 关键词:多镜头视频,交互创作,稀疏路由,上下文缓存,可灵 前序问题:真实视频创作会在多轮中交替生成新镜头、引用人物或场景、编辑已有素材,并持续继承历史。若每个去噪步都密集读取不断增长的上下文,延迟会随会话变长;若只保留短窗口,又会忘掉早期角色与约束。 本文贡献:提出交互式多镜头视频创作 IMVC 与统一模型 ContextMaster。角色感知 RoPE 区分参考图、历史镜头、源视频和待生成目标;可缓存的干净上下文只预填一次,块稀疏路由在固定预算内检索相关历史,ConstraintSink 强制保留参考和逐帧编辑约束。两阶段特权上下文蒸馏先用稠密教师做一致性蒸馏,再用分布匹配修复少步 rollout 的细节。 实验效果:在单张 H200、匹配分辨率与帧数的设置下,五镜头任务平均达到 16.74 FPS;跨镜头一致性由强基线的 0.808 提升到 0.836,并在文本生成、参考生成和视频编辑三类任务中取得最强综合表现。固定 6-FE 读取预算接近质量与速度最佳点。 批判点评:这项工作把多镜头创作从一次性提示升级为有状态工作流,并让每轮上下文读取保持定额,产品形态很清晰。但 16.74 FPS 仍依赖 H200;路由器漏掉关键旧镜头会造成不可逆遗忘,角色一致性也不等于剧情因果一致。训练阶段还使用 64 张 H200,复现门槛不低。 4. OmniPack:无训练6.8%算力保住92.9% OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models | 西北工业大学·北大·阿里·清华 | arXiv:2608.03812 关键词:全模态大模型,Token压缩,免训练,音视频理解,推理加速 前序问题:全模态大模型同时接收长视频与音频时,视觉和声音 token 数远超文本。现有压缩要么在进入 LLM 前过早丢掉分散在长时间轴上的证据,要么进入 LLM 后只听文本指令,没有充分利用已经对齐的音视频交互。 本文贡献:提出免训练两阶段压缩框架 OmniPack。LLM 前按模态重要性、全局覆盖和相似度合并结构冗余,把被删除信息回收到代表 token;多模态充分交互后,再用文本问题引导和音视频协作做第二次语义压缩。不同阶段分别处理“结构重复”和“任务相关性”,无需改权重。 实验效果:在 Qwen2.5-Omni-7B 上仅用原始 16.7% FLOPs 即保留 98.0% 性能;极限设置只用 6.8% FLOPs 仍保留 92.9%。15%/7.5% 两阶段保留率下,FLOPs 降低 10 倍、prefill 加速 4.5 倍,同时保留 95.6% 性能,并跨三种骨干、五项基准保持最佳效率折中。 批判点评:无需训练且跨 Qwen 与 MiniCPM 骨干有效,工程接入成本很低;把“先保全局结构、后按问题精炼”拆开也比统一打分更合理。不过结果主要来自 H20 上的 prefill,端到端对话延迟和 KV 缓存收益未完全等同;极低预算仍损失约 7% 综合性能,稀有短暂事件可能最先被压掉。 5. STEP-OPD:蒸馏学生越过教师得分0.961 STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models | 上海交大·阿里 | arXiv:2608.04887 关键词:扩散蒸馏,On-policy,超越教师,表示对齐,图像生成 前序问题:扩散模型的 on-policy 蒸馏通常只让学生在自己的去噪轨迹上拟合教师速度,理论最优点就是“和教师一样”,无法主动超过教师;只看最终输出还会放任各 Transformer Block 的内部表示以错误方式相互抵消。 本文贡献:提出 STEP-OPD:把任务教师相对共享基础模型的速度差视为能力提升方向,将缩放后的差值继续加到教师目标上,构造“教师之外”的输出外推目标;同时不直接硬对齐隐藏状态,而是匹配相邻 Block 表示变化的方向和幅度,让学生学习能力在网络内部如何逐层形成。 实验效果:在组合对齐、文字渲染与人类偏好三组能力上统一超过标准 DiffusionOPD,并使 GenEval 从 0.927 提升到 0.961;统一学生在三类能力上分别超过对应的单任务教师,证明多教师能力整合不必以教师上限为终点。 批判点评:“教师减基础模型”的差向量能否稳定代表可继续外推的能力,是很有启发性的假设,内部变化对齐也补上了只看终点的盲区。但外推系数依赖任务调参,走得太远可能放大教师偏差;目前只验证图像生成,扩展到视频等更长序列后,中间层监督的显存和计算成本会更突出。 6. TD-V2A:帧间差分让视频配音FAD降至0.53 Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation | 清华·南洋理工等 | arXiv:2608.04902 关键词:视频配音,帧间差分,音频扩散,时间对齐,视觉表征 前序问题:视频配音区别于看图配音的核心不是多看几张静态图,而是捕捉帧间运动变化。现有方法常外挂音视频对比模型、声学结构预测器或多模态大模型,系统复杂,且可能把真正决定声音时机的低层运动细节压掉。 本文贡献:提出 TD-V2A,直接把相邻帧差分作为额外视觉条件。作者比较像素帧差与编码后特征差,发现编码前差分保留的细粒度运动更有效;训练时以文本到音频预训练、原始视频条件、差分增强条件三阶段持续学习,采样时用退火差分引导在早期先确定全局声音动态,后期逐渐回到原始视觉语义。 实验效果:在约 1.5 万段 VGGSound 测试片上,FAD 达 0.53,优于 MMAudio 的 0.81;IS 达 16.9、ImageBind Score 达 33.8,均明显高于对比方法,时间对齐准确率 89.1。它甚至超过需要额外训练的 CAVP 音视频表示,且没有新增预测网络。 批判点评:把“视频比图片多出来的信息”直接定义为帧差,简单而有效,指标也说明低层运动不应过早被语义编码器抹掉。但逐帧差分对镜头切换、抖动和光照闪烁同样敏感,可能把无关变化误当声源;其时间对齐 89.1 仍略低于专门以对齐目标训练的 Diff-Foley 89.9。 7. CAPE-T2V:训练推理两头对齐提示词 CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation | 复旦·快手可灵 | arXiv:2608.03046 关键词:文生视频,提示增强,训练推理对齐,Caption,可灵 前序问题:视频 DiT 训练时看到的是详尽视频 caption,线上却由 Prompt Enhancer 把用户短句改写后再喂给模型。即使双方使用同一字段模板,细节选择、组织方式、粒度和措辞仍不同,形成残余 PE-Caption 分布缺口。 本文贡献:提出两步 Captioner-Anchored 对齐:先用外部视频描述器产生统一目标,把简短描述、详细描述和伪用户提示都训练成同一种 Anchored PE 输出;再让这个已经冻结的 PE 重写视频训练 caption 并微调 DiT,部署时仍由同一个 PE 改写用户提示,使训练侧与推理侧真正共享同一文本算子。 实验效果:在 Wan2.2 与 LTX-2.3、StoryEval/VBench-2.0/T2V-CompBench 的六个组合上全部超过只做 schema 对齐的基线。Wan2.2 分别提升 1.6、1.12、0.30 分,LTX-2.3 提升 1.4、0.92、0.65 分;caption 到推理改写的 MMD² 从 0.0764 降至 0.0682。 批判点评:工作指出“字段相同不等于分布相同”,并把 Prompt Enhancer 正式视作生成模型接口,诊断很贴近真实部署。但绝对增益多数只有 0.3–1.6 分,StoryEval 又使用 GPT-5.5 判定;一旦线上 PE 更新,就要重新改写训练 caption 并适配 DiT,维护成本仍然存在。 8. Two-Stage Token Pruning:只留10%视频Token还涨7分 Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models | Amazon | arXiv:2608.03112 关键词:视频语言模型,Token剪枝,免训练,自适应预算,Amazon 前序问题:视频语言模型每帧可产生数百视觉 token,数分钟视频很快进入万 token 区间。现有图像剪枝方法既忽略跨帧重复,又对所有视频使用固定保留率;静态访谈和高速运动显然不该被压成相同预算。 本文贡献:提出完全后处理的两阶段自适应剪枝:先在时间轴选择差异最大的代表帧,再在保留帧内做 token 级裁剪。第二阶段对 token 相关矩阵做特征值分解,用谱衰减速度估计当前视频冗余度,并据此动态决定保留比例,无需训练或微调原模型。 实验效果:在三种 VLM、五项视频基准上持续增益;平均仅保留 10% token 时,VideoDC 准确率达到 76.75%,比同预算 DivPrune 的 68.47% 高 8.28 分,论文摘要按跨设置概括为约 +7%;同时 TFLOPs 降低约 95%,其他问答基准基本保持。 批判点评:把“删哪些帧”和“每帧删多少 token”分开,并让谱结构决定预算,符合视频冗余的实际差异。代价是特征值分解本身有额外开销,当前实验以短视频理解基准为主;突发但关键的一帧或小目标,仍可能在两轮剪枝中被不可逆丢失。 9. OmniEdit-Bench:五赛道揭穿视频编辑假高分 OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing | 港大·阿里通义万相·浙大·北大 | arXiv:2608.05049 关键词:视频编辑评测,音频编辑,时间编辑,推理编辑,通义万相 前序问题:很多视频编辑评测沿用图像编辑任务,只看逐帧空间变化;模型即使没有执行指令,只要保留原视频的高画质和一致性,也可能得到高分。音频、时间操作、参考条件和隐式推理因此长期缺席。 本文贡献:构建覆盖空间 240、时间 200、参考 200、音频 100、推理 50 个案例的五赛道基准,并区分显式与隐式指令。评测把质量拆成准确性、保留度、真实感和一致性,再以准确率作为门控缩放后三项,避免“看起来很好但改错了”获得虚高总分。 实验效果:商业与开源模型整体都远未过关:KlingV3-Omni 综合最高也仅 38.3/100,Seedance 2.0 为 37.3;时间赛道最好 Wan2.7-Edit 只有 29.0,推理赛道最好 Seedance 2.0 也只有 29.8。商业模型在空间编辑领先,但优势在音频、时间和推理任务明显收窄。 批判点评:把准确性设为其他质量分的前提,能有效纠正原视频先验造成的假高分;五赛道也比图像式评测更接近真实需求。不过大量评分仍依赖 VLM,门控权重是人为设计;部分商业模型因功能或版权限制没有覆盖全部赛道,横向平均并非完全同条件。 10. CSGen:2.4万样本守住血管道路裂缝 CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion | ACM MM 2026·海南大学·广东海洋大学 | arXiv:2608.04655 关键词:可控生成,曲线结构,拓扑保持,专业数据,ACM MM 前序问题:血管、道路、叶脉和裂缝只占图像极少像素,却要求细长分支持续连通。通用扩散模型更擅长生成大物体,普通 MSE 又被背景像素主导,容易把这些稀疏结构画断或偏离控制图。 本文贡献:提出基于 SD3.5 的层次多模态扩散模型 CSGen,并汇集 24678 个样本,覆盖血管、冠脉、混凝土裂缝、叶脉和道路五域及七类标注。分阶段注入 CLIP 拓扑属性与 T5 场景描述,先锁定结构再补环境;稀疏感知损失按等效直径提高细小脆弱分支的权重。 实验效果:相同提示下 FID 达 98.525,优于 SD3.5-ControlNet 的 131.256;完整模型将拓扑 clDice 从基线 0.628 提升到 0.766。合成数据用于下游分割时,道路域 mIoU 最高增加 4.73 分,说明生成结果不只视觉像真,也能补充结构学习。 批判点评:这是 ACM MM 2026 已接收工作,数据、代码和结构指标较完整,说明专业生成不能只看通用审美分。但五个领域仍共享相对简单的二值拓扑先验,跨域统一性有限;合成图提升分割不等于临床或基础设施诊断可靠,专业场景还需真实分布验证。 趋势观察 音视频联合模型开始从内容生成反向进入修复 — OmniVR 直接复用 22B 音视频生成骨干,同时恢复老片画面、声音与同步关系;统一生成先验正在吞并过去彼此独立的增强管线。 视频编辑从固定短片走向实时、有状态和开放时长 — JoyAI 用两步自回归扩散在单 B200 达到 720p 约 30 FPS,ContextMaster 则以固定预算上下文支撑多轮多镜头创作,视频模型正从一次生成器变成持续工作的创作系统。 Token压缩从固定比例升级为内容与问题共同决定 — OmniPack 先保全局音视频结构、再按问题做语义精炼,Amazon 两阶段方案先删重复帧、再按谱冗余决定每帧预算;高效推理正在告别一刀切剪枝。 生成后训练不再满足于复刻教师或单边修补接口 — STEP-OPD 沿教师相对基础模型的能力方向继续外推,CAPE-T2V 则让同一个 Prompt Enhancer 同时定义训练与推理文本分布,优化目标从局部模仿转向端到端系统对齐。 视频能力评测开始补齐时间、声音与隐式推理 — OmniEdit-Bench 的五赛道显示最强商业编辑模型综合仍不足 40 分;TD-V2A 也证明只看语义无法评价配音,时间差分与同步指标将成为音视频系统的基本维度。 人工智能炼丹君 整理 | 2026-08-06 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年08月06日
17 阅读
0 评论
0 点赞
2026-07-31
AIGC 每日速读|2026-07-31|Adobe混合DiT算效提升7.3倍Chimera
今日 AIGC 论文速览 今日共 10 篇 · 生成基础范式与高效骨干 2 篇 · 电影叙事与长视频生成 3 篇 · 视频后训练与时间控制 2 篇 · 物理世界建模 2 篇 · 生成式视频编码 1 篇 重点论文标题列表 Chimera(Adobe Research):混合视觉DiT算效提升7.3倍 CineWeaver(上交·中国电信TeleAI):免训练多镜头长视频叙事 XM(UIUC·Harvard):探索成为生成预训练第三轴 cIPO(清华·快手可灵·中山大学):无需标注修复视频时序瑕疵 PhiZero(中科院自动化所):用物理语言显式推演世界 今日论文速览 1. Chimera:混合视觉DiT算效提升7.3倍 Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers | Adobe Research | arXiv:2607.28611 关键词:视觉DiT,混合注意力,MoE,缩放定律,长视频 前序问题:高分辨率图像、长视频和多模态上下文让视觉生成进入高 token 时代,全注意力 DiT 的二次复杂度愈发不可承受;语言模型中的高效结构又不能直接照搬,因为视觉扩散必须保留时空局部性和跨模态双向交互。 本文贡献:提出混合视觉扩散骨干 Chimera:在统一光栅序列中组合 O(N) 的 Kimi Delta Attention 做长上下文状态跟踪、交错的多头潜注意力做全局交互、模态感知短卷积捕捉局部时空结构,并以稀疏 MoE 扩容量而不显著增加激活计算。进一步提出模块级缩放方法 HeteroP,为异构架构拟合 Chinchilla 式最优模型规模、训练 token 数与图像/视频配比规律,最终训练 11B 参数、每次激活 2B 的模型。 实验效果:稠密骨干相较匹配的全注意力 Wan2.1-2B,预训练计算效率提升 1.7 倍;完整系统提升到 7.3 倍。模型只用 5 秒视频训练,无需长度微调即可零样本生成 30 秒视频,最后 5 秒 FID 仅退化 6.5%。 批判点评:Adobe 将线性状态跟踪、全局注意力、局部卷积和 MoE 组合后,再用专门缩放律调参,避免了“高效模块简单拼装”的常见陷阱,7.3 倍算效与 6 倍时长外推都很亮眼。但系统结构复杂、工程优化依赖强,预训练损失和 FID 并不等价于真实指令遵循与长视频观感;11B/2B 激活规模的复现门槛也不低。 2. CineWeaver:免训练多镜头长视频叙事 CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling | 上交·中国电信TeleAI | arXiv:2607.26529 关键词:多镜头视频,长视频,参考控制,免训练,电影叙事 前序问题:电影级视频生成需要同时满足多镜头切换、人物与场景的逐镜头精细控制,以及跨长时间范围的一致性。现有方法通常针对单项需求定制或重训,难以用一个框架兼顾三者。 本文贡献:提出免训练统一框架 CineWeaver,指出预训练视频扩散模型对时间连续性的结构偏置正是多镜头生成困难的根源。推理时操纵位置编码与注意力模式,主动打破时间连续性以形成清晰转场;设计按镜头路由的参考条件,实现人物和场景的逐镜头控制;再用锚点记忆跨长视频保存全局外观线索。 实验效果:据作者所述,这是首个同时支持长视频、参考可控和多镜头生成且无需重训的统一框架。实验可生成身份一致、全局外观稳定、转场清晰的长时电影级视频。 批判点评:把“视频模型过度追求连续”反过来视为多镜头障碍,并仅在推理期改位置编码与注意力,洞察直接且部署成本低。但免训练控制的上限受基础模型约束,复杂叙事中的因果推进、镜头语言和跨镜头表演一致性仍不能只靠外观锚点解决,长片级验证也有待扩大。 3. XM:探索成为生成预训练第三轴 Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation | UIUC·Harvard | arXiv:2607.27372 关键词:生成模型,端到端生成,预训练扩展,探索建模,扩散替代 前序问题:生成模型虽然能力强,却仍不像分类模型那样真正端到端:训练时与推理时的采样过程并不一致。现有可扩展方法通过拆分生成过程处理多峰分布,这种分解既阻碍端到端生成,也让生成能力主要只能沿参数量和数据量两个维度扩展。 本文贡献:提出 Explorative Modeling(XM),不再拆分生成过程,而是拆分训练循环:每次探索模型生成与真实数据之间的 K 个候选匹配,只用最佳匹配训练,使预测主动落在具体模式而非平均模糊。由此把“探索量”建立为参数与数据之外的第三条预训练扩展轴;同时提出端到端重建式生成,让训练采样与推理采样保持一致。 实验效果:扩大探索量在图像、视频、语言等连续与离散领域均单调增益,且规模越大收益越高:随数据规模增长,增益从 7% 升至 36%;随模型增大,从 13% 升至 23%。FLOP 效率提升 4.1 倍、样本效率提升 6.2 倍、参数效率提升 47%;ImageNet 无引导生成达到 1.43 FID,并在控制任务上以少 16–256 倍推理步数匹配扩散模型。 批判点评:“探索量成为第三预训练轴”是今天最具范式意义的结论,也给端到端生成提供了不同于扩散/自回归分解的新路径。但 K 候选探索会把部分成本前移到训练阶段,最佳匹配准则也可能偏向易选模式;目前的规模仍不足以证明它能全面替代成熟扩散路线,大规模文本到视频与真实产品中的稳定性尚待验证。 4. cIPO:无需标注修复视频时序瑕疵 Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion | 清华·快手可灵·中山大学 | arXiv:2607.28058 关键词:视频扩散,偏好优化,自监督,时序一致性,后训练 前序问题:DPO 等偏好对齐虽能提升视频观感,但运动坍缩、物体闪烁、颜色过饱和往往只短暂出现在少数帧。离线人工偏好昂贵且跟不上模型变化,在线奖励又不稳定;对整段视频均匀监督还会把信用分配给无问题的帧。 本文贡献:提出集中式隐式偏好优化 cIPO,不依赖人工标注或外部奖励模型。对真实视频先加噪再让当前模型迭代重建,把原视频视为偏好样本、带有模型 rollout 错误的重建视为非偏好样本,由去噪过程自动产生贴合当前模型的偏好对;再计算逐帧重建误差,把优化集中到高误差的短时片段。 实验效果:在多个数据集和视频扩散模型上持续提升视频真实性与时间连贯性,尤其能更精准地修复只在少量帧中出现的失败区域,同时省去人工偏好标注和外部奖励模型。 批判点评:可灵团队把模型自己的 rollout 错误变成偏好监督,并按时间集中火力,正面解决视频 DPO 的标注与信用分配瓶颈。不过“真实视频优于重建”主要刻画保真与稳定,不一定等价于用户审美或提示遵循;高误差片段也可能来自困难但合理的运动,需防止优化把动态性一并压平。 5. PhiZero:用物理语言显式推演世界 PhiZero: A World Model Built Around Physical Language | 中科院自动化所 | arXiv:2607.28624 关键词:世界模型,物理语言,显式推理,视频生成,动作仿真 前序问题:现有物理世界模型通常直接在像素空间预测未来视频,世界动力学被隐式藏在高维视觉预测器中,难以解释、组合和显式推理。 本文贡献:提出围绕“物理语言”构建的世界模型 PhiZero:从野外视频中自监督学习描述世界状态转移的紧凑离散表示,并采用先推理、后渲染范式——先把未来演化推断为物理语言序列,再将这些转移渲染成视频,让动力学从像素预测中解耦出来。 实验效果:在生成与理解基准上验证了物理一致世界演化能力,并展示了在写实交互世界建模、细粒度动作条件仿真和零样本运动迁移上的潜力。 批判点评:“物理语言→视频”的显式中间层让世界模型更可解释、可控,也便于组合长期规划,是比纯像素 rollout 更有想象力的路线。但离散语言可能丢掉接触、形变等连续细节,物理语言是否真正学到因果规律而非运动码本仍需更严格反事实测试,渲染器误差也可能掩盖推理质量。 6. Visko Orbis 1.0:4K24FPS实时交互长视频 Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation | Team Visko | arXiv:2607.26694 关键词:实时视频,长视频,交互生成,4K,流式生成 前序问题:真正的实时视频生成不能只快速吐出短片,还要允许用户在生成过程中随时改变提示,并在持续数十分钟乃至数小时的流式 rollout 中保持主体、场景、风格和颜色稳定。 本文贡献:推出实时交互长视频模型 Visko Orbis 1.0,统一支持文生视频、图生视频、视频续写、多语言提示和生成中切换提示。以有界多尺度记忆跨块保存主体、场景与风格,结合蒸馏后的分块流式生成器、流式视频超分器和优化 GPU 服务引擎。 实验效果:作者报告系统可实时输出 4K、24FPS,并将 rollout 延伸到 1 小时而无明显画质或色偏漂移;在长视频 Arena 中获得最高总体偏好与时间稳定性评分,DOVER 和 VideoAlign 多项指标也领先对比系统。 批判点评:4K/24FPS、实时改提示和小时级生成若能稳定复现,产品信号非常强。但技术报告未在摘要中披露实现该吞吐所需的 GPU 数量、模型规模和端到端延迟,Team Visko 的数据与模型细节也较少;这些亮眼数字应视为作者声明,仍需公开代码或独立测试验证。 7. VideoCoCo:用可执行代码推理物理视频 VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System | 港中文·中科大等11机构 | arXiv:2607.27380 关键词:物理视频,代码思维链,Blender,智能体,双引擎 前序问题:文生视频的视觉质量已很高,但文本把完整时空过程压成一句话,模型只能隐式猜测动力学,容易违反物理规律。已有思维链使用的中间计划或视觉状态不可执行、时间又稀疏,无法精确控制全过程。 本文贡献:提出智能体双引擎框架 VideoCoCo,把可执行 Blender 代码作为过程级思维链。编码智能体先把文本写成显式描述场景和时间演化的 Blender 程序,仿真引擎执行后产出确定性时空草图,再由生成式视频引擎通过草图条件编辑渲染成写实视频;并构建 3K 组“草图-指令-目标”数据适配编辑器。 实验效果:相对 OmniWeaving,PhyGenBench 从 0.475 提升到 0.558,VBench-2.0 从 52.18 提升到 77.88,两项均取得最佳平均分,表明可执行代码能充当可控、可检查的物理过程表示。 批判点评:将 Blender 代码变成视频 CoT,把物理推理与写实渲染明确拆开,既可检查又可执行,指标增益也明显。但代码智能体受 Blender 可表达对象和规则限制,真实世界的软体、流体、复杂接触难以准确脚本化;双引擎还会累积代码、仿真和渲染三层误差。 8. ReGenVC:26KB实时生成式视频编码 ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate | Intel | arXiv:2607.28144 关键词:生成式编码,超低码率,实时解码,视频压缩,扩散蒸馏 前序问题:传统视频编码在极低码率下会出现严重块效应;生成式编码能借先验保持清晰,却因扩散 Transformer 与 VAE 多步解码过慢,难以用于直播、弱网通话等交互场景。 本文贡献:提出端到端生成式视频编码器 ReGenVC:编码端只发送神经压缩首帧、逐帧姿态关键点和元数据;解码端以参考帧与姿态为条件,用四步蒸馏 DiT 重建视频。系统再结合 8 GPU 统一序列并行、空间切分 VAE 与三级重叠流水线,并以 CPU 承担编码和一次性条件编码,释放 GPU 显存。 实验效果:77 帧人像视频仅约 26KB,而 x264/x265 达到近乎无瑕疵重建需约 250–280KB;同等极低码率下传统编码出现严重块效应,ReGenVC 仍保持清晰。在 8 GPU 节点上达到 24FPS,每 25 帧窗口 972ms;混合 CPU-GPU 部署把单卡峰值显存从 21.1GB 降至约 7.7GB。 批判点评:Intel 把生成先验真正塞进实时编码链路,在弱网人像通信上用约十分之一数据量维持清晰,方向很实用。但“实时”依赖 8 GPU 节点,而内容又集中于说话人视频;生成式重建可能改变细节,新闻、医疗、取证等强调像素真实性的场景还需明确失真边界。 9. FreqForcing:免训练5秒外推到2分钟 FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring | 上海交大 | arXiv:2607.27110 关键词:长视频,自回归扩散,频谱锚定,免训练,时长外推 前序问题:自回归视频扩散可实时流式生成,但自 rollout 误差会长期累积,逐渐表现为色偏、运动停滞直至画面崩溃。作者发现其本质特征是低频能量明显漂移,注意力 sink 只能部分缓解。 本文贡献:提出免训练框架 FreqForcing,以频谱自锚定 SSA 解决长视频误差累积:局部注意力保留当前动态,锚点注意力提供高质量历史参照;在频域中融合局部注意力的高频成分与锚点注意力的低频成分,用低频稳定长期外观,同时避免锚定抹掉高频运动。 实验效果:无需重新训练,即可把仅在 5 秒片段上训练的 Self-Forcing 扩展到 2 分钟,达到 24 倍时长外推;定量与定性表现超过现有免训练方法,并可与代表性训练式方案竞争。 批判点评:把长视频崩坏定位为低频能量漂移,再让锚点只管低频、局部注意力保高频,是很干净的频域解法,24 倍外推也有说服力。但固定锚点可能限制场景长期演化,频率分解无法替代人物关系与叙事状态记忆;两分钟之后是否仍稳定尚未得到证明。 10. TPD:免训练唤醒视频后段事件 TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models | 马里兰大学 | arXiv:2607.26706 关键词:文生视频,时间先验,反事实引导,免训练,事件控制 前序问题:当提示描述一个持续的早期场景、随后才发生新事件时,视频模型常让早期先验支配整条跨时间注意力轨迹,压制后段事件所需的引导信号。例如沙堡一直存在,浪却没有在后半段将其冲毁。 本文贡献:提出时间先验解耦 TPD。仅以早期场景为条件构造时间反事实,将完整提示与反事实轨迹的差定义为被压制的信号方向;不同于以往投影法删除不想要语义,TPD 在扩散步与视频帧上联合求解帧选择的下界约束,保证被压制信号在应出现的后段帧中贡献,同时不破坏早段连贯。 实验效果:完全运行在标准 classifier-free guidance 采样空间,无需重训、与骨干结构无关。多个文生视频骨干上均发现相同压制现象,TPD 显著提升后段概念实现率,同时保持时间连贯与视觉保真。 批判点评:TPD 把“后段事件没发生”明确解释为早期先验压制,并用下界约束恢复信号,诊断与修复逻辑都很清晰。但它需要能从提示中拆出早期条件,复杂并行事件或语义边界模糊时不易构造反事实;额外条件轨迹也会增加推理成本。 趋势观察 视觉DiT进入混合注意力与专属缩放律时代 — Adobe Chimera 将线性状态、全局注意力、局部卷积与 MoE 协同设计,完整系统算效提升 7.3 倍;高 token 视觉生成不再简单照搬语言模型结构。 生成扩展出现参数和数据之外的第三轴 — XM 把探索量变成第三条预训练扩展轴,FLOP 效率提升 4.1 倍、推理步数减少 16–256 倍,生成模型开始重新思考比扩散分解更端到端的训练范式。 免训练控制正在吞并长视频难题 — CineWeaver 免训练做多镜头长叙事,FreqForcing 把 5 秒模型外推到 2 分钟,TPD 唤醒后段事件;推理期改造正成为低成本增强视频基础模型的主线。 物理视频从隐式像素预测转向显式推理 — PhiZero 用离散物理语言先推理后渲染,VideoCoCo 用可执行 Blender 代码充当视频 CoT,世界动力学开始从黑盒像素 rollout 中被显式抽离。 实时生成从短片扩展到传输与小时级交互 — Visko Orbis 宣称 4K/24FPS 并支持小时级交互长视频,ReGenVC 用约十分之一传统码率实现 24FPS 生成式解码,实时生成正进入流式服务与通信基础设施。 人工智能炼丹君 整理 | 2026-07-31 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月31日
19 阅读
0 评论
0 点赞
2026-07-30
AIGC 每日速读|2026-07-30|Adobe世界模型16FPS实时生成分钟视频
今日 AIGC 论文速览 今日共 10 篇 · 实时世界模型与未来预测 2 篇 · 图像视频生成加速 2 篇 · 全模态推理与数字人 2 篇 · 语音与图像生成控制 2 篇 · 生成安全与任务修复 2 篇 重点论文标题列表 Wonder(Adobe Research·约翰霍普金斯):16FPS实时生成分钟级可探索世界 GARFIELD(ECCV 2026·慕尼黑大学):不生成画面也能快97倍预测未来 PDD(NVIDIA·魏茨曼研究所):一次网络前向并行预测多步去噪 OmniCache(UT Austin):四级缓存让扩散推理最多快35% OmniDelta(阿里Qwen·浙大·CMU·中科院):只留25%音视频Token仍提速1.64倍 今日论文速览 1. Wonder:16FPS实时生成分钟级可探索世界 Wonder: Video World Model Done Better | Adobe Research·约翰霍普金斯 | arXiv:2607.26037 关键词:视频世界模型,实时生成,相机控制,长期记忆,Adobe 前序问题:从一张图构建可交互世界,不仅要按相机控制实时生成新视角,还要在分钟级探索中记住已见区域,允许用户返回旧地点,并维持几何、外观和动态一致。普通视频生成的控制、记忆和训练管线彼此割裂。 本文贡献:提出通用视频世界模型Wonder,联合设计相机控制、稀疏记忆与蒸馏训练。稠密坐标场把相机运动和朝向渲染成空间对齐的视觉证据;稀疏注意力记忆从不断增长的历史中只检索少量相关token,计算不随上下文长度线性增长;多项修正改善Self-Forcing式蒸馏的控制遵循、多样性和长期记忆。 实验效果:可从图片或条件视频构建可玩世界,以16 FPS实时合成分钟级视频,支持相机导航、探索未知区域、重访旧区域和对已有动态场景重新运镜,同时保持长期几何、外观与动态连贯。 批判点评:Adobe把世界模型最关键的实时性、可控相机和长期记忆放进同一系统,16 FPS分钟级结果足以指向交互创作。但“可探索”仍是视频生成而非显式3D模拟,重访一致不代表真实几何闭环;分钟级稳定性的场景复杂度与硬件成本需结合演示判断。 2. GARFIELD:不生成画面也能快97倍预测未来 Schrödinger's Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics | ECCV 2026·慕尼黑大学 | arXiv:2607.25984 关键词:运动预测,概率分布,世界模型,ECCV,不确定性 前序问题:从局部观察预测场景未来,本质上存在多条可能轨迹。视频预测往往把算力花在外观,或只采样少量轨迹,既无法显式表示完整运动分布,也难定位“哪个物体、哪个时刻”最不确定。 本文贡献:提出未来运动潜分布的目标感知表示GARFIELD。给定图像和可选稀疏时空约束,模型学习结构化时空潜变量;同一表示既能联合采样全部轨迹,也可由确定性密度解码器直接读取底层运动分布。新增约束可逐步收窄特定物体与时刻的不确定性。 实验效果:运动规划表现可与大型视频生成模型竞争,轨迹采样快97倍;运动密度估计比对生成模型做Monte Carlo采样快两个数量级,可用于交互探索和不确定性感知规划。 批判点评:它把“未来长什么样”拆成“未来可能怎么动”,避免为规划浪费画面生成算力,97倍数字很有说服力。但潜运动分布不直接保证外观、碰撞和语义合理,复杂可变形物体与长时人类行为可能仍需视频级世界知识。 3. PDD:一次网络前向并行预测多步去噪 Parallel Decoding Distillation for Fast Image and Video Generation | NVIDIA·魏茨曼研究所 | arXiv:2607.26004 关键词:并行解码,扩散蒸馏,NVIDIA,少步生成,Flow Matching 前序问题:视频扩散和流模型采样迭代慢,主流少步蒸馏依赖VSD与对抗损失,训练难稳定且容易模式坍塌,表现为视频多样性下降和运动不足。 本文贡献:提出并行解码蒸馏PDD,以简化、可扩展的轨迹蒸馏替代复杂对抗训练。每次网络评估同时预测多个去噪步,学习平均速度表示,无需JVP或有限差分回归速度导数;架构兼容任意预训练扩散/flow模型,并允许推理时选择不同NFE。 实验效果:在LTX-2.3文生视频/音频、Wan 14B文生视频和Qwen-Image文生图上,仅4到8 NFE即达到SOTA,并显著改善生成视频多样性。 批判点评:PDD横跨图像、视频和音频,说明并行解码可能成为通用少步蒸馏接口;不依赖VSD和GAN也降低训练风险。不过摘要只报4–8步SOTA,缺少相对速度与训练成本;一次预测多步是否会在极端动作中积累轨迹偏差仍需细看。 4. OmniCache:四级缓存让扩散推理最多快35% OmniCache: Multidimensional Hierarchical Feature Caching for Diffusion Models | UT Austin | arXiv:2607.23844 关键词:扩散缓存,免训练,推理加速,视频生成,层级复用 前序问题:高分辨率图像和视频扩散在多步采样中反复计算相似中间特征。现有缓存通常只利用单一维度冗余,或通过token合并求平均,容易破坏位置顺序和时空结构。 本文贡献:提出免训练多维层级缓存OmniCache,系统利用帧内、帧间、运动和去噪步四类冗余,并设计Token、Frame、Block与Layered四级缓存。方法通过相似度选择可缓存特征、跳过重复计算,再恢复位置一致的激活;空间特征可在时间层复用,时间特征也可在空间层复用。 实验效果:在保持视觉保真与运动连贯的同时,SD3、SVD-XT和Latte推理延迟分别最多降低35%、25%和28%,无需改权重或重新训练。 批判点评:OmniCache把缓存从“跨步复用一层”扩成时空、模块与层级协同,覆盖图像和视频骨干。局限是三组模型的最高收益不同,缓存命中率高度依赖内容运动;快速镜头和大形变可能减少复用,四级策略本身也增加调度复杂度。 5. OmniDelta:只留25%音视频Token仍提速1.64倍 OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs | 阿里Qwen·浙大·CMU·中科院 | arXiv:2607.25669 关键词:全模态LLM,Token压缩,Qwen,预算分配,推理加速 前序问题:全模态LLM的音频和视频token很长,现有压缩多关注“保留哪些token”,却默认模态间和模态内预算固定。查询与音视频的直接相似度难判断该给哪种模态更多预算,均匀切分又会漏掉关键片段。 本文贡献:提出免训练技能驱动框架OmniDelta。音频与视频skill pool先根据查询意图在两种模态间移动固定总预算,再依据局部复杂度和时间冗余,把各模态预算细分到音频片段与视频帧;局部预算可与已有剪枝器组合,总保留率不变,只改变算力花在哪里。 实验效果:在四个音视频基准和两款Qwen2.5-Omni模型上建立新的准确率—效率Pareto前沿。Qwen2.5-Omni-7B仅保留25% token时,GPU内存降低22%,端到端提速1.64倍。 批判点评:OmniDelta抓住了压缩前更上游的问题:先决定预算给谁,再决定删谁。数字实用且无需训练。但skill pool若误判意图,会在剪枝前就饿死关键模态;复杂跨模态推理可能无法被单一预算分配准确刻画。 6. FacialTalker:看懂人脸表情再生成共情语音 Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis | 内蒙古大学·港中文深圳 | arXiv:2607.24430 关键词:对话语音,表情建模,DPO,视觉Token,TTS 前序问题:对话语音合成需要生成符合上下文的自然、共情声音,但现有系统常忽略说话人面部表情这一细腻情绪信号;同时缺少大规模自然对话的同步语音—视频数据。 本文贡献:提出基于LLM的表情感知语音系统FacialTalker。AUTokenizer以单码本将逐帧Action Unit组合离散成紧凑视觉token;DualDPO同时对视觉token和语音token施加偏好约束,联合优化表情理解与语音语义。团队还通过自动流水线从真实网络对话构建VSDD-1K。 实验效果:VSDD-1K含超过1033小时同步说话人视频与语音,85%以上帧有人脸。客观和主观实验均超过强基线,语音更自然、富表现力且与对话情境更一致。 批判点评:从“听上下文”扩展到“看对方表情”,更贴近真实对话Agent;1033小时数据也是重要资产。但网络视频中的表情、声音与身份偏差复杂,自动采集可能带来隐私和标注噪声;Action Unit离散token也未必覆盖微妙文化差异。 7. TaoMate:固定身份锚撑住长时实时数字人 TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation | 阿里淘天 | arXiv:2607.24359 关键词:数字人,音视频生成,持久记忆,身份锚,阿里 前序问题:长时实时数字人的有界缓存只能保留近期动作和语音,旧身份信息会被遗忘;看完整历史又昂贵且会传播累积错误,导致跨分段外观漂移和音画失步。 本文贡献:提出锚点引导持久记忆TaoMate:保留不可变视觉身份锚,将完成的音视频块压缩成定容动态状态,并用模态专用残差注意力检索,不扩展活动缓存。参考感知调制联合动态与锚点外观统计;保持锚点的因果上下文蒸馏覆盖不同rollout长度、前缀来源和历史可靠性,且支持跨块阶段并行。 实验效果:在自回归长视频延续中保持跨提示分段的稳定外观和强音画同步,并通过阶段并行加速少步联合音视频生成,无需为特定流水线重新训练。 批判点评:AptAvatar解决两步速度,TaoMate则补长期记忆,两者显示淘天正搭建数字人完整栈。不可变锚可稳身份,却可能压制随时间合理变化的发型、光照或服饰;摘要没有绝对FPS和长视频时长,实时结论还需硬件指标。 8. PRISM:让模型看生成结果自己改提示词 PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation | 哈工深·中大·华南理工·广工 | arXiv:2607.24353 关键词:提示优化,文生图,自奖励,VLM,图像诊断 前序问题:文生图对提示词写法高度敏感,现有优化多在文本侧改写、扩写,或依赖外部奖励,缺少对实际生成图的结构化诊断,也难学到可复用的提示优化策略。 本文贡献:提出图像接地自奖励提示优化PRISM,闭合“提示—生成图—视觉诊断—再改提示”反馈环。统一VLM先经多任务监督微调,识别语义一致、审美质量和人类偏好问题;再以理想点与Chebyshev混合奖励进行自奖励优化,学习针对具体视觉缺陷的提示策略。 实验效果:实验显示PRISM同时提升整体图像质量与细粒度语义对齐,并能输出可解释的视觉反馈,支持有针对性的提示修正;代码已开放。 批判点评:让模型先看成片再改提示,比盲目扩写更接近人类创作迭代。风险在于VLM既当诊断器又参与自奖励,可能强化自身偏好与评分漏洞;提示变好也可能只是对特定生成器过拟合。 9. I2VShield:低算力主动阻止照片被做成视频 I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models | 中山大学 | arXiv:2607.25522 关键词:图生视频,隐私保护,对抗扰动,DiT,主动防御 前序问题:图生视频被用于未经授权地驱动个人照片。现有主动保护主要针对模型做梯度对抗攻击,防御者自己就需要大显存GPU,普通用户难以使用。 本文贡献:提出面向DiT图生视频的生成式对抗防御I2VShield。文本自适应扰动生成器结合对抗学习,以较低计算产生视觉不可察觉扰动;无目标多模态注意力破坏(MAD)直接放大DiT内部注意力特征与干净输入的偏差,破坏后续时空一致生成。 实验效果:在多个数据集和主流DiT图生视频模型上获得有竞争力的保护效果,尤其能破坏时空连贯,同时显著降低防御扰动生成的计算成本。 批判点评:它把隐私保护从事后检测前移到上传前防御,且试图摆脱大GPU门槛,现实意义强。但扰动可能被平台压缩、裁剪或重编码削弱,跨黑盒模型转移性与对抗升级仍是关键;主动破坏也可能影响合法编辑。 10. Noise-Free LoRA:去掉随机噪声一步修图反超多步扩散 Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors | 首尔大学 | arXiv:2607.25390 关键词:图像修复,一步扩散,LoRA,无噪声,任务驱动 前序问题:任务驱动图像修复既要画面好看,又要提升分类、分割、检测和OCR。扩散先验有帮助,但随机噪声让同一输入输出不稳定,可能破坏下游任务一致性。 本文贡献:论文发现预训练扩散先验可以直接做确定性、无噪声的一步前向,关键在适配器选择:LoRA能稳定提升,而ControlNet式条件并不奏效。在此基础上加入任务保持GAN训练,用感知质量约束与任务目标共同优化,避免修得好看却损伤识别。 实验效果:无噪声一步LoRA超过传统多步扩散TDIR基线,在分类、分割、检测上持续提升,并在真实退化图像与OCR中验证泛化;GAN阶段进一步改善观感而不牺牲任务表现。 批判点评:“去掉噪声、只跑一步”反而更适合任务修复,说明生成多样性在恢复场景可能是负资产。结论对端侧预处理很有价值,但优势依赖预训练扩散先验与LoRA任务适配;不同退化混合下的确定性输出也可能固化错误细节。 趋势观察 世界模型开始同时追求实时、分钟级与可回访 — Wonder以16FPS生成分钟级可探索世界并支持重访,系统重点从短视频画质转向控制、稀疏记忆和长期一致性的协同设计。 预测未来不必先生成完整视频 — GARFIELD直接建模多未来运动分布,轨迹采样快97倍、密度估计快两个数量级,规划模型正从像素预测转向结构化运动不确定性。 生成加速从单一技巧走向跨模型接口 — PDD用并行解码覆盖LTX、Wan与Qwen-Image,OmniCache则在SD3、SVD和Latte间复用四类冗余,通用性成为加速方法的新门槛。 全模态系统开始精细分配每一个Token预算 — OmniDelta只保留25%音视频token仍提速1.64倍,说明压缩关键不只是选token,而是先根据任务决定预算给音频还是视频。 生成系统从内容质量扩展到情感、隐私与任务可靠性 — FacialTalker看表情生成共情语音,I2VShield保护照片免被视频化,Noise-Free LoRA则优先保证下游识别一致性,生成技术开始承担更多系统责任。 人工智能炼丹君 整理 | 2026-07-30 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月30日
12 阅读
0 评论
0 点赞
2026-07-29
AIGC 每日速读|2026-07-29|Apple端侧Siri语音16倍实时仅21MB
今日 AIGC 论文速览 今日共 10 篇 · 端侧音频与数字人生成 2 篇 · 视觉生成推理加速 2 篇 · 可控视频编辑与专业评测 3 篇 · 全模态表示与扩散蒸馏 2 篇 · 视频模型视觉推理 1 篇 重点论文标题列表 Apple Audio DiT(Apple):端侧Siri语音16倍实时仅21MB Sol-Attn(NVIDIA):在线稀疏注意力让视频快2.3倍 UniGen-AR(CMU·UIUC·Toyota Research):一个自回归模型做15项视觉任务 AptAvatar(阿里淘天):14B数字人两步720P提速60倍 EgoPlay(Snap·KAUST):看到事件发生后才开始编辑视频 今日论文速览 1. Apple Audio DiT:端侧Siri语音16倍实时仅21MB Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers | Apple | arXiv:2607.23811 关键词:端侧TTS,Siri,音频DiT,RVQ,Apple 前序问题:Siri Expressive Voices要在设备上实时生成可配置、富表现力的语音,但语义音频token转高保真波形的detokenizer受AMX算力和内存严格限制。传统Transformer或GAN随序列长度线性甚至平方增长,难以持续合成长音频。 本文贡献:Apple提出解耦时间与RVQ深度的三组件架构:流式编码器、时间解码器和深度解码器。单个可复用的DiT式深度解码器通过stage conditioning自回归生成全部RVQ层,取代每层一个解码器;因果滑窗注意力配合固定窗口KV缓存,使运行内存不随语音长度增长。 实验效果:部署在Apple Matrix Coprocessor上,每步约10ms、约16倍实时,峰值运行内存仅21MB,端侧资产329MB,可连续合成20到320秒音频。AFM 3 Core Advanced中以10亿参数激活规模运行,相比上一代端侧TTS,整体MOS从3.87升至4.15,对话语音从3.82升至4.24。 批判点评:这是今日最强工业落地:Apple不仅给结构,还给AMX上的时延、内存、资产和MOS,证明十亿级音频生成可真正驻留端侧。代价是方案深度绑定Apple硬件与AFM token体系,16倍实时不能直接外推到通用CPU/GPU;320秒以上稳定性和多语言覆盖也未披露。 2. Sol-Attn:在线稀疏注意力让视频快2.3倍 Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification | NVIDIA | arXiv:2607.24027 关键词:稀疏注意力,视频生成,NVIDIA,免训练,推理加速 前序问题:视频DiT的长token序列让注意力成为推理瓶颈。现有免训练动态稀疏要么固定保留比例、要么按累计概率动态分配,路由预算僵硬或失衡,还要显式生成代理分数图;直接丢掉未选块则在高稀疏率下明显伤质量。 本文贡献:提出免训练Sol-Attn,将动态路由、稀疏计算与近似修正合进同一次online softmax。在线块阈值直接比较代理分数选关键KV块,不物化完整代理图,预算动态且可控;未选块的代理分数被复用来近似其贡献,避免keep-or-drop造成的信息断崖。 实验效果:在保持视觉质量的同时,视频生成端到端提速2.1倍、视频编辑提速2.3倍,并在图像与视频任务上推进免训练稀疏注意力的质量—效率前沿。 批判点评:Sol-Attn的价值不只是稀疏,而是把路由开销和遗漏补偿塞进online softmax一遍完成,NVIDIA背景也意味着内核可落地。但提速依赖模型、序列长度和阈值;代理分数对被丢块的近似在快速运动、小目标或精细文字场景中仍可能失真。 3. UniGen-AR:一个自回归模型做15项视觉任务 UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling | CMU·UIUC·Toyota Research | arXiv:2607.24157 关键词:统一视觉生成,自回归,VAR,MLLM,VQ-VAE 前序问题:文生图、编辑、修复和传统感知仍由不同模型负责;扩散虽能统一多种图像输出,但迭代采样延迟高,限制统一视觉生成在交互场景落地。 本文贡献:提出UniGen-AR,将通用MLLM与next-scale视觉自回归(VAR)解码器结合。MLLM把自由文本指令和控制信号编码为统一序列,VAR用一套权重和统一提示接口生成图像输出,覆盖四大家族15项以上任务且无需任务专用头。消融指出VQ-VAE码本大小和层级是VAR扩展的关键。 实验效果:相对扩散基线推理延迟最多降低19倍,同时保持或提升输出质量;单模型覆盖文生图、图像编辑、修复、感知等15项以上任务。 批判点评:用VAR替代扩散解码器,把统一视觉生成的效率问题正面解决,19倍延迟优势非常醒目。但自回归速度会受视觉token数量影响,VQ-VAE码本带来的量化误差仍在;15任务统一不等于每项都超过专用SOTA。 4. AptAvatar:14B数字人两步720P提速60倍 AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars | 阿里淘天 | arXiv:2607.24013 关键词:数字人,音频驱动,两步生成,分布蒸馏,阿里 前序问题:生产级音频驱动数字人既要快,又要保持身份、动作表现力和长视频稳定。现有加速常靠因果注意力、短时间窗、缩小模型或分辨率换速度,在极端两步生成时质量尤其容易塌。 本文贡献:提出14B长视频数字人AptAvatar。端点锚定分布蒸馏在普通DMD外加入Anchor Score Estimator,用冻结四步桥接生成器定义可达到的轨迹端点,指导两步学生;Self-Generated History Replay复用早期checkpoint输出作为分块训练历史,近似推理时自生成上下文而无需昂贵在线rollout。 实验效果:仅2次函数评估即可生成720P长视频数字人,推理提速60倍,同时保持视觉保真、鲜活动作、长时身份一致和文本动作控制。 批判点评:14B、720P、两步和60倍同时成立,说明淘天已瞄准直播与营销生产链。端点锚降低了两步蒸馏难度,但训练依赖四步桥接器和历史checkpoint缓存,流水线并不轻;摘要也未给绝对FPS,生产“实时”仍需硬件数据。 5. EgoPlay:看到事件发生后才开始编辑视频 EgoPlay: Event-Triggered Video Editing for Egocentric Streams | Snap·KAUST | arXiv:2607.24560 关键词:视频编辑,事件触发,第一视角,Snap,流式生成 前序问题:第一视角连续视频需要“当X发生时再做Y”,模型既要识别事件发生与否和时刻,又必须完整保留事件前画面、只改后续。检测器串联编辑器容易误触发并产生误差传递。 本文贡献:提出端到端事件触发V2V编辑器EgoPlay,在一个视频扩散模型中联合学习事件识别、时间克制和像素编辑,支持未发生事件与多事件提示。团队构建10.6万组事件触发片段—提示数据,训练双向编辑器并导出可逐块流式推理的因果版本;评测拆分触发后质量、触发前保持和假触发鲁棒性。 实验效果:相对EgoEdit,编辑质量、视觉质量和背景一致性分别提升17.7%、16.9%、16.4%;相对VLM检测器+编辑器串联基线分别提升15.7%、14.5%、13.5%,GPU内存还不到其一半。 批判点评:EgoPlay把视频编辑从“全片执行指令”升级为事件驱动程序,对AR眼镜和第一视角Agent很关键。风险是模型同时承担检测与生成,触发判断难单独校准;Ego4D里的事件覆盖有限,安全敏感场景不能只依赖生成模型自判。 6. FilmBench:电影学院用专业镜头语言重测视频模型 FilmBench: A Film-Grade Benchmark for Cinematic Video Generation | 阿里·北京电影学院·虎鲸文娱 | arXiv:2607.24241 关键词:视频评测,电影语言,多镜头,阿里,FilmOps 前序问题:多数视频生成基准用网页或LLM提示,并由通用多模态模型打总体画质、文本一致和流畅度,测到的是“像视频”,而非导演真正关心的镜头设计、动态美学和多镜头叙事。 本文贡献:提出电影级T2V/R2V基准FilmBench,与导演、北电教师和制片团队共同设计。1169条提示反推自20类获奖电影片段,其中1056条为多镜头真实shot list;评价体系含3轴、12组件、T2V 35项加R2V 3项子指标,并开放电影语言算子FilmOps和专家级自动评测Agent。 实验效果:评测9个T2V和7个R2V模型,自动评测对人类模型排名的Spearman相关分别达0.95和0.96。现有模型在动态美学上普遍不足,且从单镜头到多镜头性能明显下降,弱模型跌幅更大。 批判点评:FilmBench把视频评测从VBench式通用指标拉到专业电影语言,是生成视频走向影视生产的重要基础设施。但获奖电影反推提示可能偏向成熟电影美学,自动Agent即使排名相关高,也不代表每个镜头级解释都可靠;版权与参考片段可复现性同样重要。 7. OmniVAE:音视频VAE先对齐再联合生成 OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation | 复旦·上海创新院·MOSI·上交 | arXiv:2607.23855 关键词:音视频生成,VAE,跨模态对齐,复旦,全模态 前序问题:联合音视频生成通常分别训练音频VAE和视频VAE,两套潜空间没有细粒度对应,下游生成器不得不从零学习“哪个画面该配哪个声音”,增加同步学习难度。 本文贡献:提出联合训练的OmniVAE。除重建目标外,以片段级音视频对比学习捕获时间—语义对应并对齐潜空间;同时把预训练音频和视频语义编码器特征分别蒸馏进对应潜变量,让两种表示既保留重建能力,又更容易被下游联合生成模型学习。 实验效果:两种对齐目标持续提升潜空间可学习性,使下游文生音视频获得更高生成质量与更准确跨模态同步,验证统一表征应从VAE底座开始。 批判点评:多数工作把同步压力全留给生成DiT,OmniVAE提前在tokenizer阶段对齐,方向很对。但对比目标可能把音画关系压成粗语义相似,口型、碰撞声等毫秒级同步仍需生成器建模;联合VAE也会降低替换单一模态编码器的灵活性。 8. PDM:拆开CFG正负分支修复扩散蒸馏 Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation | 阿里通义千问 | arXiv:2607.24731 关键词:扩散蒸馏,CFG,在线策略,PDM,视频控制 前序问题:在线策略扩散蒸馏通常直接匹配教师与学生经CFG合成后的速度,但这个总目标无法唯一约束正、负两个分支:两边误差可互相抵消。当教师负分支含学生拿不到的特权信息时,正分支变好反而会伴随负分支恶化。 本文贡献:论文将该失败模式命名为负分支不对称(NBA),并提出分支感知的Positive-Direction Matching(PDM):分别约束正条件预测与CFG条件方向,使监督可识别,不再让合成结果掩盖分支错误。方法用于从稠密到稀疏的视频控制蒸馏。 实验效果:朴素CFG匹配对推理guidance scale高度敏感,PDM在不同引导尺度下实现更稳健、有效的知识迁移,修复教师负分支存在特权条件时的对抗误差动态。 批判点评:它揭示了一个容易被总loss掩盖的蒸馏病灶:CFG结果对了,不代表两个分支学对了。分析价值高于单项榜单。不过当前验证集中在稠密到稀疏视频控制,PDM对文生图少步蒸馏、不同负提示schema的普适性仍需实证。 9. VIPE:先改输入图片再让视频模型推理 Visual Prompt Engineering for Video Models | Google DeepMind | arXiv:2607.25537 关键词:视觉提示工程,视频模型,视觉推理,Google DeepMind,图像编辑 前序问题:视频生成模型正成为视觉推理基础模型,但用户仍主要优化文字提示。对于迷宫、物理轨迹等任务,原始抽象图像可能不符合模型训练分布,仅改文字无法消除视觉输入本身的表达障碍。 本文贡献:提出视觉提示工程VIPE:调用图像编辑模型自动修改任务图像的呈现方式,例如把抽象草图转成写实场景,再交给视频模型推理。它不改目标问题,只优化视觉prompt,使输入更贴近视频模型容易理解和模拟的分布。 实验效果:VIPE在多种任务上提升视频模型视觉推理,效果甚至可超过传统文本提示工程和测试时扩展,且额外计算较低。 批判点评:“不是改问题文字,而是改给模型看的世界”是很有启发的提示工程范式,Google DeepMind视频模型背景也值得关注。但编辑器可能偷偷改变物理条件或答案线索,提升不一定来自更强推理;必须验证语义与几何约束在改图前后严格等价。 10. TriLayer:视频扩散直接生成可编辑RGBA图层 Explicit Layer Modeling for Video Object Insertion and Layer Decomposition | POSTECH | arXiv:2607.25802 关键词:视频编辑,RGBA,图层分解,物体插入,扩散模型 前序问题:多数视频编辑没有显式图层表示,物体插入、复用和后期调整只能隐式推断或逐场景优化。缺少前景RGBA监督,也让阴影、反射等伴随视觉效果难与背景正确合成。 本文贡献:构建TriLayer大规模三元视频数据,逐帧对齐合成画面、背景和含物体外观及视觉效果的前景层。基于此提出双分支DBL-Diffusion,通过共享去噪和跨分支交互联合建模RGB合成与RGBA前景;DBL-Insert生成可后期编辑的插入图层,DBL-Decompose恢复前景与背景。 实验效果:显式图层建模显著提升视频物体插入保真度和图层分解质量,并让生成结果可用于真实合成与灵活后期修改。 批判点评:从最终RGB转向可编辑RGBA资产,是视频生成接入专业后期管线的重要一步。难点在于TriLayer数据如何获得真实透明度和复杂光效监督;半透明、运动模糊、反射及跨层光照很难被单一RGBA层完整表达。 趋势观察 生成模型开始进入端侧十亿参数时代 — Apple在AMX上以21MB峰值内存运行十亿参数激活规模音频生成,达到16倍实时;端侧生成竞争从小模型转向架构与硬件协同。 视觉生成加速分化为稀疏与自回归两条路线 — Sol-Attn用在线稀疏让视频编辑快2.3倍,UniGen-AR以VAR替代扩散让统一视觉任务延迟最多降19倍,计算范式本身成为核心变量。 视频产品同时追求极少步与事件驱动 — AptAvatar把14B数字人压到两步并提速60倍,EgoPlay则只在事件发生后编辑;视频生成正从整段离线采样走向低延迟、条件触发的连续服务。 评测和输出格式开始对接专业生产 — FilmBench用电影学院镜头语言重测模型,TriLayer直接生成RGBA图层;行业关注点从画面像真转向镜头设计、资产复用和后期可编辑性。 统一模型向底层表征与视觉提示延伸 — OmniVAE在VAE阶段对齐音视频,PDM拆解CFG分支监督,VIPE直接优化模型看到的图像;性能提升越来越依赖输入、tokenizer和训练目标的联合设计。 人工智能炼丹君 整理 | 2026-07-29 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月29日
15 阅读
0 评论
0 点赞
2026-07-28
AIGC 每日速读|2026-07-28|Meta单H200实时视频22.84帧MsForcing
今日 AIGC 论文速览 今日共 10 篇 · 实时与长视频生成 2 篇 · 视频测试时扩展与多人物生成 2 篇 · 理解生成统一表征 1 篇 · 可控视频与图像编辑 3 篇 · 生成部署与音频创作 2 篇 重点论文标题列表 Ms. Forcing(Brown·MIT·Meta):单卡实时视频生成22.84帧 Self Gradient Forcing(京东探索研究院):5秒训练窗口外推数分钟 CachedSearch(Google·UT Austin·CU Boulder):63%成本保留94.7%搜索收益 Twins(ICML 2026·腾讯混元·港中文):理解生成共享视觉Token GroupVideo(中科院自动化所·蚂蚁):多人物定制视频不再串脸 今日论文速览 1. Ms. Forcing:单卡实时视频生成22.84帧 Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention | Brown·MIT·Meta | arXiv:2607.20940 关键词:流式视频,实时生成,多尺度Patch,滚动扩散,DMD 前序问题:流式视频扩散虽可支持交互式世界模拟,但传统逐帧生成同时嵌套自回归与多步去噪,难以实时。滚动窗口把不同噪声级的连续帧并行去噪,却仍用同样细的空间粒度处理所有状态,浪费大量计算。 本文贡献:提出 Ms. Forcing:多尺度 Patchification(MSP)按噪声级给高噪状态分配更粗 patch,使活动窗口 token 减少45%;多尺度自注意力(MSSA)按查询尺度匹配可见 KV 密度,继续压低注意力成本。固定窗口位置决定全部尺度,计算图保持静态且硬件友好;同噪声级 DMD(H-DMD)则用来自同一源噪声级的干净预测组装训练视频,缩小训练序列与推理滚动的错位。 实验效果:单张 H200 上达到22.84 FPS,比 Rolling Forcing 快39.6%;同时在短视频和长视频设置中显著提升 VBench。 批判点评:这是今日最硬的工业数字:单 H200 首次把流式扩散推到实时帧率,而且不是单纯牺牲质量换速度。关键洞察是高噪帧无需看清每个像素。但22.84 FPS依赖H200与固定窗口配置,分辨率、模型规模和端到端编码开销需一并看;高噪粗粒度也可能损伤快速出现的小物体。 2. Self Gradient Forcing:5秒训练窗口外推数分钟 Self Gradient Forcing: Native Long Video Extrapolation | 京东探索研究院 | arXiv:2607.20368 关键词:长视频,自回归扩散,Self Forcing,KV缓存,梯度训练 前序问题:Self Forcing让模型在自身生成历史上训练,缓解训练看真值、推理看生成结果的暴露偏差;但历史KV缓存只是冻结状态,未来帧损失无法反向教会早期帧“如何写入更有用的记忆”,形成历史上下文梯度缺口。 本文贡献:提出两遍训练的Self Gradient Forcing(SGF),无需穿过完整串行 rollout 反传。第一遍无梯度执行与推理一致的自回归滚动,在抽样退出步记录自生成上下文与噪声潜变量;第二遍并行重算该步的上下文KV和未来对上下文的因果注意力,让未来视频潜变量损失监督历史记忆的写入方式。 实验效果:在逐帧与分块长时实验、不同初始化下,角色身份、背景布局和时间稳定性均强于Self Forcing;仅用5秒训练窗口即可原生外推到数分钟视频。 批判点评:它把长视频问题从“怎样读取历史”推进到“怎样写好历史”,5秒训练到数分钟外推非常抓眼。两遍法避免全序列反传,工程上也现实。不过数分钟不等于全程有意义,身份和背景稳定之外,长期叙事、动作因果与新内容丰富度仍可能衰减。 3. CachedSearch:63%成本保留94.7%搜索收益 CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion | Google·UT Austin·CU Boulder | arXiv:2607.23159 关键词:测试时搜索,视频扩散,缓存加速,Best-of-N,免训练 前序问题:测试时best-of-N搜索能让小视频模型接近大模型,却需2到10倍计算,因为所有候选都完整去噪、最后大多被丢弃。缓存可让单次生成快2到3倍,但若近似误差打乱验证器排序,就可能选错赢家。 本文贡献:首次系统研究缓存对视频候选排序的影响,并提出免训练CachedSearch:用激进缓存低成本探索所有种子,仅把缓存阶段的赢家用全计算重生成。缓存与完整生成的每提示中位Spearman相关达0.905,错误主要集中在分数近乎打平的候选,因而影响自限;方案与验证器和搜索算法解耦。 实验效果:N=8时以63%成本保留best-of-N的94.7%收益;同预算可搜索两倍宽度,收益高38%。结论覆盖1.3B到14B、Wan/LTX/CogVideoX/Hunyuan六个模型;叠加中途剪枝可节省3.11倍探索计算并保留88.6%收益。 批判点评:“便宜试遍、只精修赢家”是测试时扩展最直接的降本路线,跨四个模型家族也增强了可信度。但它仍依赖奖励器排序是否符合人类偏好,近似搜索会放大奖励黑客;新架构还需重新校准缓存参数,并非完全零配置。 4. Twins:理解生成共享视觉Token Twins: Learn to Predict Unified Representations with Focal Loss | ICML 2026·腾讯混元·港中文 | arXiv:2607.22531 关键词:统一多模态,视觉Token,ViT,VAE,Flow Matching 前序问题:统一多模态模型常用ViT语义特征做理解、VAE低层潜变量做生成,两套连续表征不一致。直接联合预测时,DiT容易拟合ViT却学不好VAE分布,难以同时满足理解、重建和生成。 本文贡献:提出Twins连续统一表征:在同一token网格按通道拼接SigLIP2 ViT特征与FLUX.2 VAE潜变量,不增加序列长度和注意力成本。团队将失衡归因于频率偏置、内在维度及条件相关/无关不确定性差异,并把Focal Loss思想改造成flow matching焦点回归,重点提升误差大的VAE维度。 实验效果:ImageNet上相对朴素MSE最高改善10.57 gFID,且不使用classifier-free guidance;多模态理解表现保持竞争力,重建保真度也提升。 批判点评:它用最简单的通道拼接绕开两套视觉接口,再用损失重加权处理“语义易学、细节难学”,ICML与混元背景值得关注。但共享token仍是两种预训练特征的并置而非真正涌现的统一空间,推理通道宽度和解码链路成本并未消失。 5. GroupVideo:多人物定制视频不再串脸 GroupVideo: Multi-Identity Customized Text-to-Video Generation | 中科院自动化所·蚂蚁 | arXiv:2607.21027 关键词:视频生成,多人物,身份保持,Video DiT,定制视频 前序问题:身份定制视频大多只支持单人;把多张人脸简单拼接成条件会造成身份混淆,人物表情与动作像把静态脸“贴”到视频上,缺乏自然性。 本文贡献:提出基于Video DiT的GroupVideo。视觉对齐联合编码多张人脸提供稳健身份参考,语义感知器负责提升动作自然度;带空间引导的ID定位模块配合边界框约束与mask正则,将身份信息限制在对应脸部区域,抑制人物间特征串扰。团队还构建2万条高质量多身份视频数据集。 实验效果:在多角色视频中,身份一致性与动作自然度均超过现有方法,并改善多人物同时出现时的身份保真;新增2万条多ID数据为后续研究提供基础。 批判点评:多人物是定制视频迈向真实叙事必须补的一环,显式ID定位比条件拼接更靠谱。局限是训练仍依赖框和mask约束,2万条数据对人物组合、遮挡与长时交互的覆盖有限;多人身份正确也不保证彼此动作逻辑自然。 6. AgentHOI:多Agent先推理再生成人物交互 AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment | 腾讯混元·中科院大学 | arXiv:2607.22241 关键词:HOI视频,多Agent,动作规划,腾讯混元,视频扩散 前序问题:人和物体交互视频不仅要让主体动起来,还要理解接触、受力与动作先后。现有方法依赖显式姿态或运动轨迹,扩展到不同物体和复杂指令时成本高、泛化弱。 本文贡献:提出thinking-before-generation的AgentHOI:感知、交互和运动规划多个Agent先把高层文本意图拆成带秒级时间区间的执行计划;再用隐式文本-运动对齐,将文本到动作先验蒸馏进视频扩散模型,使推理时无需额外运动输入。 实验效果:在穿戴、骑乘等高难物体中心场景中,显著提升交互自然度、物体外观保持和复杂文本指令遵循;代码已开源。 批判点评:混元把Agent推理从提示改写推进到动作规划,适合HOI这种先讲逻辑再画运动的任务。但文本计划无法完整表达连续接触力学,Agent链中的错误会被生成模型忠实放大;“自然”仍主要靠视觉评价而非物理正确性。 7. InnoText:一个DiT同时生成编辑中英文字 InnoText: A Unified Model for Visual Text Generation and Editing | 中山大学·京东·中科院 | arXiv:2607.22101 关键词:视觉文字,DiT,图像编辑,中文生成,统一模型 前序问题:视觉文字既要求字形结构规则又要求可读,小字号和中文尤其困难。UNet常生成乱码,现有DiT又多只做生成或编辑单项任务,造成重复训练、风格不一致和跨任务泛化不足。 本文贡献:提出统一DiT框架InnoText,在单模型内同时完成视觉文字生成与编辑。字体大小感知调制(FSAM)适配不同尺度,小字符感知增强专攻细粒度字形,任务特定区域加权损失按生成/编辑区域自适应优化;同时构建覆盖多字体、字号和背景的高质量中英双语数据集。 实验效果:实验显示生成准确率和编辑质量均优于对比方法,可输出更清晰、连贯且与背景融合自然的中英文字图像。 批判点评:把生成与编辑合并对海报、电商和本地化设计很实用,中英双语也比只测拉丁字母更有说服力。但摘要缺少量化幅度,视觉文字真正难点还包括长段排版、罕见字和任意语言,当前双语数据的外推边界待验证。 8. WhereEdit:一步编辑自动找到该改哪里 WhereEdit: Mask-aware Local Latent Editing for One-Step Image Editing | 中科院西安光机所·西交·武大 | arXiv:2607.20883 关键词:一步编辑,局部控制,AutoMask,免训练,图像编辑 前序问题:一步文生图模型让实时编辑成为可能,但现有方法主要靠文字做全局语义搬运,缺少“改哪里”的显式空间控制;即便加入区域约束,目标区修改强度也常不够,背景还容易被连带改变。 本文贡献:提出免训练、免反演的WhereEdit,把一步编辑改写为局部自适应语义运输。AutoMask从模型内部token注意力自动发现相关区域,Amplified Conditional Transport只在局部强化条件变化,同时保护非目标区域与结构一致性;额外区域监督实验进一步验证显式空间推理的价值。 实验效果:PIE-Bench上持续超过现有一步图像编辑方法,在保持一步生成效率的同时取得更高编辑质量;使用真值mask还能继续提升。 批判点评:WhereEdit补上了一步编辑最关键的空间控制,且无需训练和反演,适合交互产品。但AutoMask依赖模型注意力能正确指向目标,抽象属性、多个同类物体和大范围几何变化时容易选错区域;真值mask继续提升也说明自动定位尚未到顶。 9. KroQuant:DiT权重激活都压到4比特 KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers | EPFL·AMD | arXiv:2607.21446 关键词:DiT量化,W4A4,Kronecker变换,AMD,后训练量化 前序问题:DiT做W4A4后训练量化时,线性层输入中的离群激活超出4-bit表示范围,生成质量会严重下降。已有通道缩放损精度,Hadamard变换块大且在线成本高,完整可学习变换又要每层每步执行昂贵矩阵乘。 本文贡献:提出KroQuant,对每32个激活元素应用可学习的Kronecker结构可逆变换,参数不到逐通道缩放一半;块内结构可由tensor core小GEMM执行。离线LoRaQ权重校准再吸收剩余逐权重量化误差,把激活侧变换与权重侧修正结合。 实验效果:MI350 GPU上量化器内核最多比SmoothQuant快14%;PixArt-Σ、SANA、FLUX.1-schnell在W4A4(MXFP4e2)下,比SVDQuant和LoRaQ更接近全精度参考,同时保持或提升图像质量。 批判点评:权重和激活同时4-bit才真正触及DiT部署成本,AMD与EPFL给出的硬件内核数字比只报离线指标更可信。但14%是量化器kernel而非整条生成链路,端到端提速取决于去噪步数和算子占比;Kronecker块大小也可能需按新架构重调。 10. SoundscapeAgent:Agent把声景拆成可编辑时间线 SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision | 武汉大学·腾讯混元 | arXiv:2607.21857 关键词:音频生成,创作Agent,声景,腾讯混元,音频语言 前序问题:单次文本到音频把规划、音源选择、时间布局和混音都藏在黑盒里,用户难以控制多事件声景,也无法获得包含事件角色与时间关系的结构化音频语言监督。 本文贡献:提出SoundscapeAgent:LLM Agent把用户意图转成可执行场景计划,通过检索和按需生成获取音频素材,再按可控时间线渲染多事件混音并导出对齐元数据。用户可指定工具并直接编辑计划,实现human-in-the-loop;同一流水线还能规模化生成结构化音频语言训练数据。 实验效果:听测和客观指标显示其生成质量可与文本到音频基线竞争;使用Agent合成数据训练的模型,在下游音频推理上持续超过仅用真实数据的基线。 批判点评:它把“生成一段声音”升级为可检查、可修改的音频工程时间线,既服务创作又反哺理解数据。但检索素材的版权、来源域偏差和混音物理真实性会进入训练集;Agent生成元数据规模大不等于监督准确,仍需质量过滤。 趋势观察 流式视频正式跨过实时帧率门槛 — Ms. Forcing按噪声级动态分配空间精度,单H200达到22.84 FPS;生成加速开始从缓存和蒸馏转向更细的计算粒度调度。 长视频训练开始补上记忆写入梯度 — Self Gradient Forcing让未来损失反向监督历史KV如何写入,仅用5秒窗口外推数分钟,长时一致性从扩展上下文转向优化内部记忆。 测试时扩展进入低成本探索阶段 — CachedSearch证明缓存近似基本保留候选排序,只对赢家全精度重生成,以63%成本拿回94.7%收益,best-of-N正在变得更可部署。 理解生成统一不再只靠共享架构 — Twins直接拼接ViT语义与VAE细节表征,并用焦点回归修复优化失衡;统一模型竞争转向token空间和训练目标的共同设计。 创作Agent从改写提示走向显式规划 — AgentHOI先规划人-物动作,SoundscapeAgent把音源与时间线变成可执行计划;图像、视频、音频生成都在从单次提示走向可检查的中间状态。 人工智能炼丹君 整理 | 2026-07-28 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月28日
7 阅读
0 评论
0 点赞
2026-07-27
AIGC 每日速读|2026-07-27|NVIDIA单卡视频生成提速120倍SANA2.0
今日 AIGC 论文速览 今日共 5 篇 · 高效视频生成 1 篇 · 交互式世界模型与生成渲染 2 篇 · 可控视频生成 1 篇 · 人像图像编辑 1 篇 重点论文标题列表 SANA-Video 2.0(NVIDIA):混合线性注意力高效视频生成 WorldWeaver(UCLA·Adobe):多智能体流式世界模型 Closing the Loop(Roblox·宾州州立):免训练解决生成渲染回访不一致 GraphVid(UIUC):交互图可控的图生视频 MagicMakeup(浙大·vivo):区域可控的高保真妆容迁移 今日论文速览 1. SANA-Video 2.0:混合线性注意力高效视频生成 SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation | NVIDIA | arXiv:2607.21553 关键词:视频生成,线性注意力,扩散Transformer,高效推理,视频DiT 前序问题:视频扩散 Transformer 用全 softmax 注意力质量高但随序列二次增长、长高清视频代价大;纯线性注意力可 O(N) 扩展却缺全秩 token 交互、质量受损。 本文贡献:提出统一架构下 5B/14B 的混合视频扩散 Transformer SANA-Video 2.0:混合线性-softmax 注意力以 3:1 比例把门控线性注意力(O(N) 为主的混合)与周期性门控 softmax 锚点结合,恢复纯线性注意力缺失的全秩交互;块注意力残差(AttnRes)把完成的块摘要路由进后续线性层、复用锚点特征并把深层有效秩提升约 12%;从零训练直接学完整混合(而非线性化预训练模型),降分辨率代理实验确定 25% softmax 为质量-效率最优点。 实验效果:40 步采样下单张 H100、480p 生成 13.2s 达 VBench 84.30,与远大的 softmax 视频 DiT 具竞争力却延迟极低;编译后 DiT 前向在 720p/60s 比匹配全 softmax 基线快 3.2 倍(时长越长差距越大);再加 Sol-Engine 全栈优化(核融合/缓存/稀疏注意力)提速 3.58 倍,5B 管线 720p/5s 达 13.06s,比 Wan2.2-A14B 快 120 倍。 批判点评:用「混合线性-softmax+块注意力残差」在大幅降本下恢复 softmax 级表达力、且从零训得完整混合,单卡 720p 与 120× 提速对长高清视频落地意义大(NVIDIA 出品)。但混合比例/锚点设计的通用性、从零训练的成本、以及极长时长与更高分辨率下质量与效率的平衡仍需更多验证。 2. WorldWeaver:多智能体流式世界模型 Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers | UCLA·Adobe | arXiv:2607.21594 关键词:世界模型,多智能体,自回归扩散,状态寄存器,流式生成 前序问题:多智能体交互世界模型不仅要生成一致观测,还要维持跨智能体持久、随视角演化的世界状态;现有自回归视频扩散把观测历史作条件上下文,难在多智能体/多视角下维持共享状态。 本文贡献:提出流式多智能体视频扩散模型 WorldWeaver(W²),用跨智能体世界状态寄存器增强 rollout:可学习 token 存储共享世界信息、跟踪各智能体状态、并在每生成一块后动态更新;用跨越个体智能体状态、含鸟瞰的全局状态视图与场景文本的监督信号为寄存器提供 grounding;架构上用 Mixture-of-Transformers 让世界状态建模与视觉帧建模各用独立权重。 实验效果:在双智能体 Minecraft 视频生成上,显式世界状态建模提升了逻辑一致性与生成质量。 批判点评:用「世界状态寄存器+MoT 分权」把多智能体共享状态显式化,直指现有 AR 世界模型只靠观测历史的短板,UCLA·Adobe 出品思路扎实。但目前主要在 Minecraft 双智能体上验证,真实复杂场景、更多智能体与更长时程下的状态一致与可扩展性仍待检验。 3. Closing the Loop:免训练解决生成渲染回访不一致 Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering | Roblox·宾州州立 | arXiv:2607.21848 关键词:生成渲染,自回归视频,回环一致,免训练,3D世界 前序问题:条件视频生成可把 3D 引擎渲染(深度/无纹理几何)转成写实视频用于游戏与沉浸内容,需长时程自回归持续合成新帧并保持持久 3D 世界;但 AR 生成器用有界 KV cache 分块合成,当相机在上下文被淘汰后回访某地,即使条件渲染仍与几何对齐,模型也常重新生成不一致外观。 本文贡献:提出无需任何后训练的方案,利用 3D 引擎已提供的对应关系解决回访不一致:时间对应把位姿匹配的历史潜块检索回 KV cache 作回环记忆;空间对应用相机位姿与深度重投影,把 token 级注意力偏向检索块中几何对应区域。 实验效果:在从 TartanAir/TartanGround 挖掘的回环轨迹上(贴近复杂真实场景),在回访一致性上超过现有免训练基线,且不损整体视频质量。 批判点评:把 3D 引擎自带的时空对应变成免训练的回环记忆,精准命中 AR 生成渲染的回访漂移,Roblox 背景贴近游戏落地、零后训练很实用。但依赖 3D 引擎提供精确对应(纯生成场景不适用)、检索与重投影的额外开销,以及大幅动态/光照变化下的一致仍需更多验证。 4. GraphVid:交互图可控的图生视频 GraphVid: Interactive Graph-Controllable Video Generation | UIUC | arXiv:2607.21580 关键词:图生视频,可控生成,交互图,多主体,数据集 前序问题:可控视频生成难在用文本或主要约束像素移动的运动控制精确指定多物体交互;基于轨迹的控制常需为多物体画准确轨迹,随场景复杂度扩展差、遮挡/重叠下含糊。 本文贡献:提出图条件的图生视频模型 GraphVid,通过结构化交互图实现灵活而精确的多主体交互控制;并构建大规模、以交互为中心、带结构化关系标注的视频数据集 GraphVid-Bench 以训练交互感知的视频生成模型。 实验效果:尽管训练数据与可训练参数远少于此前运动控制方法,GraphVid 仍具强可控性与画质:相比 Motion-I2V,FID 最多降 39.9%、FVD 降 37.6%,PSNR 从 9.87 升至 15.98、SSIM 从 0.38 升至 0.61。 批判点评:用「交互图」作结构化语义接口控制多主体视频,比画轨迹更省数据、更抗遮挡歧义,指标提升明显、范式有启发。但交互图的构建与交互标注成本、复杂/开放场景下图到视频的忠实度,以及相比像素级控制的精细度边界仍需更多检验。 5. MagicMakeup:区域可控的高保真妆容迁移 MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer | 浙大·vivo | arXiv:2607.20924 关键词:妆容迁移,图像编辑,扩散Transformer,区域控制,身份保持 前序问题:妆容迁移要把参考妆容迁到源脸同时保源身份;扩散方法虽推进整脸编辑,但强区域可控、妆容保真与身份保持仍难——像素-注意力错位致溢出到非目标区、双图条件下迁移/保持概念不清致妆容属性与身份耦合、且缺身份一致且区域标注的高分辨率数据集。 本文贡献:提出基于扩散 Transformer 的区域可控高保真妆容迁移框架 MagicMakeup,建立在空间约束与概念解耦上:Token 对齐区域门控把像素 mask 与注意力对齐并施加区域特定 logit 门控以实现精确区域编辑并保身份;跨模态感知引导对齐文本与图像特征以厘清迁移与保持概念;并设计经区域特定卸妆生成 1024×1024 数据对的流程、建立合成与真实统一基准。 实验效果:大量定量定性实验表明,MagicMakeup 提升区域可控性、妆容保真与身份保持,且跨风格、种族、姿态具强鲁棒。 批判点评:用「区域门控+概念解耦」对症妆容迁移的溢出与身份耦合,配区域标注高分辨率数据与统一基准,工程扎实、vivo 背景贴近手机影像落地。但依赖卸妆合成的数据对质量、极端妆容/复杂光照下的保真,以及区域门控在细小部位的精度仍有提升空间。 趋势观察 线性注意力把视频生成推向高效 — NVIDIA SANA-Video 2.0 用混合线性-softmax 注意力,单卡 H100 生成 720p、比 Wan2.2-A14B 快 120 倍,效率成为长/高清视频生成的主战场。 世界模型走向多智能体与持久状态 — WorldWeaver 用跨智能体世界状态寄存器维持多智能体/多视角共享世界,交互式世界模型开始正视'共享状态一致'难题。 自回归生成渲染死磕长程一致 — Closing the Loop 免训练用 3D 引擎对应关系做回环记忆,解决相机回访时的外观不一致,生成式渲染向可用的持久 3D 世界靠拢。 可控生成走向结构化语义接口 — GraphVid 用交互图控制多主体视频生成、比轨迹控制更省数据更精确,'结构化语义'成为可控生成的新范式。 扩散编辑深入区域级精细控制 — MagicMakeup 用 token 对齐区域门控+概念解耦做高保真区域可控妆容迁移,图像编辑正从整脸走向部位级精修。 人工智能炼丹君 整理 | 2026-07-27 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月27日
18 阅读
0 评论
0 点赞
2026-07-23
AIGC 每日速读|2026-07-23|阿里高德5090单卡实时世界模型ABot-World-0
今日 AIGC 论文速览 今日共 10 篇 · 交互式世界模型 2 篇 · 高效图像/视频生成与编辑 3 篇 · 可控与电影级视频生成 2 篇 · 生成新用途与安全 2 篇 · 音乐生成 1 篇 重点论文标题列表 ABot-World-0(阿里·高德AMAP):单卡5090实时交互世界模型 AlayaWorld(Alaya Lab):15B交互式长时程世界模型开源 Mage-Flow(Microsoft):微软4B高效图像生成与编辑 OSVE(高丽大学):首个单步视频编辑快155倍 HeadCast(快手可灵):免训练按注意力头加速AR视频 今日论文速览 1. ABot-World-0:单卡5090实时交互世界模型 ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU | 阿里·高德AMAP | arXiv:2607.19191 关键词:世界模型,实时交互,自回归视频,蒸馏,单卡部署 前序问题:交互式视频世界模型要同时具备交互、持久时空一致、稳定长时程生成与高效响应,且此前多依赖重型算力,难在消费级单卡上实时长时程运行。 本文贡献:提出动作条件视频世界模型 ABot-World-0,配套横跨 AAA 游戏/仿真引擎/互联网视频的多源数据基建(WorldExplorer 训练反馈驱动采集 + 14 项确定性质检 + VLM 评估 + 动作/文本同步标注);训练上把双向动作条件教师经 teacher forcing 与 ODE 蒸馏渐进蒸成因果学生,并提 LongForcing 对齐长自 rollout 与扩展时程教师、抑制分布与自回归漂移;原始键盘动作作统一控制接口,参考角色记忆保第三人称身份一致;部署上协同设计流式推理栈(轻量 VAE 解码、高效注意力、内存感知调度、低比特 DiT)。 实验效果:在优化的低比特配置下,单张 NVIDIA RTX 5090 桌面 GPU 上以最高 16FPS 流式生成 720P 视频,动作到首帧延迟 1.2s、峰值显存约 19GiB;在 WorldRoamBench 与长交互 rollout 上展现有竞争力的可控性与连贯的长时程世界演化。 批判点评:把交互式世界模型压进消费级单卡(5090/16FPS/19GiB)是极硬的工程落地,多源数据基建+LongForcing 抑漂移思路完整、阿里高德背景也贴近实景重建。但 16FPS/720P 距真正丝滑仍有距离、低比特下的画质代价、超长时程一致与物理合理性、以及对开放动作的泛化仍需检验。 2. AlayaWorld:15B交互式长时程世界模型开源 AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report | Alaya Lab | arXiv:2607.18367 关键词:世界模型,交互生成,自回归蒸馏,长时程,开源 前序问题:视频世界模型能即时从文本/图像/视频生成可交互环境,但要落地需同时具备交互、持久时空一致、稳定长时程生成与高效响应四大耦合能力。 本文贡献:提出交互式长时程视频世界模型 AlayaWorld:基于 15B 视频扩散 Transformer,在相机轨迹与可切换文本提示下自回归生成短潜块;有界视觉上下文融合持久 sink 帧、压缩时序历史、几何对齐空间记忆与近帧条件;用自 rollout 收集的损坏历史与预测残差训练以降长期漂移;提出离散自回归蒸馏(结合分布匹配蒸馏、self-forcing++、一致性蒸馏)把推理从约 30 步降到每块 4 步。 实验效果:生成 540p/720p、24fps 视频,在 iWorld-Bench 上长时程生成最佳;定位为全栈、开源、长期项目,为交互式视频世界模型研究提供可扩展基座。 批判点评:15B 世界模型+四步蒸馏+全栈开源,对社区推进交互式世界模型很有价值,几何对齐空间记忆+损坏历史训练也对症长程漂移。但 24fps/720p 的实时性、复杂交互下的一致与可控、以及开源基座的训练成本与数据获取门槛,仍是从 demo 到产品要迈的坎。 3. Mage-Flow:微软4B高效图像生成与编辑 Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing | Microsoft | arXiv:2607.19064 关键词:图像生成,图像编辑,原生分辨率,VAE,少步蒸馏 前序问题:大规模视觉生成器越来越强,但训练、微调与部署成本高昂,难以兼顾高分辨率质量与交互级效率。 本文贡献:推出紧凑 4B 生成栈 Mage-Flow:由轻量高保真潜表征分词器 Mage-VAE 与原生分辨率多模态扩散 Transformer(整流流匹配)协同设计。Mage-VAE 用单步扩散式编解码+锚定潜表征正则,在保持强公开 VAE 重建质量的同时把分词成本降一个数量级以上;配合原生分辨率打包与栈级 CUDA 核融合,端到端训练吞吐提升约 2.5 倍。基于此构建 Base/RL 对齐/Turbo 三档、覆盖生成与编辑:Diffusion-NFT 提升指令遵循/文字渲染/美学/编辑保真,配对抗感知引导的少步蒸馏产出 4 步 Turbo。 实验效果:尽管规模紧凑,Mage-Flow 与 Mage-Flow-Edit 在标准生成/编辑基准上具竞争力;Turbo 变体让高分辨率交互实用——单张 A100、1024² 下生成仅 0.59s、编辑仅 1.02s,显存占用小。 批判点评:微软用「分词器-骨干-系统」协同把 4B 小模型的高分辨率生成/编辑做到 0.59s/1.02s,工业化落地感很强、成本友好。但 4B 规模在极致画质/复杂语义/长文本渲染上的天花板、与十亿级大模型的差距,以及 RL 对齐/蒸馏带来的多样性与保真权衡,仍需在更广场景验证。 4. OSVE:首个单步视频编辑快155倍 OSVE: One Step Video Editing with One Step Diffusion Models | 高丽大学 | arXiv:2607.19895 关键词:视频编辑,单步扩散,噪声预测,时序一致,实时 前序问题:扩散模型的文本引导视频编辑因多步采样与反演而慢得不实用。 本文贡献:提出 OSVE,首个成功把单步文生图(T2I)模型适配到高质量视频编辑的框架,攻克反演、可编辑性与时序一致三大难题:训练一个可学习编码器单次前向预测每帧初始噪声以绕开慢速迭代反演,并用结构感知编辑(SAE)损失在结构对齐图对上训练以在编辑中保留源视频几何;提出统一帧编辑(UFE)拼接帧潜表征在单步生成中促成跨帧注意力保时序连贯;对长视频用带锚帧的滑窗保全局一致。 实验效果:编辑质量匹配或超过 SOTA 多步方法,同时快约 155~171 倍,为实用实时视频编辑铺路;代码开源。 批判点评:把单步 T2I 迁到视频编辑、直接预测初始噪声避开反演,155~171 倍提速+结构保持的设计很漂亮,实时编辑价值大。但依赖结构对齐图对训练编码器、单步生成对大幅/复杂编辑的上限、以及长视频滑窗拼接处的一致,仍需更强样例检验。 5. HeadCast:免训练按注意力头加速AR视频 HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation | 快手可灵 | arXiv:2607.20125 关键词:自回归视频,推理加速,KV缓存,注意力头,免训练 前序问题:自回归(AR)视频扩散是长视频/流式合成的有力范式,但持续增长的 KV cache 让注意力成为主导推理成本(高分辨率下每帧 token 众多);现有缓存淘汰用粗糙启发式致帧间闪烁,或需重训。 本文贡献:提出免训练、即插即用的加速框架 HeadCast:基于「预训练 AR 模型注意力头呈稳定异质行为」的观察,短暖机后在最大噪声步一次性把每个注意力头分为 Sink/Dummy/Spatial/Global 四类,并把单体 KV cache 重构为按头分路径;关键是保留维持长程时序一致的 Global 头。因 Spatial 路径在固定网格上运算,其节省随分辨率增长。 实验效果:在多个 SOTA AR 模型上,720P 加速至多 1.62 倍、1080P 至多 1.95 倍,VBench 质量与全注意力持平且基本无闪烁;代码开源。 批判点评:「按注意力头功能分类+分路径缓存」免训练即插即用、且分辨率越高越省,对长视频/流式生成的推理成本是很实用的解法(可灵背景更贴落地)。但一次性分类的稳健性、四类原型对不同模型的普适、以及在极长序列/更高分辨率下保真与加速的平衡,仍需更多模型验证。 6. ShotPlan:可学习规划token做电影级多镜头 ShotPlan: Cinematic Video Generation with Learnable Planning Token | 中国电信TeleAI·哈工大 | arXiv:2607.17675 关键词:电影级生成,多镜头,规划token,转场,视频扩散 前序问题:现有视频生成在单镜头上效果惊艳,但电影级生成需要连贯叙事与有效多镜头组合、需显式镜头规划,仍受限。 本文贡献:提出 ShotPlan,在视频扩散基座上做显式多镜头电影级生成:引入可学习规划 token 捕捉镜头级转场线索、可与原视频生成 token 无缝融合以控制转场时间戳;规划 token 配分数时间旋转位置编码(FRoPE),使镜头转场可在帧级建模。 实验效果:显著超过现有电影级视频生成方法,提供更灵活的镜头管理与更强的镜头间一致性。 批判点评:用「可学习规划 token+帧级 FRoPE」把多镜头转场显式化,是对电影级叙事生成痛点的对症设计,中国电信 TeleAI 出品。但多镜头的叙事连贯不止转场时机,人物/场景跨镜头一致、复杂运镜与更长叙事的可控性,以及与专业剪辑的差距仍需更多验证。 7. The generator is the tracker:视频生成器即多目标跟踪器 The generator is the tracker: Multi-object tracking by painting persistent identity colours | 康奈尔大学 | arXiv:2607.17120 关键词:多目标跟踪,视频生成,身份一致,重识别,LoRA 前序问题:多目标跟踪(MOT)传统被拆成检测+关联,身份靠轨迹缓存、运动模型、外观嵌入等外部状态维护;能否让视频生成器直接用像素维护这种状态? 本文贡献:微调 22B 文生视频扩散模型(LTX-2.3)配轻量上下文 LoRA,把 RGB 片段翻译成 ID-map 片段——每个人被涂成随时间持久的独特纯色(同色=同身份);长视频以链式窗口生成、每窗以上一窗清理后的尾部为条件,短续训教模型延展给定着色,身份便无需跟踪器/运动模型/重识别模块地沿链流动。 实验效果:DanceTrack 测试榜上达 40.3 HOTA(据称首个上榜且无检测器/无跟踪栈的生成式跟踪器),虽低于专用 SOTA(≥70),但误差画像独特——关联分 AssA 44.1 超原基准全部跟踪器,短板仅在检测;同样生成窗改用经典事后关联得分差一倍(18.2 HOTA);383 个遮挡事件中以 42% 条件率在间隙后重获身份(外观嵌入基线为 0),表明其着色是涌现的重识别信号。 批判点评:「让生成器用像素维护身份」把 MOT 重构为着色生成,关联能力与遮挡重识别的涌现很惊艳、思路极具启发。但 40.3 HOTA 距实用尚远(检测是硬短板)、依赖 22B 大模型链式生成成本高、极密集/快速场景下的可扩展性仍是问题,更像范式验证而非即用方案。 8. Keyframe-Anchored:序列动作视频的身份保持 Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation | 中科大 | arXiv:2607.17985 关键词:身份保持,文生视频,关键帧,序列动作,免训练 前序问题:保身份的文生视频要在整段视频中维持指定主体可识别性;IPVG26 挑战把它从单一整体提示扩展到带时间戳的动作序列——主体须按序完成一串不同动作且身份一致,而端到端生成器随运动累积易外观漂移。 本文贡献:提出免训练三阶段流水线:动作感知提示润色阶段先把输入改写为指定每个动作终态的图像生成提示;保身份生成阶段以参考身份与前一帧联合条件产出关键帧序列,从而解耦时不变外观与时变姿态;身份感知推理增强阶段用多参考引导与身份驱动噪声搜索合成中间片段,双重强化采样期身份保真。 实验效果:在 IPVG26 官方 Track 2 榜排名第三,展现有竞争力的性能与较强通用性。 批判点评:用「关键帧锚定+解耦外观与姿态」免训练做序列动作身份保持,工程组合清晰、竞赛第三也证明有效。但依赖关键帧质量与多阶段拼接,中间片段合成的动作流畅、长序列多动作下的累积漂移,以及免训练相对专门训练方法的天花板仍待观察。 9. BSB:时序一致性越狱商用T2V Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models | 中科大 | arXiv:2607.17279 关键词:文生视频,越狱攻击,时序一致性,MCTS,AI安全 前序问题:文生视频(T2V)模型广泛部署,其对越狱攻击的鲁棒性引发担忧;现有方法多从文生图迁移,未利用视频固有的时序一致性、需大量视频查询优化(黑盒不可行)、且对抗提示搜索靠启发式局部信号缺结构化探索。 本文贡献:提出结构化、查询高效的 T2V 越狱框架 BSB:利用时序一致性,把有害意图编码为两个各自无害的「边界状态」之间的转变,攻击那些插值时易在中间帧产生不安全内容的边界状态对;为避免在视频空间直接评估所有候选的高昂开销,BSB 在更廉价的文本代理空间做蒙特卡洛树搜索(MCTS),并用稀疏视频级评估定期校准。 实验效果:在 Veo 3.1、Sora 2、Seedance、Kling v1 等主流商用 T2V 上,BSB 超越所有现有越狱基线,攻击成功率较最强对手平均相对提升 18.6%;揭示时序一致性是被忽视却关键的攻击面。 批判点评:把「时序一致性」从能力变成攻击面、用文本代理空间 MCTS 做查询高效黑盒越狱,视角新颖且对主流商用模型有效,安全警示意义大。但作为攻击方法需警惕滥用、防御侧的对应缓解未深入,攻击在持续迭代的商用安全策略下的长期有效性也存疑。 10. Full-Song:分层自回归+流匹配全曲生成 Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering | 阿里(Token Foundry) | arXiv:2607.20253 关键词:歌曲生成,自回归,流匹配,RVQ,翻唱 前序问题:从歌词、文本描述与音乐属性生成高质量全长歌曲仍具挑战,且需统一支持词到歌、纯器乐、翻唱等多任务。 本文贡献:提出统一歌曲生成框架,支持歌词到歌、器乐生成、翻唱三任务:语义感知分词器把音频编码为 8 码本 RVQ token;hybird-LM 在其上做分层自回归音频 token 建模生成全曲;FullDiT 在连续 VAE 潜空间以码本 token/歌词/文本为条件做全曲流匹配以提升保真;翻唱用旋律模块从参考音频抽取并离散化旋律线索、在保留原旋律的同时引导生成;并探索 DPO/GRPO/OPD 做 hybird-LM 后训练、对 FullDiT 用基于流的 GRPO 提升音乐性与渲染质量。 实验效果:在多语种自动基准与 Artificial Analysis 带人声音乐榜上,框架在所评设置下取得有竞争力的表现。 批判点评:「分层自回归规划+流匹配渲染」的双阶段设计兼顾结构与音质、还统一了词到歌/器乐/翻唱三任务(阿里出品),工程完整。但全曲生成对长程结构、人声吐字与音乐性要求极高,多任务统一下各子任务的上限、翻唱的版权与旋律保真边界,以及主观音乐性的稳定性仍需更多盲测检验。 趋势观察 世界模型冲进消费级实时 — ABot-World-0 单张 RTX5090 跑 720P/16FPS 实时交互世界、AlayaWorld 15B 开源长时程世界模型,交互式世界模型正从云端走向桌面单卡。 高效小模型吃下生成与编辑 — 微软 Mage-Flow 用 4B 栈把 1024² 生成压到 0.59s、编辑 1.02s,'紧凑协同设计'让高分辨率生成编辑走向交互实用。 少步/免训练把视频推向实时 — OSVE 首次让单步 T2I 做视频编辑快 155~171 倍、HeadCast 免训练按注意力头分类加速 AR 视频,效率优化在编辑与长视频两端并进。 视频生成能力外溢到感知与叙事 — '生成器即跟踪器'用视频生成做多目标跟踪、ShotPlan 用规划 token 做多镜头电影级叙事,生成模型的能力正外溢到跟踪、导演等新任务。 生成的可信与安全被正面拷问 — BSB 用时序一致性越狱主流商用 T2V(攻击成功率相对+18.6%),揭示视频生成安全的新攻击面,安全治理需跟上能力跃迁。 人工智能炼丹君 整理 | 2026-07-23 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月23日
9 阅读
0 评论
0 点赞
2026-07-22
AIGC 每日速读|2026-07-22|华为40万美元逼近闭源Boogu-Image
今日 AIGC 论文速览 今日共 10 篇 · 统一图像生成与编辑 2 篇 · 视频编辑与长视频一致性 5 篇 · 视频插帧与生成效率 1 篇 · 情绪语音生成 1 篇 · 像素扩散技术综述 1 篇 重点论文标题列表 Boogu-Image-0.1(华为香港AI Lab·港大·港科大):40万美元逼近闭源图像模型 D2DF(西交·国家电网AI Lab·浙工大·百度):视频消物一秒只需一步 SlotMem(港大·清华):按角色寻址记住长片人物 ReBind(快手可灵·港科大·南大·北大):显式绑定多参考视频编辑 FlowMimic(字节):图片编辑数据实时变视频 今日论文速览 1. Boogu-Image-0.1:40万美元逼近闭源图像模型 Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget | 华为香港AI Lab·港大·港科大 | arXiv:2607.13125 关键词:统一多模态,文生图,图像编辑,Agent推理,开源模型 前序问题:Nano-Banana-Pro、GPT-Image-2 等闭源系统靠模型理解、提示改写与推理时编排形成系统级优势,但内部配方不公开;开源社区如何在有限数据和算力下同时做好文生图、快速推理、指令编辑和中英文字渲染,缺少可复现路线。 本文贡献:发布 Boogu-Image-0.1 开源统一理解生成模型族,含 Base、Turbo、Edit、Edit-Turbo。核心不是只堆生成骨干,而是强化多模态编码器、Agent 式提示重写、数据质量和训练管线,并用 Agentic inference-time scaling 把理解能力转成生成与编辑质量;权重、代码和训练配方均以 Apache 2.0 开源。 实验效果:仅使用 2.0862 亿张去重图像,Base 理论训练成本约 40 万美元;标准基准上持续匹敌或超过其他开源模型,结果逼近领先闭源系统,并覆盖高质量文生图、快速推理、指令编辑和中英文字渲染。 批判点评:「华为团队用 40 万美元把开源模型推近闭源系统」兼具机构信号与成本冲击力,且把系统级配方完整开放,比单点榜单更有价值。但“理论训练成本”未必包含数据、失败实验与基础设施总成本;逼近闭源的结论也依赖所选基准,真实复杂编辑和生产稳定性仍需社区复验。 2. D2DF:视频消物一秒只需一步 From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting | 西交·国家电网AI Lab·浙工大·百度 | arXiv:2607.14976 关键词:视频编辑,物体移除,一步生成,一致性蒸馏,视频修复 前序问题:视频物体移除中,光流/注意力传统方法容易留伪影、结果不自然;扩散方法更真实却需要多步去噪,速度难以实用,而且常依赖外部粗糙移除稿作为输入。 本文贡献:提出 D2DF 三阶段框架:先训练教师把低质移除草稿多步精修成高保真视频;再用先验特权一致性蒸馏(PPCD)将能力压到一步学生;最后以基于时序掩码 Transformer 的自引导快速植入(SGFP),在潜空间自动生成场景一致伪草稿,得到完全不依赖外部草稿的一步模型。 实验效果:有草稿和无草稿两版在多项指标上均达 SOTA,质量与效率超过传统及多步生成方法;单个视频的去噪过程约 1 秒。 批判点评:从“多步精修草稿”蒸馏到“无草稿一步消物”,既解决速度又去掉外部依赖,1 秒数字极具产品价值。但 SGFP 伪草稿的场景推断仍可能在大面积遮挡、复杂动态背景中失真,一步模型的失败可修复性也弱于多步迭代。 3. SlotMem:按角色寻址记住长片人物 SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation | 港大·清华 | arXiv:2607.15772 关键词:长视频生成,角色一致性,内部记忆,DiT,叙事视频 前序问题:叙事长视频中角色跨场景、隔很久再出现时容易换脸。全局记忆的检索线索并不针对身份,现有角色方法又把身份和姿态、背景等偶然因素混在粗粒度帧级 KV 中,有限容量下还缺少持续更新。 本文贡献:提出可按角色寻址的内部记忆 SlotMem:Character-Semantic Probe 从交叉注意力中定位角色相关 token;Memory Encoder 把 DiT token 压成紧凑的逐角色 slot;Memory Writer 随生成保守更新每个角色的新观察;Character-Wise Cross-Attention 只把对应角色记忆注入同一人物的局部 token。 实验效果:在多个叙事长视频基准上,相比现有方法显著改善跨长时间间隔的角色一致性,同时维持相当的视频总体质量;代码已开源。 批判点评:把“记住整帧”改成“按角色地址读写”,对多角色长片身份漂移非常对症,内存也更省。但角色探针一旦漏检或多人遮挡、换装,错误可能写回并长期污染;如何处理新角色、身份合并与开放世界角色数量仍是难点。 4. ReBind:显式绑定多参考视频编辑 ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships | 快手可灵·港科大·南大·北大 | arXiv:2607.14681 关键词:视频编辑,多参考,结构化指令,可灵,视觉绑定 前序问题:多参考图条件视频编辑需要明确“哪个参考提供哪个属性”,但自然语言指令通常不写清参考关系,通用 MLLM 也难稳定生成,导致人物、材质、灯光等来源互相串线。 本文贡献:提出 ReBind,以在语义位置嵌入 reference token 的结构化指令作为中间表示,显式绑定视觉属性与来源。ReBind-Instruct 通过两阶段渐进训练学习生成精确参考关系;ReBind-Edit 则轻量适配文生视频模型,按绑定关系协调多个参考源。 实验效果:ReBind-Instruct 的指令质量显著超过通用 MLLM;ReBind-Edit 在参考图条件视频编辑中达到开源方法 SOTA,能更准确组合多视觉来源。 批判点评:把多参考歧义从“模型自己猜”变成结构化显式绑定,是复杂编辑走向可控生产的关键一步,可灵团队也有真实产品场景。但需要专用 MLLM 先生成中间指令,链路更长;参考关系正确不代表遮挡、几何和时间一致性一定正确。 5. FlowMimic:图片编辑数据实时变视频 FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry | 字节 | arXiv:2607.18227 关键词:视频编辑,数据生成,光流,图像视频统一,免Mask 前序问题:视频编辑数据采集依赖人工 mask、I2V/ControlNet 合成和 VLM 过滤,不仅耗时、易引错,任务多样性也远落后图像编辑;推理时还常需外部 MLLM 或显式 mask 才能定位编辑区域。 本文贡献:提出像素对时序扭曲流场,可从图像编辑样本实时生成对应视频编辑样本,并证明仅用这类数据即可学习多层级视频编辑。将图像视作视频特例,以生成/编辑两种 modality mimic loss 让图像与视频能力互相模仿;再加入指代表达分割等感知任务和区域感知潜空间、注意力损失,让模型内化“理解指令—定位区域—只改该处”的能力。 实验效果:无需人工视频 mask 与传统重型合成管线,即可在线扩展多种视频编辑任务;同一模型统一图像/视频生成与编辑,并实现推理期免 mask 的区域感知编辑。 批判点评:把海量图像编辑数据通过流场实时“升格”为视频数据,直击视频编辑数据荒,字节背景也说明工程价值。但扭曲流场能模拟的运动与遮挡仍有限,由图像任务迁移出的时序规律未必覆盖真实长视频和复杂镜头运动。 6. STBridge:让模型说的和画的一致 STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs | 腾讯优图·吉林大学 | arXiv:2607.17140 关键词:统一多模态,理解生成对齐,图像编辑,强化学习,腾讯优图 前序问题:统一多模态模型虽然共用架构,却可能正确描述目标、实际编辑出另一回事;语言输出与视觉输出分居不同空间,在细粒度实体、属性、空间关系和局部细节上尤其缺乏同一目标约束。 本文贡献:提出共享目标对齐 STBridge:在图像编辑中,让目标 caption 表达期望视觉结果、编辑图像实现同一结果,以共同目标状态串起理解和生成。训练采用 align-then-optimize:先监督微调建立共享目标通道,再以序列强化学习优化围绕目标的跨任务协同。 实验效果:在视觉理解、图像生成和图像编辑基准上均持续优于初始化模型;对齐分析确认“模型描述的目标”和“模型生成的结果”之间差距明显缩小。 批判点评:指出“共架构不等于共语义”,并用共享目标把说与画绑在一起,是统一模型后训练的重要方向。但依赖高质量目标 caption 和顺序 RL,目标文本可能成为新的信息瓶颈;复杂视觉变化也未必能被一句 caption 完整表达。 7. TANGO:测试时绕开长视频死路 Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation | CERTH·阿姆斯特丹大学 | arXiv:2607.15849 关键词:自回归视频,测试时适配,长视频,噪声引导,FVD 前序问题:自回归视频扩散可生成任意长视频,却会累积误差并逐渐偏离训练条件分布;即使每帧看起来都在真实流形上,某些轨迹也可能走到模型无法继续的“终点”,后续必然崩坏。 本文贡献:提出测试时终点规避 TANGO:假设可良好延续的未来轨迹,其预测噪声应匹配前向加噪的各向同性高斯分布。模型先向前预测一步,用自身充当输出批评器;一旦预测噪声偏离期望分布,就搜索替代轨迹,避免驶入终点,无需重新训练骨干。 实验效果:相对 SOTA,VBench 绝对提升 3.1%,15 秒视频上的平均 FVD 降低 28.3%;代码已开放。 批判点评:让扩散模型用噪声分布自检未来能不能走通,比只把当前帧拉回真实流形更深入,测试时即可插入。但前瞻搜索增加推理开销,各向同性噪声假设未必适合所有内容,且只能绕路、不能补足模型缺失的动态知识。 8. SPEED:一步像素扩散插帧快63% SPEED: One-Step Pixel Diffusion for High-quality Video Frame Interpolation | ACM MM 2026·复旦·B站 | arXiv:2607.15585 关键词:视频插帧,像素扩散,一步生成,4K,ACM MM 前序问题:扩散视频插帧有两大瓶颈:潜空间经 VAE 解码不可避免丢失细节,多步采样又带来高显存与高延迟;尤其 4K 插帧中,精细纹理与效率难兼得。 本文贡献:提出一步像素扩散 SPEED:渐进多阶段架构配动态 patch 缩放,学习多尺度运动、结构和外观;Noise-Update-Only Attention 只更新噪声、保护干净条件帧语义并把计算降近 50%;漂移感知时间步采样与定制目标直接在像素空间预测图像,实现不降质的一步推理。 实验效果:SNU-FILM 上 LPIPS 降低 8.8%,推理加快 63.3%、显存降低 10.6%;在高难 4K 基准上 LPIPS 最多优于先前方法 51.5%,达到 SOTA。 批判点评:一步、像素空间、4K 三个难点同时拿下,复旦+B站且获 ACM MM 2026,数字很硬。但像素扩散训练成本可能转移到离线阶段,动态 patch 与多阶段结构更复杂;插帧 SOTA 不等同于通用视频生成可直接受益。 9. AuEmoChat:离散情绪token让对话更真 AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis | ACM MM 2026·内蒙古大学·港中文深圳 | arXiv:2607.15755 关键词:对话语音合成,情绪生成,Flow Matching,Token合并,TTS 前序问题:对话语音合成要理解多轮上下文并表现像人的细腻情绪,但现有方法常把情绪压成七类等有限标签;同时历史中的冗余多模态 token 干扰上下文理解,导致声音情感僵硬或前后不一致。 本文贡献:提出 AuEmoChat:AuEmoCodec 用有限标量量化从大规模情绪语音学习离散真实情绪 token 空间;AuEmoToMe 在保留情绪相关上下文的同时合并冗余多轮 token;自回归文本-语音模型预测目标情绪与语音 token,最后用 Authentic Emotion Flow Matching 联合对话上下文、情绪和声学先验渲染语音。 实验效果:在 NCSSD-EmCap 上超过 SOTA 对话语音合成基线,生成语音的情绪表达更丰富、更真实;代码与语音演示计划开放。 批判点评:从少数人工情绪标签转向数据驱动的离散情绪空间,并同时处理多轮冗余,贴近真实对话产品。但“真实情绪”评价主观且受数据文化偏差影响,离散 token 也可能把连续情绪重新切碎;跨语言、跨说话人泛化仍是关键。 10. Pixel-Space DiT:像素DiT绕开VAE细节瓶颈 Pixel-Space Diffusion Transformers | 北大·Stanford·Cornell·南大 | arXiv:2607.17585 关键词:像素扩散,DiT,VAE,生成综述,统一多模态 前序问题:潜扩散靠 VAE 压缩实现高效高分辨率生成,但固定视觉 tokenizer 会丢纹理和结构细节,重建目标与生成目标分离也限制端到端优化;直接像素扩散则面临高维建模、噪声调度、损失加权和 token 效率难题。 本文贡献:系统综述 Pixel-Space Diffusion Transformer,从模型架构、连续生成机制和统一多模态建模三条线梳理直接在原始像素上扩散的方法,讨论如何去掉 VAE 瓶颈,并让像素、文本与任务条件进入共享 token 空间由同一 Transformer 处理。 实验效果:归纳当前像素 DiT 的代表方法、核心挑战与技术路线,指出其在高保真单阶段生成及理解生成一体化视觉基座上的潜力,并给出未来研究方向。 批判点评:像素空间正在重新成为生成主线,这篇综述适合建立全景认知;但它不是新算法、没有单一实验突破,且像素 DiT 的巨大训练成本与 token 数仍是现实约束,应放在今日列表末尾而非主推。 趋势观察 开源图像模型开始公开系统级配方 — Boogu-Image 不只开权重,还公开强编码器、Agent 提示改写、数据与训练管线,以约 40 万美元理论成本逼近闭源系统,竞争从单模型走向完整生成系统。 视频编辑同时冲刺一步化与免标注数据 — D2DF 把视频消物压到一步约 1 秒,FlowMimic 则把图像编辑样本实时变成视频数据;一个砍推理成本,一个砍数据成本。 长视频从全局缓存转向结构化记忆与自检 — SlotMem 按角色地址读写身份记忆,TANGO 在测试时用预测噪声自检轨迹死路,长视频一致性开始从粗粒度历史帧走向可解释内部状态。 复杂编辑把视觉来源和目标语义显式绑定 — ReBind 用 reference token 绑定多参考来源,STBridge 用共享目标绑定模型说的与画的,可控编辑正在减少让模型自行猜测的隐式接口。 生成底座向像素空间与真实情绪扩展 — SPEED 以一步像素扩散实现 4K 插帧,Pixel-Space DiT 总结绕开 VAE 的技术路线;AuEmoChat 则把生成边界扩到多轮对话中的细腻情绪语音。 人工智能炼丹君 整理 | 2026-07-22 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月22日
18 阅读
0 评论
0 点赞
2026-07-21
AIGC 每日速读|2026-07-21|腾讯混元4步视频胜50步强化扩散MeanFlowNFT
今日 AIGC 论文速览 今日共 5 篇 · 生成强化学习与少步加速 1 篇 · 视频DiT系统加速 1 篇 · 世界模型与科学多模态生成 2 篇 · 多模态智能体安全 1 篇 重点论文标题列表 MeanFlowNFT(腾讯混元·港科大):4步视频胜50步强化扩散 FVAttn(腾讯微信·中山大学·北大):稀疏注意力提速4.41倍 Orbis 2(弗赖堡大学):分层世界模型兼顾远景细节 S1-Omni(ScienceOne AI·文歌科技):统一200类科学任务推理生成 Lucid(UC Irvine):不可见扰动毒化智能体记忆 今日论文速览 1. MeanFlowNFT:4步视频胜50步强化扩散 MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators | 腾讯混元·港科大 | arXiv:2607.15273 关键词:视频生成,MeanFlow,强化学习,少步采样,奖励对齐 前序问题:MeanFlow 通过预测时间区间平均速度实现少步生成,但现有 DiffusionNFT 前向过程强化学习优化的是瞬时速度,两者目标不匹配;如何在保留 MeanFlow 少步采样优势的同时做可靠奖励对齐,仍未解决。 本文贡献:提出 MeanFlowNFT:利用连接平均速度与瞬时速度的 MeanFlow 恒等式,构造诱导瞬时速度预测器,再把 DiffusionNFT 目标施加到该预测器上,使奖励优化在数学上成立;实际采样仍走平均速度,因此保留快速少步生成,并证明继承 DiffusionNFT 的严格策略改进保证。 实验效果:图像与视频生成均稳定提升基线;SD3.5-M 的 8 项指标中 6 项超过此前 SOTA 少步 RL 生成器。Wan2.1 上仅 4 步即获 VBench 84.33,超过 50 步 LongCat-Video RL 的 82.57。 批判点评:把瞬时速度 RL 桥接到平均速度生成器,既有理论保证又拿出「4 步胜 50 步」的工业级数字,腾讯混元背景也很接近落地。但仍依赖 DiffusionNFT 的奖励与训练设定,少步模型在复杂长视频、细粒度运动上的稳定性,以及不同奖励下是否都能保持严格改进仍需扩验。 2. FVAttn:稀疏注意力提速4.41倍 FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation | 腾讯微信·中山大学·北大 | arXiv:2607.16190 关键词:视频DiT,稀疏注意力,负载均衡,多GPU,推理加速 前序问题:高分辨率视频 DiT 的长时空序列让自注意力成为主瓶颈;免训练 Top-p 稀疏注意力虽省计算,却在多 GPU 序列并行下造成各注意力头负载不均,最慢 rank 拖住全局同步,稀疏收益被等待开销吃掉。 本文贡献:提出 FVAttn 免训练稀疏注意力系统:以 Top-p 路由、Top-k 安全下限和视频感知分块构造稀疏前端,再按当前真实 mask 在运行时修复调度。运行时负载均衡通过 P2P 迁移少量重头缩短关键路径;Slack-Aware Sparse Augmentation 用额外高价值块填充非关键 rank 的空闲,并将调度与迁移开销同计算重叠。 实验效果:在步蒸馏 Wan2.2 I2V 上把平均负载不均衡从 1.34 降至 1.08;相对 FlashAttention,注意力提速 4.41×、DiT 推理提速 2.02–2.11×,同时保持有竞争力的视频质量。 批判点评:抓住「稀疏了却被最慢 GPU 拖死」这一系统瓶颈,运行时搬重头+用高价值块填空闲的设计很工程化,4.41× 注意力提速也扎实。但收益依赖多 GPU 序列并行、专用调度与 P2P 拓扑,单卡无红利;跨模型、不同显卡互联与更长视频下的迁移开销边界仍待验证。 3. Orbis 2:分层世界模型兼顾远景细节 Orbis 2: A Hierarchical World Model for Driving | 弗赖堡大学 | arXiv:2607.15898 关键词:驾驶世界模型,分层预测,Diffusion Forcing,DINOv2,长时生成 前序问题:现有驾驶世界模型通常只在单一抽象层预测:要么追求像素保真却缺空间推理与语义理解,要么长时滚动误差不断累积,难同时服务真实下游规划与高质量生成。 本文贡献:提出分层驾驶世界模型,将未来预测拆成两个时间与抽象尺度:高层预测器在压缩 DINOv2 语义潜空间中预测长时粗场景结构和子目标;低层生成器在 VAE 潜空间中受高层输出条件约束,生成短时精细画面。训练上先用 diffusion forcing 获得更丰富表征,再用 teacher forcing 微调以稳定自回归滚动。 实验效果:在标准驾驶世界模型评测上全面达到 SOTA,覆盖长时生成保真、反事实场景下的转向响应,以及内部表征质量;兼得高感知保真与更强空间、语义表示。 批判点评:「高层管远景语义、低层补近景细节」符合驾驶规划的天然层级,两阶段训练也把 diffusion forcing 的表征优势与 teacher forcing 的稳定性拼起来。但系统复杂、两级误差会相互传递,对极端交通事件和跨城市域偏移的可靠性,以及是否真能改善闭环驾驶安全仍需实车验证。 4. S1-Omni:统一200类科学任务推理生成 S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation | ScienceOne AI·文歌科技 | arXiv:2607.15686 关键词:AI4S,统一多模态,科学生成,分子生成,科学图像 前序问题:AI for Science 被领域模型、工具增强 LLM 与科学语言模型割裂,不同模型各管蛋白、分子、材料或图像,难在同一模型里联合建模异构数据、科学规律和专家知识。 本文贡献:提出 S1-Omni,以三部分统一科学理解、预测与生成:把自然语言、CIF、SMILES、蛋白序列、光谱和科学图像映入共享任务空间;在数据构造、验证与训练中注入科学定律和专家知识;按任务连接原生领域解码器,支持属性预测、光谱到分子生成、蛋白位点/结构预测、科学图像生成与编辑。S1-Omni-Corpus 覆盖 200 类科学任务和数百万推理样本。 实验效果:在 60 多个科学基准上评测,多数基准超过 GPT-5.5 与 Gemini-3.1-Pro,并在若干任务上匹敌或超过领域专用模型。 批判点评:将符号序列、科学图像与领域规律放进统一模型,200 类任务与 60+ 基准规模很有冲击力。但跨领域总榜容易掩盖单任务深度,科学定律是否真正进入推理而非数据相关性、闭源强基线的评测公平性,以及科学生成结果的实验可验证性都需独立复核。 5. Lucid:不可见扰动毒化智能体记忆 Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents | UC Irvine | arXiv:2607.15657 关键词:多模态智能体,长期记忆,视觉攻击,记忆投毒,安全 前序问题:多模态智能体把历史图文写进长期记忆并在未来检索,却默认视觉数据可信、没有语义完整性验证;攻击者若只改图片、不能碰文本与模型,是否仍能持续污染后续生成,尚未被系统研究。 本文贡献:提出 Lucid 黑盒视觉攻击框架,在不知道目标 MLLM、检索编码器或文本通道的严格图像边界威胁模型下,构造肉眼不可见扰动:有历史文本上下文时做 memory poisoning,替换被文本强化的良性图像并扭曲回忆;无上下文时做 memory injection,让图像直接注入攻击者叙事。覆盖图结构、LLM 摘要及商业系统等五种黑盒记忆架构。 实验效果:跨多种对话领域,记忆投毒攻击成功率达 61.6%,记忆注入达 58.4%,暴露出多模态长期记忆「检索相似即信任」的结构性漏洞。 批判点评:只靠不可见图片扰动、完全黑盒就能让错误记忆跨会话持续生效,攻击面比单轮越狱更危险,数字也足够醒目。但实验仍依赖代理视觉编码器的迁移性;现实平台的图片重压缩、重编码与人工审核可能削弱攻击,论文主要揭示风险,防御机制尚未闭环。 趋势观察 少步生成与强化学习开始真正合流 — MeanFlowNFT 用平均-瞬时速度恒等式把前向过程 RL 接进 MeanFlow,Wan2.1 四步 VBench 84.33 超过 50 步 RL 模型,奖励对齐不再必须牺牲采样效率。 视频加速从算法稀疏深入分布式调度 — FVAttn 不只剪注意力,还在运行时迁移重头、填平 GPU 空闲,把稀疏注意力的 rank 拖尾变成可优化的系统问题。 世界模型走向语义与细节分层 — Orbis 2 用 DINO 高层预测远期语义、VAE 低层生成近景细节,世界模型从单尺度像素预测转向面向规划的层级抽象。 统一多模态扩展到科学原生对象 — S1-Omni 将 CIF、SMILES、蛋白、光谱与科学图像纳入同一模型,统一生成理解正从通用图文扩到原生科学表示。 长期记忆成为多模态智能体新攻击面 — Lucid 证明肉眼不可见的图片扰动可在黑盒条件下持续污染跨会话记忆,安全边界正从当前提示扩展到历史视觉证据。 人工智能炼丹君 整理 | 2026-07-21 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月21日
26 阅读
0 评论
0 点赞
2026-07-16
AIGC 每日速读|2026-07-16|字节Seed读回提示当奖励SpectraReward
今日 AIGC 论文速览 今日共 5 篇 · 文生图强化学习与奖励 1 篇 · 视频生成潜空间与物理评测 2 篇 · 文生图个性化 1 篇 · 统一视觉表示与编辑 1 篇 重点论文标题列表 SpectraReward(港大·字节Seed·北大):MLLM读回提示当零样本奖励 VideoRAE(港中文深圳·华科·中科大):冻结视频基座炼成生成潜空间 Seriality Gap(UC Berkeley):视频扩散缺可扩展串行算力 IdentityTuning(特拉维夫大学·Cornell):免训练调身份token改五官 RINO(约翰霍普金斯·CMU·UCSC·Rice):万物皆RGB统一视觉接口 今日论文速览 1. SpectraReward:MLLM读回提示当零样本奖励 Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation | 港大·字节Seed·北大 | arXiv:2607.11886 关键词:文生图,强化学习,奖励模型,MLLM,零样本 前序问题:文生图强化学习的上限取决于奖励模型,但偏好标注贵、迭代慢;现有零样本 MLLM 奖励要么靠打分/logit(校准噪声大),要么做问题分解验证(工程复杂),缺一个免标注、免微调、开箱即用的奖励方案。 本文贡献:提出 SpectraReward:冻结预训练 MLLM,对生成图像做一次图像条件、teacher-forced 前向,用「原提示在图像条件下的平均 token 对数似然」当奖励,直接复用图文对齐能力,无需偏好标签与奖励微调。另对统一多模态模型提出 Self-SpectraReward——用策略自身理解分支当生成分支奖励,形成无外部奖励/知识的闭环自改进。 实验效果:覆盖 2 个扩散模型、3 种 RL 算法、4 大家族 9 个 MLLM 骨干(4B–235B)、5 个 OOD 文生图基准;BAGEL 上 TIIF-Bench +10.0、GenEval +4.3/5.5,并超过 AlphaGRPO。Self-SpectraReward 可匹敌甚至超过大得多的外部奖励模型,说明奖励-策略分布对齐比单纯放大奖励模型更关键。 批判点评:把「提示能否从图像读回来」做成训练免费奖励,绕开偏好数据与裁判噪声,字节 Seed+港大背景、实验覆盖面也扎实。但似然奖励对短/模板化提示可能不够敏感,Self-SpectraReward 依赖统一多模态架构,且「更大 MLLM 未必更好」意味着落地仍需仔细选骨干而非盲目缩放。 2. VideoRAE:冻结视频基座炼成生成潜空间 VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders | 港中文深圳·华科·中科大 | arXiv:2607.14088 关键词:视频生成,表征自编码器,视频基座模型,潜空间,DiT 前序问题:视频生成多依赖 3D-VAE 潜空间,但传统 3D-VAE 主要优化像素重建,语义与时空结构偏弱;V-JEPA 2、VideoMAEv2 等视频基座理解强,却少有人验证其冻结表征能否压成紧凑、可重建、利于生成的视频潜。 本文贡献:提出 VideoRAE:用冻结视频基座编码器的多尺度层级特征,经轻量 1D 自注意力投影器压缩;同时支持扩散 Transformer 的连续潜与自回归的离散 token(多码本高维量化)。解码时用与冻结 VFM 教师的局部-全局表征对齐目标保语义,无需 KL 正则。 实验效果:连续/离散两套设定下重建均强;UCF-101 上 AR/DiT 的 class-to-video gFVD 分别达 40 与 93(SOTA),收敛约比竞品自编码器快 5×;在受控 2B 文生视频实验中替换 LTX-VAE 亦更快收敛。 批判点评:把「理解向视频基座」改造成「生成友好潜空间」,连续+离散双轨、对齐目标替代 KL,方向很对、收敛数字漂亮。但依赖外部冻结 VFM 教师、投影器与量化设定仍有设计敏感度,开放域长视频/文生视频上相对专用 VAE 的画质上限仍需更大规模验证。 3. Seriality Gap:视频扩散缺可扩展串行算力 The Seriality Gap in Video Diffusion Models | UC Berkeley | arXiv:2607.13031 关键词:视频扩散,物理推理,世界模型,串行性,评测 前序问题:多球碰撞要求逐步推演因果链,但标准双向视频扩散在因果链变长时性能塌陷,即使加更多去噪步也救不回来;此前缺少把「依赖事件结构」与「视频长度」拆开的受控诊断。 本文贡献:在多球硬球动力学上定义串行性缺口(Seriality Gap):双向去噪循环无法提供可扩展的串行算力。用等长单球对照隔离「依赖事件」而非长度;干预实验比较自回归/分块生成与加深骨干等能增加有效串行计算的手段,并理论证明对确定性视频预测去噪步并不增加串行深度。 实验效果:双向扩散随碰撞链变长显著变差,单球对照下缺口基本消失;加去噪步无法弥合缺口,而自回归/更小时间块与加深网络更有效。常见失败含穿透、球数错乱、颜色身份互换。 批判点评:用极简硬球探针+理论证明把「看起来会动」和「真有串行因果算力」拆开,Berkeley 诊断很犀利,对「视频扩散当世界模型」泼了冷水。但设定高度合成、与开放域文生视频差距大,迁移边界需谨慎;主要是诊断而非即插即用修补方案。 4. IdentityTuning:免训练调身份token改五官 Latent-Identity Tuning in Text-to-Image Personalization Models | 特拉维夫大学·Cornell | arXiv:2607.11885 关键词:文生图,个性化,身份调谐,人脸,潜空间 前序问题:人脸生成与编辑精度要求极高,轻微改动就会改变身份感;现有个性化方法忠实复现身份,却几乎无法「改身份本身」(如加胡子、改鼻子、加雀斑)并让改后身份在后续所有生成中保持一致。 本文贡献:定义身份调谐(identity tuning):直接改个性化编码器里编码身份的潜表示,而非改单张图。无需额外训练,利用冻结编码器架构挖掘潜语义方向;身份潜由一组扮演不同角色、常对应特定面部区域的 token 组成,可在选定 token 子空间内做局部、细粒度、语义连贯的编辑。 实验效果:定性和定量实验显示可做多样局部人脸编辑(改鼻子、加雀斑/胡子、控眼睛开合、迁移眉毛等),且改后身份能跨多样提示一致生成到新场景。 批判点评:把「改一张脸」升级成「改可复用的身份 latent」,免训练挖方向、token-区域对应清晰,产品叙事很强。但依赖特定个性化编码器结构,跨模型迁移与全身/多主体场景、以及极端 stylization 下身份连贯性仍待用户侧验证。 5. RINO:万物皆RGB统一视觉接口 Let RGB Be the Language of Vision | 约翰霍普金斯·CMU·UCSC·Rice | arXiv:2607.12450 关键词:统一视觉,图像编辑,零样本,RGB表示,条件生成 前序问题:视觉任务表示碎片化——RGB、one-hot mask、连续深度图各用各的编解码与适配器,难像 LLM 用文本那样用统一接口自由交互;多数视觉基座仍像任务专家而非通用视觉学习者。 本文贡献:提出 RINO(RGB In and RGB Out):掩码、深度等结构化视觉信号一律表示为 RGB,通用视觉任务统一成 RGB→RGB 图像编辑问题;在通用图像编辑骨干(如 Qwen-Image-Edit)上仅用无参数数据转换模块,不做任务专用微调,共享与自然图像相同的编解码架构与参数。 实验效果:零样本覆盖 20+ 理解/生成任务:深度估计 δ₁ 达 0.938,接近 Depth Anything 专家模型;条件生成在既有协议下刷新零样本 SOTA;人评亦认可其理解与生成结果。 批判点评:「让 RGB 当视觉的语言」把理解与条件生成压进同一编辑接口,零样本广度与深度数字都有冲击力。但 RGB 编码连续几何/离散标签必有信息损失,复杂开放词汇分割与精细控制仍可能输给专用头,且强依赖强编辑骨干的先验——换弱骨干时统一范式收益会否缩水仍待看。 趋势观察 文生图 RL 奖励转向「免训即用」 — SpectraReward 用 MLLM 图像条件提示似然当奖励,Self-SpectraReward 更让理解分支自赏生成分支,奖励设计从偏好标注/裁判打分转向复用预训练对齐与策略自身理解。 视频基座表征开始反哺生成潜空间 — VideoRAE 把冻结 V-JEPA/VideoMAE 表征压成连续/离散生成潜,收敛快于传统 3D-VAE,理解向视频基座正成为新一代视频 tokenizer 的候选。 视频生成的「世界模型」能力被探针拆穿 — Seriality Gap 证明双向视频扩散缺可扩展串行算力,碰撞链一长就塌、加去噪步也救不回来,评测正从画质指标转向可控物理探针。 人像个性化从复现身份走向调谐身份 — IdentityTuning 免训练挖掘身份 token 方向,一次改鼻子/胡子/雀斑后跨提示一致生成,产品叙事从「像我」升级到「按我想要的样子像我」。 统一视觉接口押宝「万物皆 RGB」 — RINO 把 mask/深度/姿态条件统一成 RGB 编辑,零样本逼近专家深度模型,统一多模态正从「文本接口」扩到「共享视觉语言」。 人工智能炼丹君 整理 | 2026-07-16 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月16日
12 阅读
0 评论
0 点赞
2026-07-14
AIGC 每日速读|2026-07-14|DeepMind断言视频生成即通用视觉底座
今日 AIGC 论文速览 今日共 7 篇 · 视频生成基础模型与推理 2 篇 · 高效视频生成与重建 2 篇 · 音乐舞蹈与全景生成 2 篇 · 高效语音合成 1 篇 重点论文标题列表 GenCeption(Google DeepMind):视频生成模型是通用视觉学习器 OPSD-V(美团·港科大·港城大):在线自蒸馏救少步AR视频 OpenCoF(字节Seed·港中文):让视频生成学会逐帧推理 LongE2V(阳明交大(台湾)):扩散先验统一事件视频重建 Wan-Dancer(阿里通义):分钟级音乐到舞蹈生成 今日论文速览 1. GenCeption:视频生成模型是通用视觉学习器 Video Generation Models are General-Purpose Vision Learners | Google DeepMind | arXiv:2607.09024 关键词:视频生成,视觉基础模型,预训练,深度估计,涌现泛化 前序问题:NLP 靠下一 token 预测从任务专用模型走向强大的通用基础模型;那么计算机视觉要达到通用模型,需要什么等价的催化剂? 本文贡献:主张大规模文生视频是计算机视觉的强预训练范式,能提供通用视觉智能所需的时空先验、视觉-语言对齐与可扩展性。提出 GenCeption:以预训练视频生成扩散骨干定义一个前馈感知模型,可由文本指令引导执行多种视觉任务。 实验效果:在深度、表面法线、相机位姿估计、指代表达分割、3D 关键点预测等多样任务上达 SOTA,常匹配或超过 DepthAnything3、SAM3、VGGT-Omega、Sapiens 等专用模型;视频生成预训练优于 V-JEPA、Video MAE,数据效率极高(用少 7~500 倍数据即可比肩 D4RT/VGGT-Omega);且现涌现行为——仅用合成人像视频训练即可泛化到真实影像与动物/机器人等分布外类别。 批判点评:用 DeepMind 的分量把「视频生成=通用视觉基础」这一论断做实,跨任务 SOTA+惊人数据效率+涌现泛化,说服力强、方向指引意义大。但依赖大规模视频扩散骨干、算力门槛高,各下游任务仍需文本指令引导与适配,'通用'在更开放任务/真实部署下的稳健性仍需检验。 2. OPSD-V:在线自蒸馏救少步AR视频 OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators | 美团·港科大·港城大 | arXiv:2607.08766 关键词:视频生成,自回归,自蒸馏,少步采样,长视频 前序问题:少步自回归(AR)视频生成器能低延迟产长视频,但长程 AR 展开时存在误差累积与运动动态减弱。 本文贡献:提出在线(on-policy)自蒸馏范式 OPSD-V 做少步 AR 视频后训练:减少长程退化的同时保持原有少步推理路径。核心是训练时引入真实长视频作时序上下文、提供稠密的轨迹级监督——学生严格按推理时 rollout、以自己此前生成的 KV cache 为条件逐块生成;教师在学生所到的相同去噪状态评估,但用更干净、AR 一致的时序缓存(旧历史可替换为真实视频上下文),从而在在线 AR 缓存动态下给出稠密的去噪级纠正目标,不改采样器/去噪步数/推理时缓存机制。 实验效果:应用于 Self-Forcing、LongLive 等代表性少步 AR 视频模型,视觉质量、运动动态与 VBenchLong 一致提升;10 人用户研究中 66.0% 场景更偏好 OPSD-V(排除平局达 82.5%)。 批判点评:「学生走真实推理路径、教师用真实视频上下文给稠密纠正」是对少步 AR 长视频退化的精准手术,且不动推理链、即插即改。但需真实长视频作上下文、训练成本上升,纠正上限受教师与真实上下文质量制约,超长时程的漂移是否彻底解决仍待观察。 3. OpenCoF:让视频生成学会逐帧推理 OpenCoF: Learning to Reason Through Video Generation | 字节Seed·港中文 | arXiv:2607.08763 关键词:视频生成,视频推理,Chain-of-Frame,数据集,注意力 前序问题:推理已成大模型核心能力;视频生成提供了不同于 Chain-of-Thought 的路径——推理可经时序相连的帧展开(Chain-of-Frame, CoF)。但现有视频生成器多在通用语料上训练,缺乏针对 CoF 推理的多样监督与专门设计。 本文贡献:提出 OpenCoF 框架:含横跨 11 类任务的推理视频数据集 OpenCoF-17K,以及微调视频模型 Wan-CoF 研究多样时序监督能否改善 CoF;并进一步给模型配「视觉+文本推理 token」分别捕捉低层视觉线索与高层语义先验以做空间/时序推理,通过性能对比与注意力分析考察这些 token 在模型深度、去噪步、空间与时间上的贡献。 实验效果:在四个视频推理基准上,Wan-CoF 较 Wan2.2-I2V-A14B 基线取得可观提升;数据、模型与代码全开源。 批判点评:把「用连贯帧展开推理」正式化为 CoF 并配数据集+推理 token,为「会推理的视频生成」提供了抓手,开源也利于生态。但视频推理评测仍不成熟、'画面推理'与真实逻辑正确性的关系待厘清,推理 token 带来的额外结构与开销在更复杂任务上的收益仍需验证。 4. LongE2V:扩散先验统一事件视频重建 LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models | 阳明交大(台湾) | arXiv:2607.08770 关键词:事件相机,视频重建,视频扩散,插帧,时序一致 前序问题:从稀疏事件流恢复高质量视频很难:回归方法常糊化纹理,现有生成模型又难保长期稳定。 本文贡献:提出 LongE2V,用预训练视频扩散先验联合处理事件相机的视频重建、预测与插帧:微调基础视频模型获高数据效率与更优感知质量;用自回归展开(Autoregressive Unrolling)与自适应上下文切换缓解超长序列时序漂移;用重编码对齐+交叉残差校正保证插帧的精确双向一致;用事件体素密度增强确保跨传感器分辨率鲁棒。 实验效果:真实基准上在重建/预测/插帧三任务全面超过 SOTA,时序连贯性突出且具零样本泛化。 批判点评:把视频扩散先验迁到事件相机这一低层重建任务、一套框架吃三任务,数据效率与感知质量兼得,思路新颖。但依赖预训练视频先验与微调、事件-视频域差处理,极端稀疏/高速场景下的重建保真与长程漂移仍是挑战。 5. Wan-Dancer:分钟级音乐到舞蹈生成 Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation | 阿里通义 | arXiv:2607.09581 关键词:音乐到舞蹈,长视频,分层生成,RoPE,阿里通义 前序问题:直接从音乐生成长时长、高清、节奏同步的舞蹈视频仍很难——现有扩散模型多在 20 秒后失效,无论走中间 3D 骨架还是端到端合成,长时都有时序漂移、身份不一致与动作重复。 本文贡献:提出分钟级连贯音乐到舞蹈生成的分层框架:把过程解耦为全局关键帧规划与局部时序精修,利用整轨音乐上下文保长程连贯;关键创新含经时间映射 RoPE 的动态帧率自适应(精确对齐)、基于光流的损失(增强动作连续性)、动作速度控制(快速运动保细节)。 实验效果:突破常规时长壁垒,生成稳定、超过一分钟的 720p/30fps 舞蹈视频;跨五种舞种、可由音频与文本共同条件,刷新长时长连贯舞蹈合成 SOTA。 批判点评:「全局规划+局部精修」的分层设计对症长视频漂移,分钟级 720p/30fps 与多舞种适配很有产品感(通义出品)。但舞蹈生成对身份一致与物理合理要求高,分层拼接处的连贯、复杂高速编舞的保真,以及音乐-动作语义对齐的细腻度仍需更多样例检验。 6. Canvas360:几何感知的上下文全景生成 Enhancing In-context Panoramic Generation via Geometric-aware Pretraining | Insta360·清华 | arXiv:2607.08765 关键词:全景生成,上下文生成,几何感知,深度,图像编辑 前序问题:全景文生图快速进步,上下文(in-context)编辑成自然延伸,但缺乏大规模高质量的上下文全景训练数据,且全景几何一致性难保。 本文贡献:提出两阶段框架 Canvas360:几何感知预训练+下游任务微调。构建含 1M 高质量配对全景样本的 Canvas360Dataset(覆盖风格迁移/修补/外扩/编辑);建模上用并行深度生成、速度环形填充与相似度损失正则,学习几何感知表征、捕捉物体畸变细节、提升几何一致与全局连贯;借强全景先验,用 token 级拼接统一支持多种下游上下文全景任务。 实验效果:显著提升全景图像保真,在全景专用 FAED 指标上尤强,其余量化指标具竞争力或领先,任务覆盖与建模灵活性超过此前方法。 批判点评:补齐上下文全景的大规模数据+几何感知预训练,环形填充等针对全景畸变的设计对症,Insta360 背景也贴近实拍应用。但 1M 数据靠深度预测配对、质量受预测器限制,全景特有的极区畸变与跨接缝一致在复杂编辑下仍是难点。 7. FreyaTTS:免tokenizer的高效边端TTS FreyaTTS Technical Report | Freya Team | arXiv:2607.09530 关键词:语音合成,流匹配,免tokenizer,边端部署,土耳其语 前序问题:高可靠、高效的对话式语音合成需要在小模型上同时兼顾质量与部署效率。 本文贡献:推出 FreyaTTS:183.2M 参数、免 tokenizer、土耳其语优先的非自回归条件流匹配 DiT,工作在冻结的 AudioVAE2 连续潜空间(16kHz 编码/48kHz 解码),把容量全用于文本到潜表征映射。三大改进:(1)从 92 个土耳其字符词表端到端建模,无音素器/G2P 前端/离散语音分词器;(2)非自回归并行去噪,一次性预测整段潜序列;(3)面向生产的两阶段后训练(单说话人音色锁定+短句覆盖)提升一致性与短输入鲁棒。 实验效果:在 Freya-TR-Eval 上 WER 8.0%、CER 3.0%,以极小参数超过更大开源系统;消费级 GPU RTF 0.11、笔记本 CPU 也快于实时,适配边端部署;权重/代码/基准以 Apache-2.0 开源。 批判点评:免 tokenizer+非自回归+边端友好,把小模型 TTS 的质量与效率平衡做得很实用,开源也友好。但为土耳其语优先,跨语言/多语种泛化未知,183.2M 小模型在情感/多说话人/长文本上的表现天花板仍有限。 趋势观察 视频生成被当作通用视觉基础 — GenCeption 证明文生视频预训练能催生通用视觉智能(深度/法线/位姿/分割全 SOTA),视频生成不只是合成工具、更是感知底座。 少步自回归视频死磕长程质量 — OPSD-V 用在线自蒸馏修复少步 AR 视频的误差累积与动态衰减,'长视频不崩'成为实时生成的关键命题。 视频生成学会'用画面推理' — OpenCoF 提出 Chain-of-Frame 让模型在时序帧上展开推理,视频生成正从'画得像'走向'想得对'。 扩散先验反哺低层视觉重建 — LongE2V 借视频扩散先验统一事件相机的重建/预测/插帧,生成式先验持续反哺低层视觉与重建任务。 长时长与垂直场景生成加速落地 — Wan-Dancer 把音乐到舞蹈推到分钟级 720p、Canvas360 做上下文全景、FreyaTTS 把 TTS 塞进边端,生成向长时长与专用场景延伸。 人工智能炼丹君 整理 | 2026-07-14 更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」 每日更新 · 论文精选 · 深度解读 · 技术脉络 微信搜索 人工智能炼丹君 或扫描下方二维码关注
2026年07月14日
13 阅读
0 评论
0 点赞
1
...
5
6
7
...
11
粤ICP备2021042327号