今日 AIGC 论文速览
今日共 5 篇 · 生成强化学习与少步加速 1 篇 · 视频DiT系统加速 1 篇 · 世界模型与科学多模态生成 2 篇 · 多模态智能体安全 1 篇
重点论文标题列表
- MeanFlowNFT(腾讯混元·港科大):4步视频胜50步强化扩散
- FVAttn(腾讯微信·中山大学·北大):稀疏注意力提速4.41倍
- Orbis 2(弗赖堡大学):分层世界模型兼顾远景细节
- S1-Omni(ScienceOne AI·文歌科技):统一200类科学任务推理生成
- Lucid(UC Irvine):不可见扰动毒化智能体记忆
今日论文速览
1. MeanFlowNFT:4步视频胜50步强化扩散
MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators | 腾讯混元·港科大 | arXiv:2607.15273
关键词:视频生成,MeanFlow,强化学习,少步采样,奖励对齐
- 前序问题:MeanFlow 通过预测时间区间平均速度实现少步生成,但现有 DiffusionNFT 前向过程强化学习优化的是瞬时速度,两者目标不匹配;如何在保留 MeanFlow 少步采样优势的同时做可靠奖励对齐,仍未解决。
- 本文贡献:提出 MeanFlowNFT:利用连接平均速度与瞬时速度的 MeanFlow 恒等式,构造诱导瞬时速度预测器,再把 DiffusionNFT 目标施加到该预测器上,使奖励优化在数学上成立;实际采样仍走平均速度,因此保留快速少步生成,并证明继承 DiffusionNFT 的严格策略改进保证。
- 实验效果:图像与视频生成均稳定提升基线;SD3.5-M 的 8 项指标中 6 项超过此前 SOTA 少步 RL 生成器。Wan2.1 上仅 4 步即获 VBench 84.33,超过 50 步 LongCat-Video RL 的 82.57。
- 批判点评:把瞬时速度 RL 桥接到平均速度生成器,既有理论保证又拿出「4 步胜 50 步」的工业级数字,腾讯混元背景也很接近落地。但仍依赖 DiffusionNFT 的奖励与训练设定,少步模型在复杂长视频、细粒度运动上的稳定性,以及不同奖励下是否都能保持严格改进仍需扩验。
2. FVAttn:稀疏注意力提速4.41倍
FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation | 腾讯微信·中山大学·北大 | arXiv:2607.16190
关键词:视频DiT,稀疏注意力,负载均衡,多GPU,推理加速
- 前序问题:高分辨率视频 DiT 的长时空序列让自注意力成为主瓶颈;免训练 Top-p 稀疏注意力虽省计算,却在多 GPU 序列并行下造成各注意力头负载不均,最慢 rank 拖住全局同步,稀疏收益被等待开销吃掉。
- 本文贡献:提出 FVAttn 免训练稀疏注意力系统:以 Top-p 路由、Top-k 安全下限和视频感知分块构造稀疏前端,再按当前真实 mask 在运行时修复调度。运行时负载均衡通过 P2P 迁移少量重头缩短关键路径;Slack-Aware Sparse Augmentation 用额外高价值块填充非关键 rank 的空闲,并将调度与迁移开销同计算重叠。
- 实验效果:在步蒸馏 Wan2.2 I2V 上把平均负载不均衡从 1.34 降至 1.08;相对 FlashAttention,注意力提速 4.41×、DiT 推理提速 2.02–2.11×,同时保持有竞争力的视频质量。
- 批判点评:抓住「稀疏了却被最慢 GPU 拖死」这一系统瓶颈,运行时搬重头+用高价值块填空闲的设计很工程化,4.41× 注意力提速也扎实。但收益依赖多 GPU 序列并行、专用调度与 P2P 拓扑,单卡无红利;跨模型、不同显卡互联与更长视频下的迁移开销边界仍待验证。
3. Orbis 2:分层世界模型兼顾远景细节
Orbis 2: A Hierarchical World Model for Driving | 弗赖堡大学 | arXiv:2607.15898
关键词:驾驶世界模型,分层预测,Diffusion Forcing,DINOv2,长时生成
- 前序问题:现有驾驶世界模型通常只在单一抽象层预测:要么追求像素保真却缺空间推理与语义理解,要么长时滚动误差不断累积,难同时服务真实下游规划与高质量生成。
- 本文贡献:提出分层驾驶世界模型,将未来预测拆成两个时间与抽象尺度:高层预测器在压缩 DINOv2 语义潜空间中预测长时粗场景结构和子目标;低层生成器在 VAE 潜空间中受高层输出条件约束,生成短时精细画面。训练上先用 diffusion forcing 获得更丰富表征,再用 teacher forcing 微调以稳定自回归滚动。
- 实验效果:在标准驾驶世界模型评测上全面达到 SOTA,覆盖长时生成保真、反事实场景下的转向响应,以及内部表征质量;兼得高感知保真与更强空间、语义表示。
- 批判点评:「高层管远景语义、低层补近景细节」符合驾驶规划的天然层级,两阶段训练也把 diffusion forcing 的表征优势与 teacher forcing 的稳定性拼起来。但系统复杂、两级误差会相互传递,对极端交通事件和跨城市域偏移的可靠性,以及是否真能改善闭环驾驶安全仍需实车验证。
4. S1-Omni:统一200类科学任务推理生成
S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation | ScienceOne AI·文歌科技 | arXiv:2607.15686
关键词:AI4S,统一多模态,科学生成,分子生成,科学图像
- 前序问题:AI for Science 被领域模型、工具增强 LLM 与科学语言模型割裂,不同模型各管蛋白、分子、材料或图像,难在同一模型里联合建模异构数据、科学规律和专家知识。
- 本文贡献:提出 S1-Omni,以三部分统一科学理解、预测与生成:把自然语言、CIF、SMILES、蛋白序列、光谱和科学图像映入共享任务空间;在数据构造、验证与训练中注入科学定律和专家知识;按任务连接原生领域解码器,支持属性预测、光谱到分子生成、蛋白位点/结构预测、科学图像生成与编辑。S1-Omni-Corpus 覆盖 200 类科学任务和数百万推理样本。
- 实验效果:在 60 多个科学基准上评测,多数基准超过 GPT-5.5 与 Gemini-3.1-Pro,并在若干任务上匹敌或超过领域专用模型。
- 批判点评:将符号序列、科学图像与领域规律放进统一模型,200 类任务与 60+ 基准规模很有冲击力。但跨领域总榜容易掩盖单任务深度,科学定律是否真正进入推理而非数据相关性、闭源强基线的评测公平性,以及科学生成结果的实验可验证性都需独立复核。
5. Lucid:不可见扰动毒化智能体记忆
Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents | UC Irvine | arXiv:2607.15657
关键词:多模态智能体,长期记忆,视觉攻击,记忆投毒,安全
- 前序问题:多模态智能体把历史图文写进长期记忆并在未来检索,却默认视觉数据可信、没有语义完整性验证;攻击者若只改图片、不能碰文本与模型,是否仍能持续污染后续生成,尚未被系统研究。
- 本文贡献:提出 Lucid 黑盒视觉攻击框架,在不知道目标 MLLM、检索编码器或文本通道的严格图像边界威胁模型下,构造肉眼不可见扰动:有历史文本上下文时做 memory poisoning,替换被文本强化的良性图像并扭曲回忆;无上下文时做 memory injection,让图像直接注入攻击者叙事。覆盖图结构、LLM 摘要及商业系统等五种黑盒记忆架构。
- 实验效果:跨多种对话领域,记忆投毒攻击成功率达 61.6%,记忆注入达 58.4%,暴露出多模态长期记忆「检索相似即信任」的结构性漏洞。
- 批判点评:只靠不可见图片扰动、完全黑盒就能让错误记忆跨会话持续生效,攻击面比单轮越狱更危险,数字也足够醒目。但实验仍依赖代理视觉编码器的迁移性;现实平台的图片重压缩、重编码与人工审核可能削弱攻击,论文主要揭示风险,防御机制尚未闭环。
趋势观察
- 少步生成与强化学习开始真正合流 — MeanFlowNFT 用平均-瞬时速度恒等式把前向过程 RL 接进 MeanFlow,Wan2.1 四步 VBench 84.33 超过 50 步 RL 模型,奖励对齐不再必须牺牲采样效率。
- 视频加速从算法稀疏深入分布式调度 — FVAttn 不只剪注意力,还在运行时迁移重头、填平 GPU 空闲,把稀疏注意力的 rank 拖尾变成可优化的系统问题。
- 世界模型走向语义与细节分层 — Orbis 2 用 DINO 高层预测远期语义、VAE 低层生成近景细节,世界模型从单尺度像素预测转向面向规划的层级抽象。
- 统一多模态扩展到科学原生对象 — S1-Omni 将 CIF、SMILES、蛋白、光谱与科学图像纳入同一模型,统一生成理解正从通用图文扩到原生科学表示。
- 长期记忆成为多模态智能体新攻击面 — Lucid 证明肉眼不可见的图片扰动可在黑盒条件下持续污染跨会话记忆,安全边界正从当前提示扩展到历史视觉证据。
人工智能炼丹君 整理 | 2026-07-21
更多 AIGC 论文解读,关注微信公众号「人工智能炼丹君」
每日更新 · 论文精选 · 深度解读 · 技术脉络
微信搜索 人工智能炼丹君 或扫描下方二维码关注

评论 (0)