首页
应用
关于
Search
1
Pytorch DDP
2,482 阅读
2
Pytorch 常见问题
1,515 阅读
3
视频时序切分
1,341 阅读
4
中文场景下的CLIP图文预训练
1,044 阅读
5
Semi-Supervised + Noisy Label
1,028 阅读
AIGC
AIGC Daily Papers
AIGC Fundamentals
其他
职场经验复盘
多模态理解
购房/投资
阅读
广告
Segmentation
LeetCode
Pytorch
Python
Shell
C++
常用链接
Search
标签搜索
AIGC
人工智能
论文速读
ai
视频生成
DiT
对齐
蒸馏
扩散模型
attention
transformer
视频编辑
图像生成
diffusion
基础知识
稀疏注意力
多模态
文生图
NVIDIA
llm
Jefxiong
累计撰写
203
篇文章
累计收到
8
条评论
首页
应用
栏目
AIGC
AIGC Daily Papers
AIGC Fundamentals
其他
职场经验复盘
多模态理解
购房/投资
阅读
广告
Segmentation
LeetCode
Pytorch
Python
Shell
C++
常用链接
页面
关于
搜索到
2
篇与
AIGC
的结果
2026-10-04
AIGC 每日推送目录
关注公众号,不错过每一篇 每天精选 AIGC 论文速读、深度解读与周末专题,把「值得读」的那几篇送到你面前。扫码或微信搜一搜 人工智能炼丹君,第一时间收到更新。 微信搜一搜 · 人工智能炼丹君 下方为博客归档目录:点击日期即可进入对应推送全文。 当前共收录 120 期,按时间倒序排列。 2026 年 10 月 2026-10-05|NeurIPS省七成token保孔洞SILSA 2026-10-04|商汤小模型绕圈反超6.5倍大模型,Looped-DiT 2026-10-02|NVIDIA砍掉视觉编码器,PixelUMM图像视频同模 2026-10-01|一次蒸馏插遍54个模型,LongLive-Plug 2026-10-01|深度解读|字节Seed×UCSD VSA2|砍掉95%注意力计算 720p端到端快4.62倍 2026 年 9 月 2026-09-30|港科大先写谱再唱,YuE2 逼近 Suno 2026-09-29|阿里双Agent语音涨10.4分,Qwen-Audio 2026-09-28|阿里 397B 只改提示词就涨 50 分,WanPE 2026-09-25|快手开源修图登顶,GEdit仍输GPT 2026-09-24|阿里Qwen3.8-Omni发布,视频推理输Gemini 2026-09-23|NVIDIA像素扩散FID 1.46,仍输latent 2026-09-22|阶跃星辰全双工98.9登顶,清华W4A4逼近FP16 2026-09-21|伯克利线性注意力让H3视频快14.5倍-VDN 2026-09-18|高通揪出长视频KV错配-Recency Forcing 2026-09-17|Meta一个模型既写歌又改歌-SongCraft 2026-09-16|22帧视频377毫秒-LynnReal-Omni 2026-09-15|阿里五路音频控制-DiffSynth-Music 2026-09-14|SenseNova 8B原生视觉直出4K-SN-U15 2026-09-11|阿里13模型不会专业剪辑-CutCraft 2026-09-10|90%稀疏视频DiT加速2.63倍-RoLA 2026-09-09|阿里两步口型配音跑到7.13FPS-TBDub 2026-09-08|蚂蚁从零训6B开源生图-LLaDA-Image 2026-09-07|腾讯3B活跃参数逼近万亿代理-WeAgent 2026-09-06|长视频世界模型的记忆与状态概览 2026-09-04|港中深5秒训练撑起一小时世界推演-SolarWM 2026-09-03|Runway让界面直接生成而不再写代码-Solaris 2026-09-02|阿里7B原生音视频生成硬刚33B大模型-DreamX 2026-09-01|西湖大学让写代码的智能体当世界大脑CWM 2026 年 8 月 2026-08-31|复旦GameWAM同时生成画面和键鼠动作 2026-08-29|字节斯坦福让视频记住走远的人RingForcing 2026-08-28|京东JoyAI-Echo-1.5给长视频装上跨镜头记忆 2026-08-27|浙大清华19B音视频4步2.5秒出片TurboT2VA 2026-08-26|京东开源世界模型边走边生720p视听EchoWM 2026-08-25|Meta让15B DiT优化器时间砍半Muon-DiT 2026-08-24|快手可灵证明奖励劫持源于流形漂移ThermoDPO 2026-08-23|3DGS工程化转折:传得动跑得起管得住 2026-08-22|阿里6B小模型编辑分反超20B的Swift-Image 2026-08-21|中科大揪出蒸馏后数字人变木头人DynaForcing 2026-08-20|LumaAI首证扩散缩放定律要10倍数据(Abra) 2026-08-19|阿里像素空间T2I反超潜空间Z-Image-Pixel 2026-08-18|港科大数字人比LTX-2快33倍还能连说一分钟Omni… 2026-08-17|AlayaLab世界模型连跑两小时画面不塌Evoke 2026-08-16|NVIDIA领衔 On-Policy 蒸馏让学生反超教师 2026-08-14|阿里14B数字人实时跑三分钟LiveAnimate 2026-08-14|深度解读|NVIDIA Sol-Engine|Agent自动调栈视频推理快2.77倍 2026-08-13|Adobe视频世界模型首次外推物理定律LDR 2026-08-12|阿里DUET两步视频质量多样性双赢 2026-08-11|NVIDIA免训练治好世界模型失忆WorldTrace 2026-08-10|阿里Wan-Animate-2角色动画冲进实时24FPS 2026-08-07|Meta实测视觉懒惰生成数据只留5%反而更强 2026-08-07|深度解读|Sand.ai MAGI-2|114B视频MoE把token切12份挑专家 2026-08-06|京东22B音画同修让百年老片复活OmniVR 2026-08-03|深度解读|MiniMax H3|33B统一音视频与2K链路拆解 2026 年 7 月 2026-07-31|Adobe混合DiT算效提升7.3倍Chimera 2026-07-30|Adobe世界模型16FPS实时生成分钟视频 2026-07-29|Apple端侧Siri语音16倍实时仅21MB 2026-07-28|Meta单H200实时视频22.84帧MsForcing 2026-07-27|NVIDIA单卡视频生成提速120倍SANA2.0 2026-07-25|深度解读|清华SLA2|97%稀疏对比DeepSeek DSA 2026-07-23|阿里高德5090单卡实时世界模型ABot-World-0 2026-07-22|华为40万美元逼近闭源Boogu-Image 2026-07-21|腾讯混元4步视频胜50步强化扩散MeanFlowNFT 2026-07-16|字节Seed读回提示当奖励SpectraReward 2026-07-14|DeepMind断言视频生成即通用视觉底座 2026-07-10|高通MobileWan让5B视频扩散上手机16FPS 2026-07-03|北航ETH免训练让FLUX画图提速25倍MrFlow 2026-07-02|快手可灵MemLearner可学习记忆视频世界模型 2026 年 6 月 2026-06-29|清华LiveEdit实时流式视频编辑12.66FPS 2026-06-22|近两周精选-MaineCoon实时音视频世界模型 2026-06-02|微软实时流式数字人视频比肩大模型 2026-06-01|英伟达SANA单卡24FPS实时流式视频编辑 2026 年 5 月 2026-05-29|生数科技minWM开源实时交互视频世界模型 2026-05-28|北大OSP-Next视频生成跨硬件加速 2026-05-27|美团LongCat-Avatar 1.5开源逼近闭源数字人 2026-05-26|百度ERNIE-Image开源8B DiT追平闭源 2026-05-25|字节Bernini让MLLM规划DiT渲染视频 2026-05-21|智能编辑成统一模型通用任务Uni-Edit 2026-05-20|视频生成补物理常识NEWTON 2026-05-19|长视频生成FP4训推全栈LongLive-2.0 2026-05-18|14B视频对齐单步训练Flash-GRPO 2026-05-17|实时自回归视频生成加速 2026-05-15|实时视频2步出帧Causal Forcing++ 2026-05-14|视频扩散从少步到任意步AnyFlow 2026-05-13|INSET图像即词汇开启统一视觉生成新范式 2026-05-12|Forcing-KV 视频扩散2.82倍加速突破实时 2026-05-11|Cola DLM 扩散语言模型挑战自回归范式 2026-05-09|视频编辑最新进展 2026-05-08|JoyAI统一模型唤醒空间智能,通义D-OPSD破解少步… 2026-05-06|DiT-MoE统一多模态模型25B仅激活3B,运动感知缓… 2026-05-05|纯视觉流统一生成颠覆文本管线,1D-Token端到端FI… 2026-05-04|20260504|4步打败40步!AdvDMD蒸馏加速刷新SD3.5 2026-05-02|13.7-18.6x注意力加速,稀疏注意力撕开视频Di… 2026-05-01|20秒训练7x加速DiT,SAMG零开销解锁空间自适应… 2026 年 4 月 2026-04-30|V-GRPO让RL对齐提速3倍,64token暴力生图 2026-04-28|20FPS实时数字人Hallo-Live 2026-04-27|多目标Pareto后训练ParetoSlider 2026-04-26|统一多模态生成大爆发:Omni五模态SOTA碾压Qwen 2026-04-25|视频编辑评测方法全景:从传统指标到 Reward Model 的范式跃迁 2026-04-24|Wan-Image 2026-04-23|淘宝试穿上线-Google城市视频-GRPO优化扩散 2026-04-22|武大MemWN按需记忆撑起长视频一致性 2026-04-21|Qwen3.5-Omni全模态215项SOTA 2026-04-10|重新审视可控扩散训练目标——直接x₀监督实现2倍加速 2026-04-09|一图多改不再崩-MIRAGE并行编辑 2026-04-08|分数步蒸馏新范式1.x-Distill 2026-04-07|SC-DMD蒸馏2-4步高质量视频生成Salt 2026-04-06|VOID因果推理视频编辑|DynaVid CVPR2026|SteerFlow免训练编辑 2026-04-05|Mistral Voxtral TTS胜ElevenLabs 2026-04-04|视频生成前沿|统一框架|长视频|物理一致性 2026-04-03|Dynin-Omni|OmniVoice 2026-04-02|MacTok 64-token SOTA 2026 年 3 月 2026-03-30|BiFM|Wan-Weaver|PackForcing|Voxtral TTS 2026-03-29|GIDE|ScaleEdit-12M|Calibri 2026-03-28|视觉生成后训练与偏好优化 2026-03-27|ScrollScape|OmniWeaving 2026-03-25|上交ScaleEdit-12M+CVPR跨时间步自校准 2026-03-24|CubiD高维离散扩散|扩散通用加速|FoleyDirector V2A 2026-03-23|MOSS-TTS|ColourCrafter|Q-Drift 2026-03-22|视频生成与编辑前沿进展 2026-03-21|偏好对齐|RL后训练|SOLACE|CRAFT|CRD|VIGOR 最后更新:2026-10-05 12:39
2026年10月04日
28 阅读
0 评论
4 点赞
2026-10-04
AIGC 基本功知识树
每日论文速读解决的是广度——今天世界上发生了什么。但读论文有个前提:你得先看得懂。 这里是另一条线:把视觉生成的底层零件一个个拆开讲透。每篇都给数学推导 + 能跑的代码 + 经典论文出处,并标注前置知识,你可以顺着依赖链一路读下来。 当前规划 38 个知识点,已发布 33 篇。 图例:● 已发布 · ◍ 已发布待更新 · ◐ 正在写 · ○ 计划中 数学与优化基础(2/2) 概率、变分推断、随机微分方程——读懂扩散模型公式的最小前置集合。 ● 变分下界与重参数化(ELBO) · 难度:入门前置 不理解 ELBO 就没法理解 VAE 的 KL 项为什么要加权,也没法理解扩散模型的训练目标从哪来。 ● 扩散过程的前向与反向推导(SDE) · 难度:入门前置 · 前置:ELBO 把 DDPM 的离散公式和 SDE 的连续视角对上,后面所有采样器的差异都能一句话解释。 注意力与核心零件(5/7) 注意力、位置编码、稀疏激活与循环记忆——视频生成里最吃显存、最难外推也最影响长程建模的部件。 ● 自注意力机制的计算与显存账本(MHA) · 难度:核心必修 先把 O(N²) 的常数项算清楚,才能判断后面各种稀疏/线性方案到底省在哪一项。 ● 旋转位置编码 RoPE 的原理与实现(RoPE) · 难度:核心必修 · 前置:MHA 许多现代视频 DiT 使用 RoPE;理解旋转和相对位置性质,才能区分坐标可计算与生成质量可外推。 ● FlashAttention 为什么不需要存下注意力矩阵(FlashAttn) · 难度:进阶 · 前置:MHA online softmax 这一个技巧撑起了整个长序列时代,值得把递推式一步步推一遍。 ● 视频 DiT 里的 3D RoPE 与分辨率外推(3D-RoPE) · 难度:进阶 · 前置:RoPE 换分辨率或帧数时,3D RoPE 的坐标、频率与轴分配是需排查的因素之一,还要检查训练分布、VAE 与注意力实现。 ● 混合专家 MoE:稀疏激活怎么省算力(MoE) · 难度:工程实战 · 前置:MHA 统一多模态模型开始普遍用 MoE 扛参数量,但路由不均衡带来的训练不稳定很少被讲清楚。 ○ 线性、循环与记忆架构(LinearMem) · 难度:前沿 · 前置:MHA 长序列架构正在从保存完整注意力矩阵转向可更新状态和深度循环;把复杂度、记忆容量与并行性放进同一框架,才能判断它们何时真能替代 Softmax Attention。 ○ 视频生成里的稀疏注意力(SparseAttn) · 难度:前沿 · 前置:FlashAttn、3D-RoPE 视频长序列的全注意力成本很高;稀疏化可以减少计算,但免训练部署的质量取舍需和精确 IO 优化、缓存等方案比较。 生成范式(7/9) 从 DDPM 到流匹配,以及把 50 步压到 4 步的蒸馏路线。 ● DDPM 训练目标与采样流程(DDPM) · 难度:核心必修 · 前置:SDE DDPM 是理解扩散模型的重要起点;先读懂其 loss 与采样循环,再比较其他生成路径和训练目标。 ● 分类器无关引导 CFG 的代价与调法(CFG) · 难度:核心必修 · 前置:DDPM CFG 让每步算两遍,是推理成本里最容易被忽视的 2×,也是蒸馏首先要干掉的对象。 ● 从 DDIM 到高阶采样器(DDIM) · 难度:进阶 · 前置:DDPM 采样器换一个、缓存策略就得重调——这是推理加速最常见的踩坑点。 ● 流匹配与 Rectified Flow(FlowMatching) · 难度:进阶 · 前置:SDE、DDPM 流匹配被许多近期生成模型采用;它与 DDPM 的概率路径、监督目标及采样方式值得系统比较。 ● 潜空间扩散与 Stable Diffusion 架构(LDM) · 难度:进阶 · 前置:DDPM、VAE 把扩散搬进潜空间这一步,直接决定了今天视觉生成的算力可行性。 ● DiT:用 Transformer 替掉 UNet(DiT) · 难度:进阶 · 前置:LDM、MHA adaLN-Zero 这个小设计是 DiT 能稳定训起来的关键,值得逐行对照公式看。 ● 自回归视频生成与 Forcing 范式(Forcing) · 难度:工程实战 · 前置:DDPM、DiT 双向扩散没法流式出帧,Forcing 系列是把视频生成变成可交互的关键一步,也是当下最活跃的范式。 ○ 少步蒸馏:从 50 步到 4 步(Distill) · 难度:前沿 · 前置:DDIM、CFG 蒸馏是过去两年推理加速收益最大的一条线,也是最容易把质量搞崩的一条。 ○ 世界模型:从视频生成到可交互环境(WorldModel) · 难度:前沿 · 前置:Forcing 视频生成正在从「出片」转向「可交互环境」,这是范式转变而不是又一个 SOTA 分数。 表征与压缩(4/4) VAE / Tokenizer——视频生成的「地基」,决定了上限和伪影形态。 ● VAE 结构与训练目标(VAE) · 难度:核心必修 · 前置:ELBO 潜空间扩散依赖编码器输出的统计尺度;像素空间扩散不使用 VAE,不能将 scaling_factor 推广到所有扩散模型。 ● 离散化表征:VQ-VAE 与 VQGAN(VQGAN) · 难度:进阶 · 前置:VAE 离散自回归视觉模型依赖 tokenizer,码本利用率是重要问题;连续潜变量自回归路线不适用这一前提。 ● 视频 VAE 的时空压缩结构(VideoVAE) · 难度:工程实战 · 前置:VAE 时间维压缩比和因果卷积的实现方式,直接决定了长视频能不能逐块解码而不接缝。 ● 视频 VAE 的常见 loss 组合(VAELoss) · 难度:工程实战 · 前置:VideoVAE L1 + KL + LPIPS + GAN 四项的权重配比是玄学重灾区,把每项在管什么讲透很有价值。 对齐与强化学习(4/4) 从 PPO 到 GRPO,以及怎么把 RL 用到扩散和视频生成上。 ● 策略梯度与 PPO 基础(PPO) · 难度:核心必修 PPO 是在线策略优化的重要基础;掌握优势估计和裁剪后,再区分 GRPO 与直接偏好优化等不同路线。 ● 从 DPO 到 GRPO:去掉价值网络(GRPO) · 难度:进阶 · 前置:PPO GRPO 用组内相对奖励省去 critic;净成本还取决于组采样、参考模型、奖励评估和显存,不能统一声称降低一个量级。 ● 把 RL 用到扩散模型上(DiffusionRL) · 难度:前沿 · 前置:GRPO、DDIM 把多步去噪当成一条 MDP 轨迹,是理解视频 RL 各种做法的统一视角。 ● 视频生成中的强化学习与奖励模型(VideoRL) · 难度:前沿 · 前置:DiffusionRL、FlowMatching 视频的奖励要同时管画质、运动和指令遵循,reward hacking 在这里表现得最明显。 分布式训练(4/4) 参数、数据、序列三个维度怎么切,以及切完之后通信量变成多少。 ● 数据并行与 ZeRO 显存切分(ZeRO) · 难度:进阶 先把「参数 + 梯度 + 优化器状态」的显存账算清楚,才知道该切哪一部分。 ● 混合精度与数值稳定性(AMP) · 难度:进阶 BF16、FP16 与 FP8 的范围、精度和缩放机制不同,排查异常时要区分前向溢出、梯度下溢与舍入误差。 ● 张量并行与流水线并行(TP-PP) · 难度:工程实战 · 前置:ZeRO TP 的通信量和 PP 的气泡率都能手算,算完就知道并行度该怎么配。 ● 序列并行与 Ring Attention(SP) · 难度:前沿 · 前置:TP-PP、FlashAttn 超长视频序列可能需要序列或上下文并行;是否值得使用取决于单卡容量、通信和计算重叠。 推理加速与部署(5/5) 先用性能模型定位算力、带宽和显存瓶颈,再用缓存、稀疏、量化与算子融合把生成时间从分钟压到秒。 ● 性能建模与 Profiling:算力、带宽与显存账本(Roofline) · 难度:进阶 · 前置:AMP 不先判断算力、带宽还是显存容量在卡住系统,量化、融合、缓存很容易做成负优化;这篇提供所有推理优化节点共同的测量方法。 ● KV Cache 与自回归视频生成(KVCache) · 难度:进阶 · 前置:MHA、Roofline 自回归视频模型正在把 LLM 的这套缓存工程整体搬过来,值得先打好底。 ● 算子融合与 CUDA Graph(Fusion) · 难度:工程实战 · 前置:MHA、Roofline 小算子多的模型往往卡在访存和 launch 开销上,融合的收益比换算法更确定。 ● 量化:从 INT8 到 FP4(Quant) · 难度:工程实战 · 前置:AMP、Roofline 激活里的离群值是量化掉点的主因,SmoothQuant 的迁移技巧值得逐步推演一遍。 ● 扩散模型的跨步缓存复用(DiffCache) · 难度:前沿 · 前置:DDIM、DiT、Roofline 相邻去噪步的特征高度相似,这是免训练加速里性价比最高的一类手段。 评测与指标(2/3) FID/CLIP/VBench 各自测的是什么,以及它们什么时候会骗人。 ● FID / CLIP Score 到底测了什么(FID) · 难度:核心必修 FID 对样本量和预处理极其敏感,不同论文的数字经常根本不可比。 ○ 视频生成评测:VBench 与人工验收(VBench) · 难度:进阶 · 前置:FID 加速类工作最爱报 VBench 总分不变,但分维度看往往能发现明显退化。 ● 音频质量评测:MOS、PESQ 与 FAD 各测什么(AudioEval) · 难度:工程实战 音视频生成里音频质量几乎全靠几个数字说话,但这些数字测的根本不是一回事:SI-SDR 只管波形对齐、PESQ 只为通信语音设计、FAD 看的是分布而不是单条样本的保真度。选错指标会得到自欺欺人的结论——比如用波形指标验收 codec,数字很好听但高频毛刺全在。 接下来会写 线性、循环与记忆架构(LinearMem) —— 长序列架构正在从保存完整注意力矩阵转向可更新状态和深度循环;把复杂度、记忆容量与并行性放进同一框架,才能判断它们何时真能替代 Softmax Attention。 视频生成里的稀疏注意力(SparseAttn) —— 视频长序列的全注意力成本很高;稀疏化可以减少计算,但免训练部署的质量取舍需和精确 IO 优化、缓存等方案比较。 少步蒸馏:从 50 步到 4 步(Distill) —— 蒸馏是过去两年推理加速收益最大的一条线,也是最容易把质量搞崩的一条。 最后更新:2026-10-05 12:40
2026年10月04日
11 阅读
0 评论
3 点赞
粤ICP备2021042327号