视频生成与高性能注意力
参与 HunyuanVideo 1.5 相关工作;共同参与 Flex-Block-Attn,面向视频模型训练与推理提供灵活的块稀疏注意力计算能力,覆盖 STA、MoBA 与 SSTA 等稀疏策略。
Selected Work
HunyuanVideo:首个工业级开源大规模视频生成模型;并参与 HunyuanVideo 1.5,持续推进模型架构、训练及高分辨率推理。
查看项目 →为视频模型训练与推理设计的高效块稀疏注意力库,支持灵活稀疏策略和 PyTorch 风格 mask 表达;个人作为共同作者参与。
查看项目 →强调细粒度中文理解与多分辨率生成的 Diffusion Transformer,并包含双语文本编码与图像描述能力;个人作为论文作者参与。
查看项目 →面向多轮文本到图像生成的多模态交互系统,支持生成、编辑和对话,并引入双语评测基准 DialogBen;个人作为论文作者参与。
查看项目 →从广告业务出发,提出广告视频时序理解任务与 Benchmark,并构建 Tencent AVS 数据集及 baseline。
查看论文 →CCF BDCI2017 遥感影像分类与识别比赛冠军方案,是早期语义分割实践与开源积累的代表项目。
查看代码 →Experience
参与 HunyuanVideo 1.5 相关工作;共同参与 Flex-Block-Attn,面向视频模型训练与推理提供灵活的块稀疏注意力计算能力,覆盖 STA、MoBA 与 SSTA 等稀疏策略。
参与 Hunyuan-DiT 与 HunyuanVideo:前者聚焦细粒度中文理解与多分辨率图像生成;HunyuanVideo 是首个工业级开源大规模视频生成模型。
探索中英文双语 CLIP、中文 Dense Image Captioning,并参与 DialogGen:通过绘图提示对齐、训练数据构建与错误纠正,支持多轮文本到图像生成及图像编辑交互。
从广告业务出发,提出广告视频时序理解任务与 Benchmark;参与腾讯广告算法大赛赛题设计与解读,构建 Tencent AVS 数据集及 baseline。
CCF BDCI2017 获得遥感影像分割比赛冠军🏆;发表视频目标跟踪论文 ASNT(ICME 2018), 复现并开源经典Tracking算法SiamRPN。
About This Site
学习、工作、杂想随笔记录。这里也记录技术实践、论文阅读、算法基础与阶段性思考。比起只展示结论,更希望留下问题背景、推导过程和能被复用的经验。
AIGC、多模态理解、分布式训练、PyTorch、视觉算法,以及工作与生活中的复盘。