Multimodal AI · Generative Models

Jefxiong

多模态理解 · 图像 / 视频生成算法工程师

腾讯在职(2019-至今),持续探索视觉内容理解、生成式 AI(图片&视频生成)。 工作路径从分割、跟踪与视频理解,逐步延伸到中英文视觉语言表征、Diffusion Transformer、 大规模视频生成与高效稀疏注意力

2018–2019视觉感知
2020–2022视频与广告理解
2023–2024多模态与图像生成
2024–Now大规模视频生成

Selected Work

代表工作

Experience

工作经历与技术演进

2025

视频生成与高性能注意力

参与 HunyuanVideo 1.5 相关工作;共同参与 Flex-Block-Attn,面向视频模型训练与推理提供灵活的块稀疏注意力计算能力,覆盖 STA、MoBA 与 SSTA 等稀疏策略。

2024

从图像生成走向大规模视频生成

参与 Hunyuan-DiT 与 HunyuanVideo:前者聚焦细粒度中文理解与多分辨率图像生成;HunyuanVideo 是首个工业级开源大规模视频生成模型。

2023

视觉语言表征与多轮生成交互

探索中英文双语 CLIP、中文 Dense Image Captioning,并参与 DialogGen:通过绘图提示对齐、训练数据构建与错误纠正,支持多轮文本到图像生成及图像编辑交互。

2022

广告视频吸引力预估

围绕广告视频的短时观看反馈开展效果建模,将视频内容理解与业务目标连接,用于广告视频 3 秒完播率等吸引力指标的预估。

2021

广告视频时序理解任务与 Benchmark

从广告业务出发,提出广告视频时序理解任务与 Benchmark;参与腾讯广告算法大赛赛题设计与解读,构建 Tencent AVS 数据集及 baseline。

2020

广告创意自动化与内容理解

参与广告创意制作引擎研发,探索素材的自动化生成;建设视频多模态标签能力,从画面、文本与时序信息中理解广告素材内容。

2019

视频人像分割

聚焦人像边缘的分割精度与视频时序稳定性,让逐帧视觉结果在复杂背景和人物运动下保持更自然、更连贯。

2018

分割、跟踪与视觉算法起点

CCF BDCI2017 获得遥感影像分割比赛冠军🏆;发表视频目标跟踪论文 ASNT(ICME 2018), 复现并开源经典Tracking算法SiamRPN。

About This Site

关于本站

持续记录,保持可复现

学习、工作、杂想随笔记录。这里也记录技术实践、论文阅读、算法基础与阶段性思考。比起只展示结论,更希望留下问题背景、推导过程和能被复用的经验。

主要内容

AIGC、多模态理解、分布式训练、PyTorch、视觉算法,以及工作与生活中的复盘。