我目前是腾讯混元世界模型团队的算法研究员,主要研究方向为视频世界模型。在此之前,我在腾讯混元应用模型中心工作,主要研究身份一致的视频生成模型。
我于清华大学计算机科学与技术系获得博士学位,导师为张松海教授和王瑀屏教授。我所在的实验室是由胡事民教授创建的 CSCG 实验室。在攻读博士学位期间,我有三段精彩的实习经历:我在腾讯 AI Lab 实习了两年,与康頔博士和暴林超博士共同研究 3D 数字人表示与动画;我在蚂蚁研究院交互智能实验室实习了一年,与王璇博士共同探索 3D 数字人生成与动画;我还作为阿里星实习生在淘天集团实习,研究数字人表情动画。在攻读博士学位之前,我在北京科技大学计算机与通信工程学院获得了学士学位。
我目前的研究兴趣集中在视频世界模型、多模态生成和数字人 AI。
🔥 新闻
- 2026.07: 🎉 Goku 被 ECCV 2026 接收!
- 2026.06: 🎉 HarmoView 在 arXiv 上发布!
- 2026.05: 🎉 SpongeBob 在 arXiv 上发布!
- 2025.07: 我作为算法研究员加入腾讯混元。
- 2025.07: 🎉 两篇论文被 ICCV 2025 接收!
- 2025.03: 🎉 MeGA 被 CVPR 2025 接收!
- 2024.07: 我作为实习生加入蚂蚁集团。
- 2023.08: 🎉 Neural Point-based Volumetric Avatars 被 SIGGRAPH Asia 2023 接收!
- 2023.07: 🎉 LoLep 被 ICCV 2023 接收!
📝 发表论文

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen
- 我们介绍了 Goku,这是一个包含 200 万高质量视频编辑对的大规模数据集,将任务边界扩展到了多任务和结构性操作,同时还提出了 Goku-Edit(基于 MLLM 的双分支模型)和 Goku-Bench 以进行全面评估。

HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation
Cong Wang, Zhentao Yu, Hongmei Wang, Weicong Liang, Zixiang Zhou, Zilin Yang, Jiarong Ou, Rui Chen, Yezhou Liu, Shiyu An, Yue Lu, Yuan Zhou, Qinglin Lu
- 我们提出了 HarmoView,这是一个用于身份一致视频生成的鲁棒框架,它通过三种架构改进(多级特征注入、可学习的代理 token 和 Jump-RoPE)有效地整合了多视角线索,并结合渐进式视角课程,在预训练的 T2V 模型上实现了稳定的多视角训练。

SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing
Sen Liang, Cong Wang, Fengbin Guan, Zhentao Yu, Yiting Lu, Yuanzhi Wang, Yuan Zhou, Xin Li, Zhibo Chen
- SpongeBob 是首个端到端的音视频联合编辑框架,基于双流 DiT 构建,具有用于时空对齐的同步感知编辑机制和用于保持内容一致性的上下文感知模块,实现了和谐的视频-音频协同编辑。

He-Yi Sun, Cong Wang, Tian-Xing Xu, Jingwei Huang, Di Kang, Chunchao Guo, Song-Hai Zhang
- 通过提出 surf-GS 用于将全局外观建模为纹理图像,以及 vol-GS 用于非朗伯区域的高保真渲染,SVG-Head 不仅支持高质量渲染,还支持实时、细粒度的纹理编辑。

Yuan Sun, Xuan Wang, Cong Wang, WeiLi Zhang, Yanbo Fan, Yu Guo, Fei Wang
- 我们将从静态采集中进行 3D 高斯头部数字人建模转化为一个联合重建和配准问题,优化了基于先验和无先验的两组高斯,并通过非刚性 ICP 将它们绑定,生成了高分辨率的细粒度可驱动数字人。

MeGA: Hybrid Mesh-Gaussian Head Avatar for High-Fidelity Rendering and Head Editing
Cong Wang, Di Kang, He-Yi Sun, Shen-Han Qian, Zi-Xuan Wang, Linchao Bao, Song-Hai Zhang
- 通过提出为人类头部的不同部分使用更合适的表示方法以及相应的混合渲染方法,我们生成了高质量的 3D 人头数字人,并首次支持人头编辑(即纹理编辑和头发更改)。

Cong Wang, Di Kang, Yan-Pei Cao, Linchao Bao, Ying Shan, Song-Hai Zhang
- 我们提出了一种新的表面引导的神经点表示方法以及相应的渲染加速方法,大大提高了 3D 数字人头建模中眼睛和口腔内部的渲染质量。

LoLep: Single-View View Synthesis with Locally-Learned Planes and Self-Attention Occlusion Inference
Cong Wang, Yu-Ping Wang, Dinesh Manocha
- 我们提出使用 NN 采样器来获得更确定和合理的 MPI 平面位置,并引入了重投影损失来促进采样器的学习。此外,我们提出了块自注意力机制来增强网络对遮挡区域的推理能力。

MotionHint: Self-Supervised Monocular Visual Odometry with Motion Constraints
Cong Wang, Yu-Ping Wang, Dinesh Manocha
- 我们通过预训练的 PPNet 引入了相机载体(主要是无人车)的运动先验,从而可以根据运动先验校正预测的相机姿态,取得了最先进的结果。
- ORBBuf: A robust buffering method for remote visual SLAM, Yu-Ping Wang, Zi-xin Zou, Cong Wang, et al. IROS 2021
🎖 荣誉奖项
- 2024.11 华为奖学金 (¥20,000)
- 2024.07 2023 腾讯 AI Lab 犀牛鸟精英人才,卓越奖
- 2023.10 二等奖学金 (¥5,000)
- 2023.09 龙湖奖学金 (¥5,000)
- 2023.05 2023 腾讯 AI Lab 犀牛鸟精英人才
- 2022.10 二等奖学金 (¥5,000)
- 2022.09 龙湖奖学金 (¥5,000)
- 2020.06 北京市优秀毕业生 (Top 5%)
- 2019.11 国家奖学金 (¥8,000, 1/446)
- 2019.04 美国大学生数学建模竞赛,一等奖 (Top 4%)
- 2018.11 国家奖学金 (¥8,000, 1/446)
- 2018.04 美国大学生数学建模竞赛,一等奖 (Top 4%)
- 2017.11 人民特等奖学金 (¥5,000, 1/145)
- 2017.11 “冠之”奖学金 (¥10,000, 1/446)
📖 教育背景
- 2020.09 - 2025.06,博士生,清华大学计算机科学与技术系,北京。
- 2016.09 - 2020.06,本科生,北京科技大学计算机与通信工程学院,北京。
💬 邀请报告
- 2023.12,”Neural Point-based Volumetric Avatar: Surface-guided Neural Points for Efficient and Photorealistic Volumetric Head Avatar” 口头报告,SIGGRAPH Asia 2023,澳大利亚新南威尔士州悉尼。
- 2023.11,展示我的论文,受中国图象图形学报邀请,bilibili 视频
- 2022.07,展示我的论文,受将门创投邀请,bilibili 视频
- 2022.05,”MotionHint: Self-Supervised Monocular Visual Odometry with Motion Constraints” 口头报告,ICRA 2022,美国宾夕法尼亚州费城。
💻 工作经历
- 2025.07 - 至今,腾讯混元,北京。
- 2025.05 - 2025.07,淘天集团,杭州。
- 2024.07 - 2025.05,蚂蚁集团,杭州。
- 2022.07 - 2024.07,腾讯 AI Lab,北京。
