I am currently working at WeChat AI Foundation Model Center, Tencent, focusing on the development and research of WeLM, with emphasis on Reinforcement Learning for LLMs and the integration of RL with model architecture. Prior to this, I worked at Baidu on LLM post-training for ERNIE / Wenxin Yiyan (ζεΏδΈθ¨). Before that, I graduated from the Department of Electronic Engineering, Tsinghua University. During my graduate studies, I primarily worked on communication-related research. I later transitioned to machine learning, with a focus on vision-language foundation models and multimodal learning.
π₯ News
- 2026.02: Β π New preprint: PyVision-RL on agentic vision models via RL is now on arXiv.
- 2026.02: Β π One paper on video generation evaluation (SVBench) accepted by CVPR 2026.
- 2026.01: Β π One paper on video-guided audio generation (HarmoniDPO) accepted by IJCV.
π Technical Report
- ERNIE 4.5 Technical Report, Baidu ERNIE Team, 2025
π Publications

PyVision-RL: Forging Open Agentic Vision Models via RL
Shitian Zhao, Shaoheng Lin, Ming Li, Haoquan Zhang, Wenshuo Peng, Kaipeng Zhang, Chen Wei

SVBench: Evaluation of Video Generation Models on Social Reasoning
Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion
Wenshuo Peng, Kaipeng Zhang

Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
Wenshuo Peng, Kaipeng Zhang, Yue Yang, Hao Zhang, Yu Qiao

T3M: Text Guided 3D Human Motion Synthesis from Speech
Wenshuo Peng, Kaipeng Zhang, SAI QIAN Zhang
-
Yume: An Interactive World Generation Model, Xiangyu Mao, Shaoheng Lin, Zhen Li, Chuanhao Li, Wenshuo Peng, Tong He, Jiangmiao Pang, Mingming Chi, Yu Qiao, Kaipeng Zhang, arXiv 2025
-
Multi-relational Pedestrian Trajectory Prediction in Complex Scenes, Wenshuo Peng, Zhoujuan Cui, Yiping Duan, Xiaoming Tao, IEEE VTC 2022
π Educations
- 2021.09 - 2024.06, M.S., Tsinghua University, Beijing, China.
π» Work Experience
- 2026 - Present, WeChat AI, Tencent, Beijing, China.
- 2024 - 2025, Baidu, Beijing, China. LLM post-training for ERNIE / Wenxin Yiyan (ζεΏδΈθ¨).