I am currently working at WeChat AI Foundation Model Center, Tencent, focusing on the development and research of WeLM, with emphasis on Reinforcement Learning for LLMs and the integration of RL with model architecture. Prior to this, I worked at Baidu on LLM post-training for ERNIE / Wenxin Yiyan (文心一言). Before that, I graduated from the Department of Electronic Engineering, Tsinghua University. During my graduate studies, I primarily worked on communication-related research. I later transitioned to machine learning, with a focus on vision-language foundation models and multimodal learning.

πŸ”₯ News

  • 2026.02: Β πŸŽ‰ New preprint: PyVision-RL on agentic vision models via RL is now on arXiv.
  • 2026.02: Β πŸŽ‰ One paper on video generation evaluation (SVBench) accepted by CVPR 2026.
  • 2026.01: Β πŸŽ‰ One paper on video-guided audio generation (HarmoniDPO) accepted by IJCV.

πŸ“„ Technical Report

πŸ“ Publications

Recent
PyVision-RL

PyVision-RL: Forging Open Agentic Vision Models via RL

Shitian Zhao, Shaoheng Lin, Ming Li, Haoquan Zhang, Wenshuo Peng, Kaipeng Zhang, Chen Wei

CVPR 2026
SVBench

SVBench: Evaluation of Video Generation Models on Social Reasoning

Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

AAAI 2024
DAT

Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification

Wenshuo Peng, Kaipeng Zhang, Yue Yang, Hao Zhang, Yu Qiao

Findings of NAACL 2024
T3M

T3M: Text Guided 3D Human Motion Synthesis from Speech

Wenshuo Peng, Kaipeng Zhang, SAI QIAN Zhang

πŸ“– Educations

  • 2021.09 - 2024.06, M.S., Tsinghua University, Beijing, China.

πŸ’» Work Experience

  • 2026 - Present, WeChat AI, Tencent, Beijing, China.
  • 2024 - 2025, Baidu, Beijing, China. LLM post-training for ERNIE / Wenxin Yiyan (文心一言).