|
Jianbiao Mei
I received my Ph.D. in June 2026 from the Department of Control Science and Engineering at
Zhejiang University, advised by
Prof. Yong Liu at the
APRIL Lab. Before that, I received my B.Eng. in June 2021 from the same department
with an honors degree at Chu Kochen Honors College.
I am currently a researcher at Shanghai AI Laboratory, where I study AI agents and their applications to autonomous scientific discovery. My research interests span self-evolving agents, post-training, and agentic world modeling, informed by my prior work in foundational computer vision, including 3D scene understanding, as well as video understanding and generation. More broadly, I aim to develop intelligent systems that understand the world, learn proactively through interaction, and continually improve over time. I view these capabilities as essential for building agents that can advance scientific discovery, including AI research itself.
Email /
Scholar /
GitHub
|
|
|
* indicates equal contributions, † indicates equal advising.
|
MemHarness: Memory Is Reconstructed, Not Replayed
Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong Cai
arXiv, 2026
arXiv
/ code
Context-conditioned reconstruction turns retrieved agent memories into state-aligned guidance instead of static replay.
Proxy OPD: On-Policy Distillation with Transferable Relative Proxy Update
Daocheng Fu, Rong Wu, Yu Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Xuemeng Yang, Yong Liu, Botian Shi, Yu Qiao
arXiv, 2026
arXiv
/ code
Reuses relative policy improvements from proxy optimization to strengthen target LLMs without requiring stronger expert models.
IG-Searcher: Anchoring Intent and Verifying Locally for Robust Multi-Turn Search with LLMs
Daocheng Fu*, Jianbiao Mei*, Licheng Wen, Xuemeng Yang, Rong Wu, Tao Hu, Pinlong Cai, Botian Shi, Yong Liu, Yu Qiao
WAICA, 2026
project page
Anchoring user intent and verifying evidence locally enables robust multi-turn search with LLMs.
O2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering
Jianbiao Mei*, Tao Hu*, Daocheng Fu*, Licheng Wen, Xuemeng Yang, Rong Wu, Pinlong Cai, Xinyu Cai, Xing Gao, Yu Yang, Chengjun Xie, Botian Shi, Yong Liu, Yu Qiao
TMLR, 2026
arXiv
/ code
Training search agents with reinforcement learning enables open-domain open-ended question answering.
SPIRAL: Self-Evolving Action-Conditioned Video Generation via Reflective Planning Agents
Yu Yang*, Yue Liao*, Jianbiao Mei*, Baisen Wang*, Xuemeng Yang, Licheng Wen, Jiangning Zhang, Xiangtai Li, Liang Lv, Hanlin Chen, Botian Shi, Yong Liu, Shuicheng Yan, Gim Hee Lee
arXiv, 2026
arXiv
/ project page
Sequential planning and iterative reflection enable self-evolving action-conditioned video generation for long-horizon tasks.
EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle
Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi
ICML, 2026
arXiv
/ code
Distilling and reusing interaction experience enables self-evolving LLM agents.
The Agent's First Day: Benchmarking Learning, Exploration, and Scheduling in the Workplace Scenarios
Daocheng Fu*, Jianbiao Mei*, Rong Wu*, Xuemeng Yang*, Jia Xu, Ding Wang, Pinlong Cai, Yong Liu, Licheng Wen, Botian Shi
ACL Findings, 2026
arXiv
/ code
Simulating first-day workplace scenarios enables TraineeBench to evaluate agent learning, exploration, and scheduling.
Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
Cheng Yang, Xuemeng Yang, Licheng Wen, Daocheng Fu, Jianbiao Mei, Rong Wu, Pinlong Cai, Yufan Shen, Nianchen Deng, Botian Shi, Yu Qiao, Haifeng Li
ACL Findings, 2026
arXiv
/ code
Accumulating hierarchical experience enables MUSE to self-evolve on long-horizon productivity tasks.
UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images
Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu
Preprint, 2025
arXiv
/ code
/ project page
Evaluating multi-hop reasoning over ultra-high-resolution imagery reveals the limits of current multimodal models.
3D and 4D World Modeling: A Survey
Lingdong Kong*, Wesley Yang*, Jianbiao Mei*, Youquan Liu*, Ao Liang*, Dekai Zhu*, Dongyue Lu*, Wei Yin*, Xiaotao Hu, Mingkai Jia, Junyuan Deng, Kaiwen Zhang, Yang Wu, Tianyi Yan, Shenyuan Gao, Song Wang, Linfeng Li, Liang Pan, Yong Liu, Jianke Zhu, Wei Tsang Ooi, Steven C. H. Hoi, Ziwei Liu
Preprint, 2025
arXiv
/ code
/ project page
Organizing video, occupancy, and LiDAR generation methods clarifies the landscape of 3D and 4D world modeling.
CogDDN: A Cognitive Demand-Driven Navigation with Decision Optimization and Dual-Process Thinking
Yuehao Huang, Liang Liu, Shuangming Lei, Yukai Ma, Hao Su, Jianbiao Mei, Pengxiang Zhao, Yaqing Gu, Yong Liu, Jiajun Lv
ACM MM, 2025
arXiv
/ code
/ project page
Selecting goal-relevant objects with dual-process reasoning enables demand-driven robot navigation.
DriveArena: A Closed-loop Generative Simulation Platform for Autonomous Driving
Xuemeng Yang*, Licheng Wen*, Tiantian Wei*, Yukai Ma*, Jianbiao Mei*, Xin Li*, Wenjie Lei, Daocheng Fu, Pinlong Cai, Min Dou, Botian Shi, Liang He, Yong Liu, Yu Qiao
ICCV, 2025
arXiv
/ code
/ project page
Coupling generative scene simulation with closed-loop traffic interaction enables realistic evaluation of driving agents.
DreamForge: Motion-Aware Autoregressive Video Generation for Multi-View Driving Scenes
Jianbiao Mei*, Tao Hu*, Licheng Wen, Xuemeng Yang, Yu Yang, Tiantian Wei, Yukai Ma, Min Dou, Botian Shi, Yong Liu
Preprint, 2025
arXiv
/ project page
Autoregressively generating motion-aware multi-view videos enables long-horizon controllable driving scene synthesis.
Continuously Learning, Adapting, and Improving: A Dual-Process Approach to Autonomous Driving
Jianbiao Mei*, Yukai Ma*, Xuemeng Yang, Licheng Wen, Xinyu Cai, Xin Li, Daocheng Fu, Bo Zhang, Pinlong Cai, Min Dou, Botian Shi, Liang He, Yong Liu, Yu Qiao
NeurIPS, 2024
arXiv
/ code
/ project page
Combining dual-process reasoning with experience memory enables continuously improving autonomous driving agents.
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
Mengmeng Wang, Jiazheng Xing, Boyuan Jiang, Jun Chen, Jianbiao Mei, Xingxing Zuo, Guang Dai, Jingdong Wang, Yong Liu
AAAI, 2024 (Oral)
arXiv
/ code
Adapting multimodal CLIP features with multi-task supervision improves video action recognition and transfer.
Service
- Reviewer of TPAMI, TIP, TMM, TCSVT, RAL, CVPR, ECCV, NeurIPS, ICLR, AAAI, ACM MM, BMVC, ICRA, IROS, et al.
|
|