|
Jianbiao Mei
I received my Ph.D. in June 2026 from the Department of Control Science and Engineering at
Zhejiang University, advised by
Prof. Yong Liu at the
APRIL Lab. Before that, I received my B.Eng. in June 2021 from the same department
with an honors degree at Chu Kochen Honors College.
I am currently a researcher at Shanghai AI Laboratory.
My research broadly focuses on embodied and interactive AI, including autonomous agents,
closed-loop environments, multimodal reasoning, and interactive systems.
Email /
Scholar /
GitHub
|
|
Research
* indicates equal contributions, † indicates equal advising.
|
|
MemHarness: Memory Is Reconstructed, Not Replayed
Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong Cai
arXiv, 2026
arXiv
/ code
Context-conditioned reconstruction turns retrieved agent memories into state-aligned guidance instead of static replay.
|
|
Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals
Daocheng Fu, Rong Wu, Yu Yang, Xuemeng Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Yong Liu, Botian Shi, Yu Qiao
arXiv, 2026
arXiv
/ code
Proxy-guided update signal transfer decouples low-cost exploration from reusable policy alignment for LLM post-training.
|
|
IG-Searcher: Anchoring Intent and Verifying Locally for Robust Multi-Turn Search with LLMs
Daocheng Fu*, Jianbiao Mei*, Licheng Wen, Xuemeng Yang, Rong Wu, Tao Hu, Pinlong Cai, Botian Shi, Yong Liu, Yu Qiao
WAICA, 2026
project page
Anchoring user intent and verifying evidence locally enables robust multi-turn search with LLMs.
|
|
O2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering
Jianbiao Mei*, Tao Hu*, Daocheng Fu*, Licheng Wen, Xuemeng Yang, Rong Wu, Pinlong Cai, Xinyu Cai, Xing Gao, Yu Yang, Chengjun Xie, Botian Shi, Yong Liu, Yu Qiao
TMLR, 2026
arXiv
/ code
Training search agents with reinforcement learning enables open-domain open-ended question answering.
|
|
SPIRAL: Self-Evolving Action-Conditioned Video Generation via Reflective Planning Agents
Yu Yang*, Yue Liao*, Jianbiao Mei*, Baisen Wang*, Xuemeng Yang, Licheng Wen, Jiangning Zhang, Xiangtai Li, Liang Lv, Hanlin Chen, Botian Shi, Yong Liu, Shuicheng Yan, Gim Hee Lee
arXiv, 2026
arXiv
/ project page
Sequential planning and iterative reflection enable self-evolving action-conditioned video generation for long-horizon tasks.
|
|
SPIKE: An Adaptive Dual Controller Framework for Cost-Efficient Long-Horizon Game Agents
Wencan Jiang, Jiangning Zhang, Jianbiao Mei, Jinzhuo Liu, Yu Yang, Xiaobin Hu, Zhucun Xue, Yong Liu, Dacheng Tao
arXiv, 2026
arXiv
/ code
/ project page
Adaptive switching between strategic planning and reactive execution improves long-horizon game agents under token and latency budgets.
|
|
EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle
Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi
ICML, 2026
arXiv
/ code
Distilling and reusing interaction experience enables self-evolving LLM agents.
|
|
The Agent's First Day: Benchmarking Learning, Exploration, and Scheduling in the Workplace Scenarios
Daocheng Fu*, Jianbiao Mei*, Rong Wu*, Xuemeng Yang*, Jia Xu, Ding Wang, Pinlong Cai, Yong Liu, Licheng Wen, Botian Shi
ACL Findings, 2026
arXiv
/ code
Simulating first-day workplace scenarios enables TraineeBench to evaluate agent learning, exploration, and scheduling.
|
|
Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
Cheng Yang, Xuemeng Yang, Licheng Wen, Daocheng Fu, Jianbiao Mei, Rong Wu, Pinlong Cai, Yufan Shen, Nianchen Deng, Botian Shi, Yu Qiao, Haifeng Li
ACL Findings, 2026
arXiv
/ code
Accumulating hierarchical experience enables MUSE to self-evolve on long-horizon productivity tasks.
|
|
Vision-Centric 4D Occupancy Forecasting and Planning via Implicit Residual World Models
Jianbiao Mei*, Yu Yang*, Xuemeng Yang, Licheng Wen, Jiajun Lv, Botian Shi, Yong Liu
ICRA, 2026
arXiv
/ code
Modeling residual scene changes enables vision-centric 4D occupancy forecasting and planning.
|
|
UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images
Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu
Preprint, 2025
arXiv
/ code
/ project page
Evaluating multi-hop reasoning over ultra-high-resolution imagery reveals the limits of current multimodal models.
|
|
KG-TRACES: Enhancing Large Language Models with Knowledge Graph-constrained Trajectory Reasoning and Attribution Supervision
Rong Wu, Pinlong Cai, Jianbiao Mei, Licheng Wen, Tao Hu, Xuemeng Yang, Daocheng Fu, Botian Shi
Preprint, 2025
arXiv
/ code
Constrained trajectory reasoning over knowledge graphs improves attribution-aware large language model reasoning.
|
|
X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability
Yu Yang, Alan Liang, Jianbiao Mei, Yukai Ma, Yong Liu, Gim Hee Lee
NeurIPS, 2025
arXiv
/ code
/ project page
Generating 3D scenes from semantic and textual controls enables high-fidelity controllable driving scene synthesis.
|
|
3D and 4D World Modeling: A Survey
Lingdong Kong*, Wesley Yang*, Jianbiao Mei*, Youquan Liu*, Ao Liang*, Dekai Zhu*, Dongyue Lu*, Wei Yin*, Xiaotao Hu, Mingkai Jia, Junyuan Deng, Kaiwen Zhang, Yang Wu, Tianyi Yan, Shenyuan Gao, Song Wang, Linfeng Li, Liang Pan, Yong Liu, Jianke Zhu, Wei Tsang Ooi, Steven C. H. Hoi, Ziwei Liu
Preprint, 2025
arXiv
/ code
/ project page
Organizing video, occupancy, and LiDAR generation methods clarifies the landscape of 3D and 4D world modeling.
|
|
CogDDN: A Cognitive Demand-Driven Navigation with Decision Optimization and Dual-Process Thinking
Yuehao Huang, Liang Liu, Shuangming Lei, Yukai Ma, Hao Su, Jianbiao Mei, Pengxiang Zhao, Yaqing Gu, Yong Liu, Jiajun Lv
ACM MM, 2025
arXiv
/ code
/ project page
Selecting goal-relevant objects with dual-process reasoning enables demand-driven robot navigation.
|
|
DriveArena: A Closed-loop Generative Simulation Platform for Autonomous Driving
Xuemeng Yang*, Licheng Wen*, Tiantian Wei*, Yukai Ma*, Jianbiao Mei*, Xin Li*, Wenjie Lei, Daocheng Fu, Pinlong Cai, Min Dou, Botian Shi, Liang He, Yong Liu, Yu Qiao
ICCV, 2025
arXiv
/ code
/ project page
Coupling generative scene simulation with closed-loop traffic interaction enables realistic evaluation of driving agents.
|
|
DreamForge: Motion-Aware Autoregressive Video Generation for Multi-View Driving Scenes
Jianbiao Mei*, Tao Hu*, Licheng Wen, Xuemeng Yang, Yu Yang, Tiantian Wei, Yukai Ma, Min Dou, Botian Shi, Yong Liu
Preprint, 2025
arXiv
/ project page
Autoregressively generating motion-aware multi-view videos enables long-horizon controllable driving scene synthesis.
|
|
DQFormer: Towards Unified LiDAR Panoptic Segmentation with Decoupled Queries
Yu Yang*, Jianbiao Mei*, Liang Liu, Siliang Du, Yilin Xiao, Jongwon Ra, Yong Liu, Xiao Xu, Huifeng Wu
TGRS, 2025
arXiv
/ code
Decoupling thing and stuff queries enables unified LiDAR panoptic segmentation.
|
|
Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving
Yu Yang*, Jianbiao Mei*, Yukai Ma, Siliang Du, Wenqing Chen, Yijie Qian, Yuxiang Feng, Yong Liu
AAAI, 2025 (Oral)
arXiv
/ code
/ project page
Forecasting controllable 4D occupancy with world models enables vision-centric planning for autonomous driving.
|
|
LeapVAD: A Leap in Autonomous Driving via Cognitive Perception and Dual-Process Thinking
Yukai Ma, Tiantian Wei, Naiting Zhong, Jianbiao Mei, Tao Hu, Licheng Wen, Xuemeng Yang, Botian Shi, Yong Liu
TNNLS, 2025
arXiv
/ code
/ project page
Combining cognitive perception with dual-process thinking improves autonomous driving decision making.
|
|
Continuously Learning, Adapting, and Improving: A Dual-Process Approach to Autonomous Driving
Jianbiao Mei*, Yukai Ma*, Xuemeng Yang, Licheng Wen, Xinyu Cai, Xin Li, Daocheng Fu, Bo Zhang, Pinlong Cai, Min Dou, Botian Shi, Liang He, Yong Liu, Yu Qiao
NeurIPS, 2024
arXiv
/ code
/ project page
Combining dual-process reasoning with experience memory enables continuously improving autonomous driving agents.
|
|
Camera-based 3D Semantic Scene Completion with Sparse Guidance Network
Jianbiao Mei, Yu Yang, Mengmeng Wang, Junyu Zhu, Jongwon Ra, Yukai Ma, Laijian Li, Yong Liu
TIP, 2024
arXiv
/ code
Propagating sparse semantic and geometric guidance enables camera-based 3D semantic scene completion.
|
|
LiCROcc: Teach Radar for Accurate Semantic Occupancy Prediction using LiDAR and Camera
Yukai Ma*, Jianbiao Mei*, Xuemeng Yang, Licheng Wen, Weihua Xu, Jiangning Zhang, Botian Shi, Yong Liu, Xingxing Zuo
RAL, 2024
arXiv
/ code
/ project page
Distilling LiDAR-camera occupancy knowledge into radar inputs improves robust semantic occupancy prediction.
|
|
A Coarse-to-Fine Place Recognition Approach using Attention-guided Descriptors and Overlap Estimation
Chencan Fu, Lin Li, Jianbiao Mei, Yukai Ma, Linpeng Peng, Xiangrui Zhao, Yong Liu
ICRA, 2024
arXiv
/ code
Combining attention-guided descriptors with overlap estimation enables coarse-to-fine place recognition.
|
|
Exploit Spatiotemporal Contextual Information for 3D Single Object Tracking via Memory Networks
Jongwon Ra, MengMeng Wang, Jianbiao Mei, Shanqi Liu, Yu Yang, Yong Liu
3DV, 2024
PDF
Storing short-term and long-term point-cloud memory improves 3D single object tracking under sparse observations.
|
|
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
Mengmeng Wang, Jiazheng Xing, Boyuan Jiang, Jun Chen, Jianbiao Mei, Xingxing Zuo, Guang Dai, Jingdong Wang, Yong Liu
AAAI, 2024 (Oral)
arXiv
/ code
Adapting multimodal CLIP features with multi-task supervision improves video action recognition and transfer.
|
|
Geo-Localization With Transformer-Based 2D-3D Match Network
Laijian Li, Yukai Ma, Kai Tang, Xiangrui Zhao, Chao Chen, Jianxin Huang, Jianbiao Mei, Yong Liu
RAL, 2023
code
/ PDF
Matching satellite imagery with LiDAR point clouds enables accurate geo-localization for urban navigation.
|
|
CenterLPS: Segment Instances by Centers for LiDAR Panoptic Segmentation
Jianbiao Mei*, Yu Yang*, Mengmeng Wang, Zizhang Li, Xiaojun Hou, Jongwon Ra, Laijian Li, Yong Liu
ACM MM, 2023
code
/ PDF
Representing LiDAR instances by sparse centers enables detection-free and clustering-free panoptic segmentation.
|
|
SSC-RS: Elevate LiDAR Semantic Scene Completion with Representation Separation and BEV Fusion
Jianbiao Mei, Yu Yang, Mengmeng Wang, Tianxin Huang, Xuemeng Yang, Yong Liu
IROS, 2023
arXiv
/ code
Separating semantic and geometric representations with BEV fusion improves LiDAR semantic scene completion.
|
|
PANet: LiDAR Panoptic Segmentation with Sparse Instance Proposal and Aggregation
Jianbiao Mei*, Yu Yang*, Mengmeng Wang, Xiaojun Hou, Laijian Li, Yong Liu
IROS, 2023
arXiv
/ code
Generating sparse instance proposals and aggregating fragments enables efficient LiDAR panoptic segmentation.
|
|
Fast Real-Time Video Object Segmentation with a Tangled Memory Network
Jianbiao Mei*, Mengmeng Wang*, Yu Yang, Yanjun Li, Yong Liu
ACM TIST, 2023
code
/ PDF
Organizing compact mask-aware memory enables fast real-time video object segmentation.
|
|
ActionCLIP: Adapting Language-Image Pretrained Models for Video Action Recognition
Mengmeng Wang, Jiazheng Xing, Jianbiao Mei, Yong Liu, Yunliang Jiang
TNNLS, 2023
code
/ PDF
Adapting language-image pretrained models enables transferable video action recognition across supervised and zero-shot settings.
|
|
E-NeRV: Expedite Neural Video Representation with Disentangled Spatial-Temporal Context
Zizhang Li, Mengmeng Wang, Huaijin Pi, Kechun Xu, Jianbiao Mei, Yong Liu
ECCV, 2022
arXiv
/ code
Disentangling spatial and temporal context accelerates neural video representation with fewer redundant parameters.
|
|
Delving Deeper Into Mask Utilization in Video Object Segmentation
Mengmeng Wang*, Jianbiao Mei*, Lina Liu, Guanzhong Tian, Yong Liu, Zaisheng Pan
TIP, 2022
code
/ PDF
Exploiting reference masks more effectively improves matching and boundary reasoning for video object segmentation.
|
|
TransVOS: Video Object Segmentation with Transformers
Jianbiao Mei*, Mengmeng Wang*, Yeneng Lin, Yi Yuan, Yong Liu
Preprint, 2021
arXiv
/ code
Modeling spatiotemporal relationships with transformers enables a unified pipeline for video object segmentation.
|
Service
Reviewer of TPAMI, TIP, TMM, TCSVT, RAL, CVPR, ECCV, NeurIPS, ICLR, AAAI, ACM MM, BMVC, ICRA, IROS, et al.
|
|