Jianbiao Mei

I received my Ph.D. in June 2026 from the Department of Control Science and Engineering at Zhejiang University, advised by Prof. Yong Liu at the APRIL Lab. Before that, I received my B.Eng. in June 2021 from the same department with an honors degree at Chu Kochen Honors College.

I am currently a researcher at Shanghai AI Laboratory. My research broadly focuses on embodied and interactive AI, including autonomous agents, closed-loop environments, multimodal reasoning, and interactive systems.

Email  /  Scholar  /  GitHub

profile photo

News

Jul 2026 - One paper was accepted to WAICA 2026: IG-Searcher.

Jul 2026 - One paper was accepted to TMLR 2026: O2-Searcher.

Apr 2026 - One paper was accepted to ICML 2026: Evolver.

Apr 2026 - Two papers were accepted to ACL Findings 2026: TraineeBench and MUSE.

Jan 2026 - One paper was accepted to ICRA 2026: IR-WM.

Sep 2025 - One paper was accepted to NeurIPS 2025: X-Scene.

Jul 2025 - One paper was accepted to ACM MM 2025: CogDDN.

Jun 2025 - One paper was accepted to ICCV 2025: DriveArena.

Dec 2024 - One paper was accepted to AAAI 2025 as an oral presentation: Drive-OccWorld.

Oct 2024 - One paper was accepted to NeurIPS 2024: LeapAD.

Sep 2024 - One paper was accepted to TIP 2024: SGN.

Aug 2023 - One paper was accepted to ACM MM 2023: CenterLPS.

Jun 2023 - Two papers were accepted to IROS 2023: SSC-RS and PANet.

Feb 2023 - One paper was accepted to ACM TIST 2023: TMN.

Sep 2022 - One paper was accepted to TIP 2022: MaskVOS.

Research

* indicates equal contributions, † indicates equal advising.

project image MemHarness: Memory Is Reconstructed, Not Replayed
Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong Cai
arXiv, 2026
arXiv / code

Context-conditioned reconstruction turns retrieved agent memories into state-aligned guidance instead of static replay.

project image Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals
Daocheng Fu, Rong Wu, Yu Yang, Xuemeng Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Yong Liu, Botian Shi, Yu Qiao
arXiv, 2026
arXiv / code

Proxy-guided update signal transfer decouples low-cost exploration from reusable policy alignment for LLM post-training.

project image IG-Searcher: Anchoring Intent and Verifying Locally for Robust Multi-Turn Search with LLMs
Daocheng Fu*, Jianbiao Mei*, Licheng Wen, Xuemeng Yang, Rong Wu, Tao Hu, Pinlong Cai, Botian Shi, Yong Liu, Yu Qiao
WAICA, 2026
project page

Anchoring user intent and verifying evidence locally enables robust multi-turn search with LLMs.

project image O2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering
Jianbiao Mei*, Tao Hu*, Daocheng Fu*, Licheng Wen, Xuemeng Yang, Rong Wu, Pinlong Cai, Xinyu Cai, Xing Gao, Yu Yang, Chengjun Xie, Botian Shi, Yong Liu, Yu Qiao
TMLR, 2026
arXiv / code

Training search agents with reinforcement learning enables open-domain open-ended question answering.

project image SPIRAL: Self-Evolving Action-Conditioned Video Generation via Reflective Planning Agents
Yu Yang*, Yue Liao*, Jianbiao Mei*, Baisen Wang*, Xuemeng Yang, Licheng Wen, Jiangning Zhang, Xiangtai Li, Liang Lv, Hanlin Chen, Botian Shi, Yong Liu, Shuicheng Yan, Gim Hee Lee
arXiv, 2026
arXiv / project page

Sequential planning and iterative reflection enable self-evolving action-conditioned video generation for long-horizon tasks.

project image SPIKE: An Adaptive Dual Controller Framework for Cost-Efficient Long-Horizon Game Agents
Wencan Jiang, Jiangning Zhang, Jianbiao Mei, Jinzhuo Liu, Yu Yang, Xiaobin Hu, Zhucun Xue, Yong Liu, Dacheng Tao
arXiv, 2026
arXiv / code / project page

Adaptive switching between strategic planning and reactive execution improves long-horizon game agents under token and latency budgets.

project image EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle
Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi
ICML, 2026
arXiv / code

Distilling and reusing interaction experience enables self-evolving LLM agents.

project image The Agent's First Day: Benchmarking Learning, Exploration, and Scheduling in the Workplace Scenarios
Daocheng Fu*, Jianbiao Mei*, Rong Wu*, Xuemeng Yang*, Jia Xu, Ding Wang, Pinlong Cai, Yong Liu, Licheng Wen, Botian Shi
ACL Findings, 2026
arXiv / code

Simulating first-day workplace scenarios enables TraineeBench to evaluate agent learning, exploration, and scheduling.

project image Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
Cheng Yang, Xuemeng Yang, Licheng Wen, Daocheng Fu, Jianbiao Mei, Rong Wu, Pinlong Cai, Yufan Shen, Nianchen Deng, Botian Shi, Yu Qiao, Haifeng Li
ACL Findings, 2026
arXiv / code

Accumulating hierarchical experience enables MUSE to self-evolve on long-horizon productivity tasks.

project image Vision-Centric 4D Occupancy Forecasting and Planning via Implicit Residual World Models
Jianbiao Mei*, Yu Yang*, Xuemeng Yang, Licheng Wen, Jiajun Lv, Botian Shi, Yong Liu
ICRA, 2026
arXiv / code

Modeling residual scene changes enables vision-centric 4D occupancy forecasting and planning.

project image UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images
Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu
Preprint, 2025
arXiv / code / project page

Evaluating multi-hop reasoning over ultra-high-resolution imagery reveals the limits of current multimodal models.

project image KG-TRACES: Enhancing Large Language Models with Knowledge Graph-constrained Trajectory Reasoning and Attribution Supervision
Rong Wu, Pinlong Cai, Jianbiao Mei, Licheng Wen, Tao Hu, Xuemeng Yang, Daocheng Fu, Botian Shi
Preprint, 2025
arXiv / code

Constrained trajectory reasoning over knowledge graphs improves attribution-aware large language model reasoning.

project image X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability
Yu Yang, Alan Liang, Jianbiao Mei, Yukai Ma, Yong Liu, Gim Hee Lee
NeurIPS, 2025
arXiv / code / project page

Generating 3D scenes from semantic and textual controls enables high-fidelity controllable driving scene synthesis.

project image 3D and 4D World Modeling: A Survey
Lingdong Kong*, Wesley Yang*, Jianbiao Mei*, Youquan Liu*, Ao Liang*, Dekai Zhu*, Dongyue Lu*, Wei Yin*, Xiaotao Hu, Mingkai Jia, Junyuan Deng, Kaiwen Zhang, Yang Wu, Tianyi Yan, Shenyuan Gao, Song Wang, Linfeng Li, Liang Pan, Yong Liu, Jianke Zhu, Wei Tsang Ooi, Steven C. H. Hoi, Ziwei Liu
Preprint, 2025
arXiv / code / project page

Organizing video, occupancy, and LiDAR generation methods clarifies the landscape of 3D and 4D world modeling.

project image CogDDN: A Cognitive Demand-Driven Navigation with Decision Optimization and Dual-Process Thinking
Yuehao Huang, Liang Liu, Shuangming Lei, Yukai Ma, Hao Su, Jianbiao Mei, Pengxiang Zhao, Yaqing Gu, Yong Liu, Jiajun Lv
ACM MM, 2025
arXiv / code / project page

Selecting goal-relevant objects with dual-process reasoning enables demand-driven robot navigation.

project image DriveArena: A Closed-loop Generative Simulation Platform for Autonomous Driving
Xuemeng Yang*, Licheng Wen*, Tiantian Wei*, Yukai Ma*, Jianbiao Mei*, Xin Li*, Wenjie Lei, Daocheng Fu, Pinlong Cai, Min Dou, Botian Shi, Liang He, Yong Liu, Yu Qiao
ICCV, 2025
arXiv / code / project page

Coupling generative scene simulation with closed-loop traffic interaction enables realistic evaluation of driving agents.

project image DreamForge: Motion-Aware Autoregressive Video Generation for Multi-View Driving Scenes
Jianbiao Mei*, Tao Hu*, Licheng Wen, Xuemeng Yang, Yu Yang, Tiantian Wei, Yukai Ma, Min Dou, Botian Shi, Yong Liu
Preprint, 2025
arXiv / project page

Autoregressively generating motion-aware multi-view videos enables long-horizon controllable driving scene synthesis.

project image DQFormer: Towards Unified LiDAR Panoptic Segmentation with Decoupled Queries
Yu Yang*, Jianbiao Mei*, Liang Liu, Siliang Du, Yilin Xiao, Jongwon Ra, Yong Liu, Xiao Xu, Huifeng Wu
TGRS, 2025
arXiv / code

Decoupling thing and stuff queries enables unified LiDAR panoptic segmentation.

project image Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving
Yu Yang*, Jianbiao Mei*, Yukai Ma, Siliang Du, Wenqing Chen, Yijie Qian, Yuxiang Feng, Yong Liu
AAAI, 2025 (Oral)
arXiv / code / project page

Forecasting controllable 4D occupancy with world models enables vision-centric planning for autonomous driving.

project image LeapVAD: A Leap in Autonomous Driving via Cognitive Perception and Dual-Process Thinking
Yukai Ma, Tiantian Wei, Naiting Zhong, Jianbiao Mei, Tao Hu, Licheng Wen, Xuemeng Yang, Botian Shi, Yong Liu
TNNLS, 2025
arXiv / code / project page

Combining cognitive perception with dual-process thinking improves autonomous driving decision making.

project image Continuously Learning, Adapting, and Improving: A Dual-Process Approach to Autonomous Driving
Jianbiao Mei*, Yukai Ma*, Xuemeng Yang, Licheng Wen, Xinyu Cai, Xin Li, Daocheng Fu, Bo Zhang, Pinlong Cai, Min Dou, Botian Shi, Liang He, Yong Liu, Yu Qiao
NeurIPS, 2024
arXiv / code / project page

Combining dual-process reasoning with experience memory enables continuously improving autonomous driving agents.

project image Camera-based 3D Semantic Scene Completion with Sparse Guidance Network
Jianbiao Mei, Yu Yang, Mengmeng Wang, Junyu Zhu, Jongwon Ra, Yukai Ma, Laijian Li, Yong Liu
TIP, 2024
arXiv / code

Propagating sparse semantic and geometric guidance enables camera-based 3D semantic scene completion.

project image LiCROcc: Teach Radar for Accurate Semantic Occupancy Prediction using LiDAR and Camera
Yukai Ma*, Jianbiao Mei*, Xuemeng Yang, Licheng Wen, Weihua Xu, Jiangning Zhang, Botian Shi, Yong Liu, Xingxing Zuo
RAL, 2024
arXiv / code / project page

Distilling LiDAR-camera occupancy knowledge into radar inputs improves robust semantic occupancy prediction.

project image A Coarse-to-Fine Place Recognition Approach using Attention-guided Descriptors and Overlap Estimation
Chencan Fu, Lin Li, Jianbiao Mei, Yukai Ma, Linpeng Peng, Xiangrui Zhao, Yong Liu
ICRA, 2024
arXiv / code

Combining attention-guided descriptors with overlap estimation enables coarse-to-fine place recognition.

project image Exploit Spatiotemporal Contextual Information for 3D Single Object Tracking via Memory Networks
Jongwon Ra, MengMeng Wang, Jianbiao Mei, Shanqi Liu, Yu Yang, Yong Liu
3DV, 2024
PDF

Storing short-term and long-term point-cloud memory improves 3D single object tracking under sparse observations.

project image M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
Mengmeng Wang, Jiazheng Xing, Boyuan Jiang, Jun Chen, Jianbiao Mei, Xingxing Zuo, Guang Dai, Jingdong Wang, Yong Liu
AAAI, 2024 (Oral)
arXiv / code

Adapting multimodal CLIP features with multi-task supervision improves video action recognition and transfer.

project image Geo-Localization With Transformer-Based 2D-3D Match Network
Laijian Li, Yukai Ma, Kai Tang, Xiangrui Zhao, Chao Chen, Jianxin Huang, Jianbiao Mei, Yong Liu
RAL, 2023
code / PDF

Matching satellite imagery with LiDAR point clouds enables accurate geo-localization for urban navigation.

project image CenterLPS: Segment Instances by Centers for LiDAR Panoptic Segmentation
Jianbiao Mei*, Yu Yang*, Mengmeng Wang, Zizhang Li, Xiaojun Hou, Jongwon Ra, Laijian Li, Yong Liu
ACM MM, 2023
code / PDF

Representing LiDAR instances by sparse centers enables detection-free and clustering-free panoptic segmentation.

project image SSC-RS: Elevate LiDAR Semantic Scene Completion with Representation Separation and BEV Fusion
Jianbiao Mei, Yu Yang, Mengmeng Wang, Tianxin Huang, Xuemeng Yang, Yong Liu
IROS, 2023
arXiv / code

Separating semantic and geometric representations with BEV fusion improves LiDAR semantic scene completion.

project image PANet: LiDAR Panoptic Segmentation with Sparse Instance Proposal and Aggregation
Jianbiao Mei*, Yu Yang*, Mengmeng Wang, Xiaojun Hou, Laijian Li, Yong Liu
IROS, 2023
arXiv / code

Generating sparse instance proposals and aggregating fragments enables efficient LiDAR panoptic segmentation.

project image Fast Real-Time Video Object Segmentation with a Tangled Memory Network
Jianbiao Mei*, Mengmeng Wang*, Yu Yang, Yanjun Li, Yong Liu
ACM TIST, 2023
code / PDF

Organizing compact mask-aware memory enables fast real-time video object segmentation.

project image ActionCLIP: Adapting Language-Image Pretrained Models for Video Action Recognition
Mengmeng Wang, Jiazheng Xing, Jianbiao Mei, Yong Liu, Yunliang Jiang
TNNLS, 2023
code / PDF

Adapting language-image pretrained models enables transferable video action recognition across supervised and zero-shot settings.

project image E-NeRV: Expedite Neural Video Representation with Disentangled Spatial-Temporal Context
Zizhang Li, Mengmeng Wang, Huaijin Pi, Kechun Xu, Jianbiao Mei, Yong Liu
ECCV, 2022
arXiv / code

Disentangling spatial and temporal context accelerates neural video representation with fewer redundant parameters.

project image Delving Deeper Into Mask Utilization in Video Object Segmentation
Mengmeng Wang*, Jianbiao Mei*, Lina Liu, Guanzhong Tian, Yong Liu, Zaisheng Pan
TIP, 2022
code / PDF

Exploiting reference masks more effectively improves matching and boundary reasoning for video object segmentation.

project image TransVOS: Video Object Segmentation with Transformers
Jianbiao Mei*, Mengmeng Wang*, Yeneng Lin, Yi Yuan, Yong Liu
Preprint, 2021
arXiv / code

Modeling spatiotemporal relationships with transformers enables a unified pipeline for video object segmentation.

Service

Reviewer of TPAMI, TIP, TMM, TCSVT, RAL, CVPR, ECCV, NeurIPS, ICLR, AAAI, ACM MM, BMVC, ICRA, IROS, et al.


This website is adapted from this amazing template.