Yuxiang Cai is an assistant professor affiliated with School of Software Technology at Zhejiang University. He obtained the PhD degree in computer science and technology from Zhejiang University in 2023, supervised by Prof. Jianwei Yin. His research interests lie in Crossover Service, Model Transfer, Embodied AI and VLM. In particular, he is actively working on intelligent interpretation of multimodal data (video, 2D/3D image, …), transfer learning (UDA, TTA, …), AI+X (remote sensing, medicine, …),Embodied AI (VLA, Sim-to-Real, Efficiency, …) and space–air–ground integrated computing.
For students who are interested in joining our research group (Master/Intern), please contact me via caiyuxiang AT zju.edu.cn.
🔥 News
- 2026.08: I was Invited to serve as a reviewer for IEEE TIP
- 2026.08: 🎉 One paper is accepted by EMNLP 2026
- 2026.07: 🎉 One paper is accepted by ACMMM 2026
- 2026.07: I was Invited to serve as a reviewer for IEEE TMM
- 2026.06: I was Invited to serve as a reviewer for IJCV
- 2026.06: I was Invited to serve as a reviewer for IEEE TNNLS
- 2026.06: 🎉 One paper is accepted by IJCV (IF=10.3)
- 2026.06: 🎉 Two papers are accepted by ECCV 2026
- 2026.06: I was Invited to serve as a reviewer for AAAI 2027
- 2026.05: I was Invited to serve as a reviewer for CSUR
- 2026.05: 🎉 One paper is accepted by ICML 2026
- 2026.04: 🎉 One paper is accepted by ISPRS (IF=12.9)
- 2026.02: 🎉 Two papers are accepted by CVPR 2026 (one main, one findings)
- 2026.02: I was Invited to serve as a reviewer for ACMMM 2026
- 2026.02: I was Invited to serve as a reviewer for ICML 2026
- 2026.01: 🎉 One paper is accepted by ICLR 2026
- 2026.01: 🎉 One paper is accepted by ICASSP 2026
- 2025.12: I was Invited to serve as a reviewer for IJCAI-ECAI 2026
- 2025.11: I was Invited to serve as a reviewer for CVPR 2026
- 2025.09: 🎉 One United States Patent is granted
- 2025.09: 🎉 One Patent is granted by State Intellectual Property Office of China
- 2025.08: I was Invited to serve as a reviewer for AAAI 2026
- 2025.05: 🎉 One paper is accepted by IEEE GRSM (IF=16.4)
- 2025.04: 🎉 One Patent is granted by State Intellectual Property Office of China
- 2025.03: 🎉 One paper is accepted by ICME 2025
- 2025.02: I was Invited to serve as a reviewer for ACMMM 2025
- 2025.01: I was Invited to serve as a reviewer for IJCAI 2025
- 2024.07: 🎉 One paper is accepted by ACMMM 2024
- 2024.01: Join the School of Software Technology at Zhejiang University as an Assistant Professor
- 2023.11: 🎉 One Patent is granted by State Intellectual Property Office of China
- 2023.07: 🎉 One paper is accepted by ACMMM 2023
- 2023.05: I was Invited to serve as a reviewer for IEEE TGRS
- 2023.02: I was Invited to serve as a reviewer for NPL
- 2022.12: 🎉 One paper is accepted by IEEE TGRS
- 2022.09: I was Invited to serve as a reviewer for TJSC
- 2022.08: 🎉 One paper is accepted by IEEE TGRS
📝 Selective Publications

Qiaoru Li, Shaotian Liang, Jintao Chen, Haoran Sun, Yuxiang Cai*, Jianwei Yin, Yankai Jiang*
- This paper proposes VITAL, a latent-space reasoning framework for medical MLLMs with visual-semantic dual supervision.

Continual Video-MLLM Adaptation over Evolving Domains
Rui Cheng, Meixing Shi, Yuxiang Cai*, Jingcai Guo, Jianwei Yin, Zhi Chen*
- This paper proposes Distribution-Aware Expert Routing (DAER), a parameter-efficient framework for continual Video-MLLM adaptation over evolving domains.

Federated Learning Meets Test-Time Adaptation: Methods, Challenges, and Future Directions
Chen Zhang, Ge Su, Huaxiao Zhou, Lu Hao, Fenglin Zhu, Jintai Chen,Yuxiang Cai*, Jianwei Yin, Hongxia Xu*.
- This paper provides a comprehensive survey of Federated Test-Time Adaptation (FedTTA), formalizing its problem setting and establishing a unified taxonomy encompassing three paradigms.

Spectral Evolution-Guided Token Pruning in Large Multimodal Models
Bin Chen, Yuxiang Cai*, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen*.
- This work proposes a training-free token pruning framework based on Cross-Layer Spectral Evolution (CLSE).

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction
Zengjie Chen, Yuxiang Cai*, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen*.
- This work proposes Prior-Corrected Token Reduction (PriorTR), a training-free token reduction method that explicitly separates task-conditioned attention from the model-induced prior.

Yankai Jiang, Qiaoru Li, Binlu Xu, Haoran Sun, Chao Ding, Junting Dong, Yuxiang Cai*, Xuhong Zhang, Jianwei Yin.
- This work proposes a novel agentic MLLM, named IBISAgent, that reformulates segmentation as a vision-centric, multi-step decision-making process. IBISAgent enables MLLMs to generate interleaved reasoning and text-based click actions, invoke segmentation tools, and produce high-quality masks without architectural modifications.

Yuxiang Cai, Yongheng Shang, Jianwei Yin*
- This work proposes a novel multistage, multisource and multitarget unsupervised domain adaptation network called MultiDAN for remotely sensed semantic segmentation.

Yuxiang Cai, Meng Xi*, Yongheng Shang, Jianwei Yin
- This work proposes a novel multi-source domain adaptation method for semantic segmentation to maximally exploit the high-correlation source domains and source pixels for target domain.

Yuxiang Cai, Yingchun Yang, Yongheng Shang, Zhengwei Shen, Jianwei Yin*
- This work proposes DASRSNet, a novel multitask domain adaptation network for cross-domain semantic segmentation of low-resolution remote sensing images.

IterDANet: Iterative Intra-domain Adaptation for Semantic Segmentation of Remote Sensing Images
Yuxiang Cai, Yingchun Yang, Yongheng Shang, Zhenqian Chen, Zhengwei Shen, Jianwei Yin*
- This work proposes IterDANet, an iterative intra-domain adaptation network for semantic segmentation of remote sensing images.
- Qiaoru Li, Shaotian Liang, Jintao Chen, Haoran Sun, Yuxiang Cai*, Jianwei Yin, Yankai Jiang*. VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs. EMNLP 2026. [TH-CPL A]
- Rui Cheng, Meixing Shi, Yuxiang Cai*, Jingcai Guo, Jianwei Yin, Zhi Chen*. Continual Video-MLLM Adaptation over Evolving Domains. ACMMM 2026. [CCF-A]
- Chen Zhang, Ge Su, Huaxiao Zhou, Lu Hao, Fenglin Zhu, Jintai Chen,Yuxiang Cai*, Jianwei Yin, Hongxia Xu*. Federated Learning Meets Test-Time Adaptation: Methods, Challenges, and Future Directions. IJCV. 2026. [CCF-A]
- Bin Chen, Yuxiang Cai*, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen*. Spectral Evolution-Guided Token Pruning in Large Multimodal Models. ECCV 2026. [TH-CPL A]
- Zengjie Chen, Yuxiang Cai*, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen*. Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction. ECCV 2026. [TH-CPL A]
- Yankai Jiang, Qiaoru Li, Binlu Xu, Haoran Sun, Chao Ding, Junting Dong, Yuxiang Cai*, Xuhong Zhang, Jianwei Yin. IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation. CVPR 2026. [CCF-A]
- Yuxiang Cai, Yongheng Shang, Jianwei Yin*. MultiDAN: Unsupervised, Multistage, Multisource and Multitarget Domain Adaptation for Semantic Segmentation of Remote Sensing Images. ACMMM 2024. [CCF-A]
- Yuxiang Cai, Meng Xi*, Yongheng Shang, Jianwei Yin. Exploring High-Correlation Source Domain Information for Multi-Source Domain Adaptation in Semantic Segmentation. ACMMM 2023. [CCF-A]
- Yuxiang Cai, Yingchun Yang, Yongheng Shang, Zhengwei Shen, Jianwei Yin*. DASRSNet: Multitask Domain Adaptation for Super-Resolution-Aided Semantic Segmentation of Remote Sensing Images. TGRS 2023. [ZJUTOP/CCF-B, IF=8.6]
- Yuxiang Cai, Yingchun Yang, Yongheng Shang, Zhenqian Chen, Zhengwei Shen, Jianwei Yin*. IterDANet: Iterative Intra-domain Adaptation for Semantic Segmentation of Remote Sensing Images. TGRS 2022. [ZJUTOP/CCF-B, IF=8.6]
- Meixing Shi, Huaxiao Zhou, Jianhua Zhu, Tianyu Li, Yuxiang Cai*. SIGMA: Similarity-Guided Modulation with Adaptive Token Aggregation for LMM-based Reasoning Segmentation. ICONIP 2026. [CCF-C]
- Xu Jia, Bin Chen, Huaxiao Zhou, Xiaochu Chen, Lingxin Yu, Zilun Zhang, Yuxiang Cai*. TSAVD-CLIP: One Visual Encoder Learn Both Temporal and Spatial Feat. SOCA 2025. [CCF-C]
- Yuxiang Cai, Yingchun Yang*, Qiyi Zheng, Zhengwei Shen, Yongheng Shang, Jianwei Yin, Zhongtian Shi. BiFDANet: Unsupervised Bidirectional Domain Adaptation for Semantic Segmentation of Remote Sensing Images. RS 2022. [IF=5.0]
- Yingxuan Zhuang, Miao Pan, Jingxiao Yang, Jintao Chen, Cheng Tan, Yuxiang Cai, Siwei Tan, Chen Zhi, Xuhong Zhang, Jianwei Yin. Mitigating Manifold Departure: Uncertainty-aware Subspace Rectification for Trustworthy MLLM Decoding. ICML 2026. [CCF-A]
- Yuntai Bao, Xuhong Zhang, Jintao Chen, Ge Su, Yuxiang Cai, Hao Peng, Sun Bing, Haiqin Weng, Liu Yan, Jianwei Yin. Faithful Bi-Directional Model Steering via Distribution Matching and Distributed Interchange Interventions. ICLR 2026. [CCF-A]
- Xingyu Wu, Jintao Chen, Xuanye Zheng, Chenkai pan, Yuxiang Cai, Sun Bing, Ge Su, Shengye Pang, Xuhong Zhang. Adaptive Distillation for LM-GNN Alignment in Semi-Supervised Text-Attributed Graph Node Classification. ICASSP 2026. [CCF-B]
- Zilun Zhang, Zian Guan, Tiancheng Zhao, Haozhan Shen, Tianyu Li, Yuxiang Cai, Zhonggen Su, Zhaojun Liu, Jianwei Yin, Xiang Li.Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning. ISPRS Journal of Photogrammetry and Remote Sensing 2026. [IF=12.9]
- Zilun Zhang, Haozhan Shen, Tiancheng Zhao, Zian Guan, Bin Chen, Yuhao Wang, Xu Jia, Yuxiang Cai, Yongheng Shang, Jianwei Yin. Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG. IEEE GRSM 2025. [IF=16.4]
- Zhiqiang Shen, Qinfeng Li, Xuhong Zhang, Yuxiang Cai, Xiaochu Chen, Ping An, Haiqin Weng, Yan Liu. PatchSegDet: Attack-Agnostic Detection of Physical Adversarial Patches in Face Recognition Systems. ICME 2025. [CCF-B]
- Zhenqian Chen, Yongheng Shang, Andre Python, Yuxiang Cai, Jianwei Yin*. DB-BlendMask: Decomposed Attention and Balanced BlendMask for Instance Segmentation of High-Resolution Remote Sensing Images. TGRS 2022. [ZJUTOP/CCF-B, IF=8.6]
* denotes Corresponding Author
👏 Awards
- 2024年度中国商业联合会科技进步奖特等奖
- 2024年示范性软件学院软件技术创新成果
- 2026年示范性软件学院联盟关键软件技术创新成果
📓 Selective Patents
- US, “SEMANTIC SEGMENTATION METHOD FOR CROSS-DOMAIN REMOTE SENSING IMAGES BASED ON ITERATIVE INTRA-DOMAIN ADAPTATION”, US 12423825 B2.
- CN, “基于多级领域相关度的多源领域自适应语义分割方法及装置”, ZL 2023 1 1119643.3.
- CN, “基于迭代域内适应和自训练的跨域遥感图像语义分割方法”, ZL 2022 1 0402338.4.
- CN, “基于双向无监督域适应融合的跨星遥感图像语义分割方法”, ZL 2021 1 1017498.9.
- CN, “基于尺寸平衡FCOS的高分辨率遥感场景目标检测方法”, ZL 2021 1 1143539.9.
📚 Professional Activities
- Reviewer for IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), International Conference on Machine Learning (ICML), ACM International Conference on Multimedia (ACMMM), AAAI Conference on Artificial Intelligence (AAAI), International Joint Conference on Artificial Intelligence (IJCAI), …
- Reviewer for IEEE Transactions on Image Processing (TIP), IEEE Transactions on Multimedia (TMM), International Journal of Computer Vision (IJCV), ACM Computing Surveys (CSUR), IEEE Transactions on Geoscience and Remote Sensing (TGRS), IEEE Transactions on Neural Networks and Learning Systems (TNNLS), …
🎓 Education
- 2018.09 - 2023.12, Ph.D., Computer Science and Technology, Zhejiang University, Hangzhou.
- 2014.09 - 2018.06, B.E., Computer Science and Technology, Lanzhou University, Lanzhou.
💬 Contact
- caiyuxiang AT zju dot edu dot cn
- Building 3, School of Software Technology, Zhejiang University, Ningbo, China.