Author of 20+ papers with 2,100+ citations. See Google Scholar for citation counts and the most current list.

📄 Conference & Journal Publications

  • Bangzheng Li, Ximeng Sun, Jiang Liu, Ze Wang, Jialian Wu, Xiaodong Yu, Hao Chen, Emad Barsoum, Muhao Chen, Zicheng Liu. "Latent Visual Reasoning". ICLR 2026.
  • paper

  • Jingyang Lin, Jialian Wu, Jiang Liu, Ximeng Sun, Ze Wang, Xiaodong Yu, Jiebo Luo, Zicheng Liu, Emad Barsoum. "VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking". CVPR 2026.
  • paper

  • Shijia Yang, Yunong Liu, Bohan Zhai, Ximeng Sun, Zicheng Liu, Emad Barsoum, Manling Li, Chenfeng Xu. "CaptionQA: Is Your Caption as Useful as the Image Itself?". CVPR 2026.
  • paper

  • Xingrui Wang, Jiang Liu, Chao Huang, Xiaodong Yu, Ze Wang, Ximeng Sun, Jialian Wu, Alan Yuille, Emad Barsoum, Zicheng Liu. "XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models". ICLR 2026.
  • paper

  • Yujian Liu, Ze Wang, Hao Chen, Ximeng Sun, Xiaodong Yu, Jialian Wu, Jiang Liu, Emad Barsoum, Zicheng Liu, Shiyu Chang. "Learning from Online Videos at Inference Time for Computer-Use Agents". TMLR 2026.
  • paper

  • Jingyang Lin, Jialian Wu, Ximeng Sun, Ze Wang, Jiang Liu, Yusheng Su, Xiaodong Yu, Hao Chen, Jiebo Luo, Zicheng Liu, Emad Barsoum. "Unleashing Hour-Scale Video Training for Long Video-Language Understanding". NeurIPS 2025 (Spotlight).
  • paper

  • Yufan Zhuang, Xiaodong Yu, Jialian Wu, Ximeng Sun, Ze Wang, Jiang Liu, Yusheng Su, Jingbo Shang, Zicheng Liu, Emad Barsoum. "Self-Taught Agentic Long Context Understanding". ACL 2025.
  • paper

  • Samuel Schmidgall, Yusheng Su, Ze Wang, Ximeng Sun, Jialian Wu, Xiaodong Yu, Jiang Liu, Michael Moor, Zicheng Liu, Emad Barsoum. "Agent Laboratory: Using LLM Agents as Research Assistants". EMNLP 2025 (Findings).
  • paper

  • Hao Chen, Ze Wang, Xiang Li, Ximeng Sun, Fangyi Chen, Jiang Liu, Jindong Wang, Bhiksha Raj, Zicheng Liu, Emad Barsoum. "SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer". CVPR 2025.
  • paper

  • Reuben Tan, Ximeng Sun, Ping Hu, Jui-hsien Wang, Hanieh Deilamsalehy, Bryan A. Plummer, Bryan Russell, Kate Saenko. "Koala: Key Frame-Conditioned Long Video-LLM". CVPR 2024.
  • paper

  • Ping Hu, Ximeng Sun, Stan Sclaroff, Kate Saenko. "DualCoOp++: Fast and Effective Adaptation to Multi-Label Recognition with Limited Annotations". TPAMI 2024.
  • paper

  • Ximeng Sun, Rameswar Panda, Chun-Fu Chen, Naigang Wang, Bowen Pan, Aude Oliva, Rogerio Feris, Kate Saenko. "All at Once Network Quantization via Collaborative Knowledge Transfer". WACV 2024.
  • Ximeng Sun, Pengchuan Zhang, Peizhao Zhang, Hardik Shah, Kate Saenko, Xide Xia. "DIME-FM: DIstilling Multimodal and Efficient Foundation Models". ICCV 2023.
  • paper / code

  • Ximeng Sun, Ping Hu, Kate Saenko. "DualCoOp: Fast Adaptation to Multi-Label Recognition with Limited Annotations". NeurIPS 2022.
  • paper / code

  • Ximeng Sun, Rameswar Panda, Chun-Fu Chen, Aude Oliva, Rogerio Feris, Kate Saenko. "Dynamic Network Quantization for Efficient Video Inference". ICCV 2021.
  • paper / code

  • Rameswar Panda, Chun-Fu Chen, Quanfu Fan, Ximeng Sun, Kate Saenko, Aude Oliva, Rogerio Feris. "AdaMML: Adaptive Multi-Modal Learning for Efficient Video Recognition". ICCV 2021.
  • paper / code

  • Ximeng Sun, Rameswar Panda, Rogerio Feris, Kate Saenko. "AdaShare: Learning What To Share For Efficient Deep Multi-Task Learning". NeurIPS 2020.
  • paper / code

  • Ximeng Sun, Huijuan Xu, Kate Saenko. "TwoStreamVAN: Improving Motion Modeling in Video Generation". WACV 2020.
  • paper / code

  • Xingchao Peng, Zijun Huang, Ximeng Sun, Kate Saenko. "Domain Agnostic Learning with Disentangled Representations". ICML 2019.
  • paper / code

  • Ximeng Sun, Ryan Szeto, Jason Corso. "A Temporally-Aware Interpolation Network for Video Frame Inpainting". ACCV 2018.
  • paper / demo / code

  • Ryan Szeto, Ximeng Sun, Kunyi Lu, Jason Corso. "A Temporally-Aware Interpolation Network for Video Frame Inpainting". TPAMI 2019.
  • paper / code

📝 Preprints

  • Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu. "VEGAS: Human-Aligned Video Caption Evaluation via Gaze". 2026.
  • paper

  • Yihao Liang, Ze Wang, Hao Chen, Ximeng Sun, Jialian Wu, Xiaodong Yu, Jiang Liu, Emad Barsoum, Zicheng Liu, Niraj K. Jha. "CD4LM: Consistency Distillation and aDaptive Decoding for Diffusion Language Models". 2026.
  • paper

  • Zhikun Xu, Xiaodong Yu, Ben Zhou, Jiang Liu, Jialian Wu, Ze Wang, Ximeng Sun, Hao Chen, Zicheng Liu. "Reliable Use of Lemmas via Eligibility Reasoning and Section-Aware Reinforcement Learning". 2026.
  • paper

  • Jiang Liu, Jialian Wu, Xiaodong Yu, Yusheng Su, Prakamya Mishra, Gowtham Ramesh, Sudhanshu Ranjan, Chaitanya Manem, Ximeng Sun, Ze Wang, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum. "Instella: Fully Open Language Models with Stellar Performance". 2025.
  • paper

  • Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu. "Directional Reasoning Injection for Fine-Tuning MLLMs". 2025.
  • paper

  • Yuxiang Guo, Jiang Liu, Ze Wang, Hao Chen, Ximeng Sun, Yang Zhao, Jialian Wu, Xiaodong Yu, Zicheng Liu, Emad Barsoum. "ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning". 2025.
  • paper

  • Yuzhen Zhou, Jiajun Li, Yusheng Su, Gowtham Ramesh, Zilin Zhu, Xiang Long, Chenyang Zhao, Jin Pan, Xiaodong Yu, Ze Wang, Kangrui Du, Jialian Wu, Ximeng Sun, Jiang Liu, Qiaolin Yu, Hao Chen, Zicheng Liu, Emad Barsoum. "APRIL: Active Partial Rollouts in Reinforcement Learning to Tame Long-Tail Generation". 2025.
  • paper

  • Ze Wang, Hao Chen, Benran Hu, Jiang Liu, Ximeng Sun, Jialian Wu, Yusheng Su, Xiaodong Yu, Emad Barsoum, Zicheng Liu. "Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation". 2025.
  • paper / code

  • Xingrui Wang, Jiang Liu, Ze Wang, Xiaodong Yu, Jialian Wu, Ximeng Sun, Yusheng Su, Alan Yuille, Zicheng Liu, Emad Barsoum. "KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation". 2025.
  • paper

  • Aimon Rahman, Jiang Liu, Ze Wang, Ximeng Sun, Jialian Wu, Xiaodong Yu, Yusheng Su, Vishal M. Patel, Zicheng Liu, Emad Barsoum. "MOVi: Training-free Text-conditioned Multi-Object Video Generation". 2025.
  • paper

  • Piotr Teterwak, Ximeng Sun, Bryan A. Plummer, Kate Saenko, Ser-Nam Lim. "CLAMP: Contrastive LAnguage Model Prompt-tuning".
  • Ximeng Sun, Kihyuk Sohn, Kate Saenko, Clayton Mellina, Xiao Bian. "Label Budget Allocation in Multi-Task Learning".

🔖 Patents

  • Rameswar Panda, Ximeng Sun, Richard Chen, Rogerio Schmidt Feris, Ekaterina Saenko. "Dynamic network quantization for efficient video inference". US Patent App. 17/566,782.