Publications
Preprint
"*" means authors contributed equally and "#" means corresponding author.
Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions
Yunheng Li, Hengrui Zhang, Meng-Hao Guo, Wenzhao Gao, Shaoyong Jia, Shaohui Jiao, Qibin Hou#, Ming-Ming Cheng
Arxiv, 2026
Selected Journal Publications
SRFormerV2: Taking a Closer Look at Permuted Self-Attention for Image Super-Resolution
Yupeng Zhou, Zhen Li, Chun-Le Guo, Li Liu, Ming-Ming Cheng, Qibin Hou#
IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2026
Yolo-ms: rethinking multi-scale representation learning for real-time object detection
Yuming Chen, Xinbin Yuan, Ruiqi Wu, Jiabao Wang, Qibin Hou#, Ming-Ming Cheng
IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 47(6), 4240-4252, 2025
Conv2former: A simple transformer-style convnet for visual recognition
Qibin Hou, Cheng-Ze Lu, Ming-Ming Cheng#, Jiashi Feng
IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2024
Camoformer: Masked separable attention for camouflaged object detection
Bowen Yin*, Xuying Zhang*, Deng-Ping Fan, Shaohui Jiao, Ming-Ming Cheng, Luc Van Gool, Qibin Hou#
IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2024
Vision permutator: A permutable mlp-like architecture for visual recognition
Qibin Hou, Zihang Jiang, Li Yuan, Ming-Ming Cheng, Shuicheng Yan, Jiashi Feng
IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2023
Selected Conference Publications
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
Yupeng Zhou, Lianghua Huang, Zhifan Wu, Jiabao Wang, Yupeng Shi, Biao Jiang, Daquan Zhou, Yu Liu, Ming-Ming Cheng, Qibin Hou#
Siggraph Asia, 2026
GeoAgent: Learning to Geolocate Everywhere with Reinforced Geographic Characteristics
Modi Jin, Yiming Zhang, Boyuan Sun, Dingwen Zhang, MingMing Cheng, Qibin Hou#
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
Yunheng Li, Jing Cheng, Shaoyong Jia, Hangyi Kuang, Shaohui Jiao, Qibin Hou#, Ming-Ming Cheng
Neural Information Processing Systems (NeurIPS), 2025
Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning
Xinbin Yuan, Jian Zhang, Kaixin Li, Zhuoxuan Cai, Lujian Yao, Jie Chen, Enguang Wang, Qibin Hou#, Jinwei Chen, Peng-Tao Jiang, Bo Li#
Neural Information Processing Systems (NeurIPS), 2025
TAR3D: Creating High-Quality 3D Assets via Next-Part Prediction
Xuying Zhang*, Yutong Liu*, Yangguang Li, Renrui Zhang, Yufei Liu, Kai Wang, Wanli Ouyang, Zhiwei Xiong, Peng Gao, Qibin Hou#, Ming-Ming Cheng
IEEE International Conference on Computer Vision (ICCV), 2025
DFormerv2: Geometry Self-Attention for RGBD Semantic Segmentation
Bo-Wen Yin, Jiao-Long Cao, Ming-Ming Cheng, Qibin Hou#
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2025
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
Yupeng Zhou, Daquan Zhou#, Ming-Ming Cheng, Jiashi Feng, Qibin Hou#
Neural Information Processing Systems (NeurIPS), 2024
Coordinate attention for efficient mobile network design
Qibin Hou, Daquan Zhou, Jiashi Feng
IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2021