diff --git a/README.md b/README.md index b625c09..8b13789 100644 --- a/README.md +++ b/README.md @@ -1,589 +1 @@ - - - -
- - - - - - - - - - -|
-
-
-
-
-
- Kevin - Qinghong Lin-Postdoctoral Researcher-
- Torr Vision Group |
-
- ![]() - - - |
-
-
-I work on building multi-modal assistants from and for humans. This involves abilities - like:
-I am looking for self-motivated students to work on the above topic. Feel free to drop me an email if you are interested.
-
-
- |
- Code2Video: A Code-centric Paradigm for Educational Video Generation - Yanzhe Chen†, Kevin QH. Lin†, Mike Z. Shou. -
- Preprint, 2025 |
-
-
- |
- Paper2Poster: Towards Multimodal Poster
- Automation from Scientific Papers - Wei Pang†, Kevin QH. Lin†, Xiangru - Jian†, Xi He, Philip Torr -
- NeurIPS D&B, 2025 |
-
-
- |
- Think or Not? Selective Reasoning via
- Reinforcement Learning for Vision-Language Models - Jiaqi Wang†, Kevin QH. Lin†, James - Cheng, Mike Z. Shou. -
- NeurIPS, 2025 |
-
-
- |
- VideoMind: A Chain-of-LoRA Agent for Long
- Video Reasoning - Ye Liu†, Kevin QH. Lin†, Chang Wen Chen, Mike Z. Shou. -
- Preprint, 2025 |
-
-
- |
- ShowUI: One Vision-Language-Action
- Model for GUI Visual Agent - Kevin QH. Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Stan WX. - Lei, Lijuan Wang, Mike Z. Shou. -
- CVPR, 2025 |
-
-
- |
- VLog: Video-Language Models by Generative
- Retrieval of Narration Vocabulary - Kevin QH. Lin, Mike Z. Shou. - |
-
-
- |
- VideoGUI: A Benchmark for GUI Automation
- from Instructional Videos - Kevin QH. Lin, Linjie Li, Difei Gao, Qinchen Wu, Mingyi Yan, Zhengyuan Yang, Lijuan - Wang, Mike Z. Shou. -
- NeurIPS D&B, 2024. Spotlight |
-
-
- |
- Learning Video Context as Interleaved
- Multimodal Sequences Kevin QH. Lin, Pengchuan Zhang, Difei Gao, - Xide Xia, Joya Chen, Ziteng Gao, Jinheng Xie, Xuhong Xiao, Mike Z. Shou. - |
-
-
- |
- UniVTG: Towards Unified Video-Language
- Temporal Grounding - Kevin QH. Lin, Pengchuan Zhang, Joya Chen, Shraman Pramanick, Difei Gao, Alex JP. - Wang, Rui Yan, Mike Z. Shou. - |
-
-
- |
-
- Egocentric Video-Language Pretraining
- - Kevin QH. Lin, Alex JP. Wang, M. Soldan, M. Wray, R. Yan, Eric ZC. Xu, D. Gao, R. Tu, - W. Zhao, W. Kong, C. Cai, H. Wang, D. Damen, B. Ghanem, W. Liu, Mike Z. Shou. -
-
- NeurIPS, 2022. Spotlight (1.7%) |
-
Area Chair: NeurIPS 2025. -
Workshop Organizer: Open Multimodal Gathering @ NUS; - Multimodal Video Agent @ CVPR 25. -
Conference Reviewer: CVPR (2024 Outstanding Reviewers), ICCV, ECCV, NeurIPS (2024 Top Reviewers), - ICML, ICLR, etc.
-Journal Reviewer: TPAMI, IJCV, TMLR, TNNLS, TMM, etc.
-Co-organizer of The AI Talks. -