diff --git a/README.md b/README.md index 0081146..b625c09 100644 --- a/README.md +++ b/README.md @@ -1,230 +1,589 @@ - -# Code2Video: Video Generation via Code - - - - - - - -
- Code2Video: A Code-centric Paradigm for Educational Video Generation -
- - - - - -
- Yanzhe Chen,
- Kevin Qinghong Lin,
- Mike Zheng Shou
- Show Lab @ National University of Singapore
-
- 📄 Paper | - 🤗 Daily Paper | - 🤗 Dataset | - 🌐 Project Website | - 💬 X (Twitter) -
- -https://github.com/user-attachments/assets/d906423f-734a-41c9-b102-b113ad3b3c25 - ---- - -### Table of Contents -- [🌟 Overview](#-overview) -- [🚀 Quick Start: Code2Video](#-how-to-create----code2video) - - [1. Requirements](#1-requirements) - - [2. Configure LLM API Keys](#2-configure-llm-api-keys) - - [3. Run Agents](#3-run-agents) - - [4. Project Organization](#4-project-organization) -- [📊 Evaluation: MMMC](#-how-to-evaluate----mmmc) -- [🙏 Acknowledgements](#-acknowledgements) -- [📌 Citation](#-citation) - ---- - -## 🌟 Overview - -
-
-
-
-
|
+
+
+
+
+
+ Kevin + Qinghong Lin+Postdoctoral Researcher+
+ Torr Vision Group |
+
+ ![]() + + + |
+
+
+I work on building multi-modal assistants from and for humans. This involves abilities + like:
+I am looking for self-motivated students to work on the above topic. Feel free to drop me an email if you are interested.
+
+
+ |
+ Code2Video: A Code-centric Paradigm for Educational Video Generation + Yanzhe Chen†, Kevin QH. Lin†, Mike Z. Shou. +
+ Preprint, 2025 |
+
+
+ |
+ Paper2Poster: Towards Multimodal Poster
+ Automation from Scientific Papers + Wei Pang†, Kevin QH. Lin†, Xiangru + Jian†, Xi He, Philip Torr +
+ NeurIPS D&B, 2025 |
+
+
+ |
+ Think or Not? Selective Reasoning via
+ Reinforcement Learning for Vision-Language Models + Jiaqi Wang†, Kevin QH. Lin†, James + Cheng, Mike Z. Shou. +
+ NeurIPS, 2025 |
+
+
+ |
+ VideoMind: A Chain-of-LoRA Agent for Long
+ Video Reasoning + Ye Liu†, Kevin QH. Lin†, Chang Wen Chen, Mike Z. Shou. +
+ Preprint, 2025 |
+
+
+ |
+ ShowUI: One Vision-Language-Action
+ Model for GUI Visual Agent + Kevin QH. Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Stan WX. + Lei, Lijuan Wang, Mike Z. Shou. +
+ CVPR, 2025 |
+
+
+ |
+ VLog: Video-Language Models by Generative
+ Retrieval of Narration Vocabulary + Kevin QH. Lin, Mike Z. Shou. + |
+
+
+ |
+ VideoGUI: A Benchmark for GUI Automation
+ from Instructional Videos + Kevin QH. Lin, Linjie Li, Difei Gao, Qinchen Wu, Mingyi Yan, Zhengyuan Yang, Lijuan + Wang, Mike Z. Shou. +
+ NeurIPS D&B, 2024. Spotlight |
+
+
+ |
+ Learning Video Context as Interleaved
+ Multimodal Sequences Kevin QH. Lin, Pengchuan Zhang, Difei Gao, + Xide Xia, Joya Chen, Ziteng Gao, Jinheng Xie, Xuhong Xiao, Mike Z. Shou. + |
+
+
+ |
+ UniVTG: Towards Unified Video-Language
+ Temporal Grounding + Kevin QH. Lin, Pengchuan Zhang, Joya Chen, Shraman Pramanick, Difei Gao, Alex JP. + Wang, Rui Yan, Mike Z. Shou. + |
+
+
+ |
+
+ Egocentric Video-Language Pretraining
+ + Kevin QH. Lin, Alex JP. Wang, M. Soldan, M. Wray, R. Yan, Eric ZC. Xu, D. Gao, R. Tu, + W. Zhao, W. Kong, C. Cai, H. Wang, D. Damen, B. Ghanem, W. Liu, Mike Z. Shou. +
+
+ NeurIPS, 2022. Spotlight (1.7%) |
+
Area Chair: NeurIPS 2025. +
Workshop Organizer: Open Multimodal Gathering @ NUS; + Multimodal Video Agent @ CVPR 25. +
Conference Reviewer: CVPR (2024 Outstanding Reviewers), ICCV, ECCV, NeurIPS (2024 Top Reviewers), + ICML, ICLR, etc.
+Journal Reviewer: TPAMI, IJCV, TMLR, TNNLS, TMM, etc.
+Co-organizer of The AI Talks. +