English
Related papers

Related papers: Skywork-R1V4: Toward Agentic Multimodal Intelligen…

200 papers

Video reasoning constitutes a comprehensive assessment of a model's capabilities, as it demands robust perceptual and interpretive skills, thereby serving as a means to explore the boundaries of model performance. While recent research has…

Computer Vision and Pattern Recognition · Computer Science 2026-02-06 Yudi Shi , Shangzhe Di , Qirui Chen , Qinian Wang , Jiayin Cai , Xiaolong Jiang , Yao Hu , Weidi Xie

Multimodal reasoning requires iterative coordination between language and vision, yet it remains unclear what constitutes a meaningful interleaved chain of thought. We posit that text and image thoughts should function as complementary…

Computer Vision and Pattern Recognition · Computer Science 2026-03-03 Jiawei Gu , Yunzhuo Hao , Huichen Will Wang , Linjie Li , Michael Qizhe Shieh , Yejin Choi , Ranjay Krishna , Yu Cheng

Research Agents enable models to gather information from the web using tools to answer user queries, requiring them to dynamically interleave internal reasoning with tool use. While such capabilities can in principle be learned via…

Artificial Intelligence · Computer Science 2026-03-10 Hansi Zeng , Zoey Li , Yifan Gao , Chenwei Zhang , Xiaoman Pan , Tao Yang , Fengran Mo , Jiacheng Lin , Xian Li , Jingbo Shang

Millimeter-wave or terahertz communications can meet demands of low-altitude economy networks for high-throughput sensing and real-time decision making. However, high-frequency characteristics of wireless channels result in severe…

Networking and Internet Architecture · Computer Science 2026-03-13 Min Hao , Zhizhuo Li , Zirui Zhang , Maoqiang Wu , Han Zhang , Rong Yu

Multimodal deep search agents have shown great potential in solving complex tasks by iteratively collecting textual and visual evidence. However, managing the heterogeneous information and high token costs associated with multimodal inputs…

Computer Vision and Pattern Recognition · Computer Science 2026-04-28 Yifan Du , Zikang Liu , Jinbiao Peng , Jie Wu , Junyi Li , Jinyang Li , Wayne Xin Zhao , Ji-Rong Wen

The frontier of visual reasoning is shifting toward models like OpenAI o3, which can intelligently create and operate tools to transform images for problem-solving, also known as thinking-\textit{with}-images in chain-of-thought. Yet…

Computer Vision and Pattern Recognition · Computer Science 2025-11-07 Ming Li , Jike Zhong , Shitian Zhao , Haoquan Zhang , Shaoheng Lin , Yuxiang Lai , Chen Wei , Konstantinos Psounis , Kaipeng Zhang

LLMs are increasingly deployed as agents, systems capable of planning, reasoning, and dynamically calling external tools. However, in visual reasoning, prior approaches largely remain limited by predefined workflows and static toolsets. In…

Computation and Language · Computer Science 2025-08-28 Shitian Zhao , Haoquan Zhang , Shaoheng Lin , Ming Li , Qilong Wu , Kaipeng Zhang , Chen Wei

Empowering Large Multimodal Models (LMMs) to deeply integrate image interaction with long-horizon reasoning capabilities remains a long-standing challenge in this field. Recent advances in vision-centric reasoning explore a promising…

Computer Vision and Pattern Recognition · Computer Science 2025-12-19 Runqi Qiao , Qiuna Tan , Minghan Yang , Guanting Dong , Peiqing Yang , Shiqiang Lang , Enhui Wan , Xiaowan Wang , Yida Xu , Lan Yang , Chong Sun , Chen Li , Jing Lyu , Honggang Zhang

Agentic reinforcement learning has advanced large language models (LLMs) to reason through long chain-of-thought trajectories while interleaving external tool use. Existing approaches assume a fixed inventory of tools, limiting LLM agents'…

Computation and Language · Computer Science 2025-12-16 Jiaru Zou , Ling Yang , Yunzhe Qi , Sirui Chen , Mengting Ai , Ke Shen , Jingrui He , Mengdi Wang

We introduce Kimi K2.5, an open-source multimodal agentic model designed to advance general agentic intelligence. K2.5 emphasizes the joint optimization of text and vision so that two modalities enhance each other. This includes a series of…

Computation and Language · Computer Science 2026-02-04 Kimi Team , Tongtong Bai , Yifan Bai , Yiping Bao , S. H. Cai , Yuan Cao , Y. Charles , H. S. Che , Cheng Chen , Guanduo Chen , Huarong Chen , Jia Chen , Jiahao Chen , Jianlong Chen , Jun Chen , Kefan Chen , Liang Chen , Ruijue Chen , Xinhao Chen , Yanru Chen , Yanxu Chen , Yicun Chen , Yimin Chen , Yingjiang Chen , Yuankun Chen , Yujie Chen , Yutian Chen , Zhirong Chen , Ziwei Chen , Dazhi Cheng , Minghan Chu , Jialei Cui , Jiaqi Deng , Muxi Diao , Hao Ding , Mengfan Dong , Mengnan Dong , Yuxin Dong , Yuhao Dong , Angang Du , Chenzhuang Du , Dikang Du , Lingxiao Du , Yulun Du , Yu Fan , Shengjun Fang , Qiulin Feng , Yichen Feng , Garimugai Fu , Kelin Fu , Hongcheng Gao , Tong Gao , Yuyao Ge , Shangyi Geng , Chengyang Gong , Xiaochen Gong , Zhuoma Gongque , Qizheng Gu , Xinran Gu , Yicheng Gu , Longyu Guan , Yuanying Guo , Xiaoru Hao , Weiran He , Wenyang He , Yunjia He , Chao Hong , Hao Hu , Jiaxi Hu , Yangyang Hu , Zhenxing Hu , Ke Huang , Ruiyuan Huang , Weixiao Huang , Zhiqi Huang , Tao Jiang , Zhejun Jiang , Xinyi Jin , Yu Jing , Guokun Lai , Aidi Li , C. Li , Cheng Li , Fang Li , Guanghe Li , Guanyu Li , Haitao Li , Haoyang Li , Jia Li , Jingwei Li , Junxiong Li , Lincan Li , Mo Li , Weihong Li , Wentao Li , Xinhang Li , Xinhao Li , Yang Li , Yanhao Li , Yiwei Li , Yuxiao Li , Zhaowei Li , Zheming Li , Weilong Liao , Jiawei Lin , Xiaohan Lin , Zhishan Lin , Zichao Lin , Cheng Liu , Chenyu Liu , Hongzhang Liu , Liang Liu , Shaowei Liu , Shudong Liu , Shuran Liu , Tianwei Liu , Tianyu Liu , Weizhou Liu , Xiangyan Liu , Yangyang Liu , Yanming Liu , Yibo Liu , Yuanxin Liu , Yue Liu , Zhengying Liu , Zhongnuo Liu , Enzhe Lu , Haoyu Lu , Zhiyuan Lu , Junyu Luo , Tongxu Luo , Yashuo Luo , Long Ma , Yingwei Ma , Shaoguang Mao , Yuan Mei , Xin Men , Fanqing Meng , Zhiyong Meng , Yibo Miao , Minqing Ni , Kun Ouyang , Siyuan Pan , Bo Pang , Yuchao Qian , Ruoyu Qin , Zeyu Qin , Jiezhong Qiu , Bowen Qu , Zeyu Shang , Youbo Shao , Tianxiao Shen , Zhennan Shen , Juanfeng Shi , Lidong Shi , Shengyuan Shi , Feifan Song , Pengwei Song , Tianhui Song , Xiaoxi Song , Hongjin Su , Jianlin Su , Zhaochen Su , Lin Sui , Jinsong Sun , Junyao Sun , Tongyu Sun , Flood Sung , Yunpeng Tai , Chuning Tang , Heyi Tang , Xiaojuan Tang , Zhengyang Tang , Jiawen Tao , Shiyuan Teng , Chaoran Tian , Pengfei Tian , Ao Wang , Bowen Wang , Chensi Wang , Chuang Wang , Congcong Wang , Dingkun Wang , Dinglu Wang , Dongliang Wang , Feng Wang , Hailong Wang , Haiming Wang , Hengzhi Wang , Huaqing Wang , Hui Wang , Jiahao Wang , Jinhong Wang , Jiuzheng Wang , Kaixin Wang , Linian Wang , Qibin Wang , Shengjie Wang , Shuyi Wang , Si Wang , Wei Wang , Xiaochen Wang , Xinyuan Wang , Yao Wang , Yejie Wang , Yipu Wang , Yiqin Wang , Yucheng Wang , Yuzhi Wang , Zhaoji Wang , Zhaowei Wang , Zhengtao Wang , Zhexu Wang , Zihan Wang , Zizhe Wang , Chu Wei , Ming Wei , Chuan Wen , Zichen Wen , Chengjie Wu , Haoning Wu , Junyan Wu , Rucong Wu , Wenhao Wu , Yuefeng Wu , Yuhao Wu , Yuxin Wu , Zijian Wu , Chenjun Xiao , Jin Xie , Xiaotong Xie , Yuchong Xie , Yifei Xin , Bowei Xing , Boyu Xu , Jianfan Xu , Jing Xu , Jinjing Xu , L. H. Xu , Lin Xu , Suting Xu , Weixin Xu , Xinbo Xu , Xinran Xu , Yangchuan Xu , Yichang Xu , Yuemeng Xu , Zelai Xu , Ziyao Xu , Junjie Yan , Yuzi Yan , Guangyao Yang , Hao Yang , Junwei Yang , Kai Yang , Ningyuan Yang , Ruihan Yang , Xiaofei Yang , Xinlong Yang , Ying Yang , Yi Yang , Yi Yang , Zhen Yang , Zhilin Yang , Zonghan Yang , Haotian Yao , Dan Ye , Wenjie Ye , Zhuorui Ye , Bohong Yin , Chengzhen Yu , Longhui Yu , Tao Yu , Tianxiang Yu , Enming Yuan , Mengjie Yuan , Xiaokun Yuan , Yang Yue , Weihao Zeng , Dunyuan Zha , Haobing Zhan , Dehao Zhang , Hao Zhang , Jin Zhang , Puqi Zhang , Qiao Zhang , Rui Zhang , Xiaobin Zhang , Y. Zhang , Yadong Zhang , Yangkun Zhang , Yichi Zhang , Yizhi Zhang , Yongting Zhang , Yu Zhang , Yushun Zhang , Yutao Zhang , Yutong Zhang , Zheng Zhang , Chenguang Zhao , Feifan Zhao , Jinxiang Zhao , Shuai Zhao , Xiangyu Zhao , Yikai Zhao , Zijia Zhao , Huabin Zheng , Ruihan Zheng , Shaojie Zheng , Tengyang Zheng , Junfeng Zhong , Longguang Zhong , Weiming Zhong , M. Zhou , Runjie Zhou , Xinyu Zhou , Zaida Zhou , Jinguo Zhu , Liya Zhu , Xinhao Zhu , Yuxuan Zhu , Zhen Zhu , Jingze Zhuang , Weiyu Zhuang , Ying Zou , Xinxing Zu

Real-world multimodal agents solve multi-step workflows grounded in visual evidence. For example, an agent can troubleshoot a device by linking a wiring photo to a schematic and validating the fix with online documentation, or plan a trip…

Computer Vision and Pattern Recognition · Computer Science 2026-03-03 Zhaochen Su , Jincheng Gao , Hangyu Guo , Zhenhua Liu , Lueyang Zhang , Xinyu Geng , Shijue Huang , Peng Xia , Guanyu Jiang , Cheng Wang , Yue Zhang , Yi R. Fung , Junxian He

AI agents with advanced reasoning and tool use capabilities have demonstrated impressive performance in web browsing for deep search. While existing benchmarks such as BrowseComp evaluate these browsing abilities, they primarily focus on…

We present a Collaborative Agent-Based Framework for Multi-Image Reasoning. Our approach tackles the challenge of interleaved multimodal reasoning across diverse datasets and task formats by employing a dual-agent system: a language-based…

Computer Vision and Pattern Recognition · Computer Science 2025-08-04 Angelos Vlachos , Giorgos Filandrianos , Maria Lymperaiou , Nikolaos Spanos , Ilias Mitsouras , Vasileios Karampinis , Athanasios Voulodimos

The success of DeepSeek-R1 underscores the significant role of reinforcement learning (RL) in enhancing the reasoning capabilities of large language models (LLMs). In this work, we present Skywork-OR1, an effective and scalable RL…

A key trend in Large Reasoning Models (e.g., OpenAI's o3) is the native agentic ability to use external tools such as web browsers for searching and writing/executing code for image manipulation to think with images. In the open-source…

Computer Vision and Pattern Recognition · Computer Science 2025-05-21 Ziyu Liu , Yuhang Zang , Yushan Zou , Zijian Liang , Xiaoyi Dong , Yuhang Cao , Haodong Duan , Dahua Lin , Jiaqi Wang

Large Language Models (LLMs) have achieved remarkable reliability and advanced capabilities through extended test-time reasoning. However, extending these capabilities to Multi-modal Large Language Models (MLLMs) remains a significant…

Computer Vision and Pattern Recognition · Computer Science 2026-03-20 Yuhao Dong , Zuyan Liu , Shulin Tian , Yongming Rao , Ziwei Liu

The reasoning capabilities of LLM (Large Language Model) are widely acknowledged in recent research, inspiring studies on tool learning and autonomous agents. LLM serves as the "brain" of the agent, orchestrating multiple tools for…

Machine Learning · Computer Science 2024-03-26 Xiangyan Liu , Rongxue Li , Wei Ji , Tao Lin

Recently, large language models (LLMs) have demonstrated remarkable problem-solving capabilities by autonomously integrating with external tools for collaborative reasoning. However, due to the inherently complex and diverse nature of…

Artificial Intelligence · Computer Science 2025-11-03 Mengjie Deng , Guanting Dong , Zhicheng Dou

Multimodal reasoning has become a cornerstone of modern AI research. Standardized exam questions offer a uniquely rigorous testbed for such reasoning, providing structured visual contexts and verifiable answers. While recent progress has…

Computer Vision and Pattern Recognition · Computer Science 2025-12-02 Egemen Sert , Şeyda Ertekin

Direct prompt-based editing often fails on complex transformations because vague and subjective prompts often require nuanced understanding of what should be changed in the image. Our core intuition is that leveraging compositional image…

Machine Learning · Computer Science 2026-03-10 Subhojyoti Mukherjee , Stefano Petrangeli , Branislav Kveton , Trung Bui , Franck Dernoncourt , Arko Mukherjee