中文
相关论文

相关论文: VistaWise: Building Cost-Effective Agent with Cros…

200 篇论文

Large Language Models (LLMs) have enabled automated heuristic design (AHD) for combinatorial optimization problems (COPs), but existing frameworks' reliance on fixed evolutionary rules and static prompt templates often leads to myopic…

人工智能 · 计算机科学 2026-05-26 Oguzhan Gungordu , Siheng Xiong , Faramarz Fekri

While vision-language models (VLMs) have demonstrated remarkable performance across various tasks combining textual and visual information, they continue to struggle with fine-grained visual perception tasks that require detailed…

Recent advancements in Large Language Models (LLMs) have led to a rapid growth of agentic systems capable of handling a wide range of complex tasks. However, current research largely relies on manual, task-specific design, limiting their…

计算与语言 · 计算机科学 2025-02-28 Yu Shang , Yu Li , Keyu Zhao , Likai Ma , Jiahe Liu , Fengli Xu , Yong Li

We introduce Kimi K2.5, an open-source multimodal agentic model designed to advance general agentic intelligence. K2.5 emphasizes the joint optimization of text and vision so that two modalities enhance each other. This includes a series of…

计算与语言 · 计算机科学 2026-02-04 Kimi Team , Tongtong Bai , Yifan Bai , Yiping Bao , S. H. Cai , Yuan Cao , Y. Charles , H. S. Che , Cheng Chen , Guanduo Chen , Huarong Chen , Jia Chen , Jiahao Chen , Jianlong Chen , Jun Chen , Kefan Chen , Liang Chen , Ruijue Chen , Xinhao Chen , Yanru Chen , Yanxu Chen , Yicun Chen , Yimin Chen , Yingjiang Chen , Yuankun Chen , Yujie Chen , Yutian Chen , Zhirong Chen , Ziwei Chen , Dazhi Cheng , Minghan Chu , Jialei Cui , Jiaqi Deng , Muxi Diao , Hao Ding , Mengfan Dong , Mengnan Dong , Yuxin Dong , Yuhao Dong , Angang Du , Chenzhuang Du , Dikang Du , Lingxiao Du , Yulun Du , Yu Fan , Shengjun Fang , Qiulin Feng , Yichen Feng , Garimugai Fu , Kelin Fu , Hongcheng Gao , Tong Gao , Yuyao Ge , Shangyi Geng , Chengyang Gong , Xiaochen Gong , Zhuoma Gongque , Qizheng Gu , Xinran Gu , Yicheng Gu , Longyu Guan , Yuanying Guo , Xiaoru Hao , Weiran He , Wenyang He , Yunjia He , Chao Hong , Hao Hu , Jiaxi Hu , Yangyang Hu , Zhenxing Hu , Ke Huang , Ruiyuan Huang , Weixiao Huang , Zhiqi Huang , Tao Jiang , Zhejun Jiang , Xinyi Jin , Yu Jing , Guokun Lai , Aidi Li , C. Li , Cheng Li , Fang Li , Guanghe Li , Guanyu Li , Haitao Li , Haoyang Li , Jia Li , Jingwei Li , Junxiong Li , Lincan Li , Mo Li , Weihong Li , Wentao Li , Xinhang Li , Xinhao Li , Yang Li , Yanhao Li , Yiwei Li , Yuxiao Li , Zhaowei Li , Zheming Li , Weilong Liao , Jiawei Lin , Xiaohan Lin , Zhishan Lin , Zichao Lin , Cheng Liu , Chenyu Liu , Hongzhang Liu , Liang Liu , Shaowei Liu , Shudong Liu , Shuran Liu , Tianwei Liu , Tianyu Liu , Weizhou Liu , Xiangyan Liu , Yangyang Liu , Yanming Liu , Yibo Liu , Yuanxin Liu , Yue Liu , Zhengying Liu , Zhongnuo Liu , Enzhe Lu , Haoyu Lu , Zhiyuan Lu , Junyu Luo , Tongxu Luo , Yashuo Luo , Long Ma , Yingwei Ma , Shaoguang Mao , Yuan Mei , Xin Men , Fanqing Meng , Zhiyong Meng , Yibo Miao , Minqing Ni , Kun Ouyang , Siyuan Pan , Bo Pang , Yuchao Qian , Ruoyu Qin , Zeyu Qin , Jiezhong Qiu , Bowen Qu , Zeyu Shang , Youbo Shao , Tianxiao Shen , Zhennan Shen , Juanfeng Shi , Lidong Shi , Shengyuan Shi , Feifan Song , Pengwei Song , Tianhui Song , Xiaoxi Song , Hongjin Su , Jianlin Su , Zhaochen Su , Lin Sui , Jinsong Sun , Junyao Sun , Tongyu Sun , Flood Sung , Yunpeng Tai , Chuning Tang , Heyi Tang , Xiaojuan Tang , Zhengyang Tang , Jiawen Tao , Shiyuan Teng , Chaoran Tian , Pengfei Tian , Ao Wang , Bowen Wang , Chensi Wang , Chuang Wang , Congcong Wang , Dingkun Wang , Dinglu Wang , Dongliang Wang , Feng Wang , Hailong Wang , Haiming Wang , Hengzhi Wang , Huaqing Wang , Hui Wang , Jiahao Wang , Jinhong Wang , Jiuzheng Wang , Kaixin Wang , Linian Wang , Qibin Wang , Shengjie Wang , Shuyi Wang , Si Wang , Wei Wang , Xiaochen Wang , Xinyuan Wang , Yao Wang , Yejie Wang , Yipu Wang , Yiqin Wang , Yucheng Wang , Yuzhi Wang , Zhaoji Wang , Zhaowei Wang , Zhengtao Wang , Zhexu Wang , Zihan Wang , Zizhe Wang , Chu Wei , Ming Wei , Chuan Wen , Zichen Wen , Chengjie Wu , Haoning Wu , Junyan Wu , Rucong Wu , Wenhao Wu , Yuefeng Wu , Yuhao Wu , Yuxin Wu , Zijian Wu , Chenjun Xiao , Jin Xie , Xiaotong Xie , Yuchong Xie , Yifei Xin , Bowei Xing , Boyu Xu , Jianfan Xu , Jing Xu , Jinjing Xu , L. H. Xu , Lin Xu , Suting Xu , Weixin Xu , Xinbo Xu , Xinran Xu , Yangchuan Xu , Yichang Xu , Yuemeng Xu , Zelai Xu , Ziyao Xu , Junjie Yan , Yuzi Yan , Guangyao Yang , Hao Yang , Junwei Yang , Kai Yang , Ningyuan Yang , Ruihan Yang , Xiaofei Yang , Xinlong Yang , Ying Yang , Yi Yang , Yi Yang , Zhen Yang , Zhilin Yang , Zonghan Yang , Haotian Yao , Dan Ye , Wenjie Ye , Zhuorui Ye , Bohong Yin , Chengzhen Yu , Longhui Yu , Tao Yu , Tianxiang Yu , Enming Yuan , Mengjie Yuan , Xiaokun Yuan , Yang Yue , Weihao Zeng , Dunyuan Zha , Haobing Zhan , Dehao Zhang , Hao Zhang , Jin Zhang , Puqi Zhang , Qiao Zhang , Rui Zhang , Xiaobin Zhang , Y. Zhang , Yadong Zhang , Yangkun Zhang , Yichi Zhang , Yizhi Zhang , Yongting Zhang , Yu Zhang , Yushun Zhang , Yutao Zhang , Yutong Zhang , Zheng Zhang , Chenguang Zhao , Feifan Zhao , Jinxiang Zhao , Shuai Zhao , Xiangyu Zhao , Yikai Zhao , Zijia Zhao , Huabin Zheng , Ruihan Zheng , Shaojie Zheng , Tengyang Zheng , Junfeng Zhong , Longguang Zhong , Weiming Zhong , M. Zhou , Runjie Zhou , Xinyu Zhou , Zaida Zhou , Jinguo Zhu , Liya Zhu , Xinhao Zhu , Yuxuan Zhu , Zhen Zhu , Jingze Zhuang , Weiyu Zhuang , Ying Zou , Xinxing Zu

Large language models (LLMs) can help writers build story worlds by generating world elements, such as factions, characters, and locations. However, making sense of many generated elements can be overwhelming. Moreover, if the user wants to…

人机交互 · 计算机科学 2024-08-09 John Joon Young Chung , Max Kreminski

Cross-modal entity linking refers to the ability to align entities and their attributes across different modalities. While cross-modal entity linking is a fundamental skill needed for real-world applications such as multimodal code…

计算与语言 · 计算机科学 2025-06-02 Iñigo Alonso , Gorka Azkune , Ander Salaberria , Jeremy Barnes , Oier Lopez de Lacalle

Graphic visual content helps in promoting information communication and inspiration divergence. However, the interpretation of visual content currently relies mainly on humans' personal knowledge background, thereby affecting the quality…

计算机视觉与模式识别 · 计算机科学 2024-12-02 Xiaoyu Deng , Zhengjian Kang , Xintao Li , Yongzhe Zhang , Tianmin Guo

Large Language Models (LLMs) have shown great promise in tool-making, yet existing frameworks often struggle to efficiently construct reliable toolsets and are limited to single-task settings. To address these challenges, we propose GATE…

计算与语言 · 计算机科学 2025-02-21 Jianwen Luo , Yiming Huang , Jinxiang Meng , Fangyu Lei , Shizhu He , Xiao Liu , Shanshan Jiang , Bin Dong , Jun Zhao , Kang Liu

Text-rich visual understanding-the ability to process environments where dense textual content is integrated with visuals-is crucial for multimodal large language models (MLLMs) to interact effectively with structured environments. To…

计算机视觉与模式识别 · 计算机科学 2024-11-07 Junpeng Liu , Tianyue Ou , Yifan Song , Yuxiao Qu , Wai Lam , Chenyan Xiong , Wenhu Chen , Graham Neubig , Xiang Yue

Large language models (LLMs) have achieved remarkable performance across a wide range of natural language tasks. Understanding how LLMs internally represent knowledge remains a significant challenge. Despite Sparse Autoencoders (SAEs) have…

计算与语言 · 计算机科学 2025-09-26 Haoxuan Li , Zhen Wen , Qiqi Jiang , Chenxiao Li , Yuwei Wu , Yuchen Yang , Yiyao Wang , Xiuqi Huang , Minfeng Zhu , Wei Chen

While Vision-Language Models (VLMs) hold promise for tasks requiring extensive collaboration, traditional multi-agent simulators have facilitated rich explorations of an interactive artificial society that reflects collective behavior.…

计算与语言 · 计算机科学 2024-05-24 Xianhao Yu , Jiaqi Fu , Renjia Deng , Wenjuan Han

Vision-Language Models (VLMs) often yield inconsistent descriptions of the same object across viewpoints, hindering the ability of embodied agents to construct consistent semantic representations over time. Previous methods resolved…

计算机视觉与模式识别 · 计算机科学 2026-03-31 Tommaso Galliena , Stefano Rosa , Tommaso Apicella , Pietro Morerio , Alessio Del Bue , Lorenzo Natale

As multimodal large language models (MLLMs) advance, their large-scale architectures pose challenges for deployment in resource-constrained environments. In the age of large models, where energy efficiency, computational scalability and…

计算机视觉与模式识别 · 计算机科学 2025-09-11 Sike Xiang , Shuang Chen , Amir Atapour-Abarghouei

We present APT, an advanced Large Language Model (LLM)-driven framework that enables autonomous agents to construct complex and creative structures within the Minecraft environment. Unlike previous approaches that primarily concentrate on…

机器学习 · 计算机科学 2024-12-03 Jun Yu Chen , Tao Gao

Large Language Models (LLMs) have achieved remarkable reliability and advanced capabilities through extended test-time reasoning. However, extending these capabilities to Multi-modal Large Language Models (MLLMs) remains a significant…

计算机视觉与模式识别 · 计算机科学 2026-03-20 Yuhao Dong , Zuyan Liu , Shulin Tian , Yongming Rao , Ziwei Liu

Large language models (LLMs) have advanced code generation from single-function tasks to competitive-programming problems, but existing multi-agent solutions either rely on costly large-scale (>30B) models or collapse when downsized to…

计算与语言 · 计算机科学 2026-02-05 Woongkyu Lee , Junhee Cho , Jungwook Choi

Visual presentations are vital for effective communication. Early attempts to automate their creation using deep learning often faced issues such as poorly organized layouts, inaccurate text summarization, and a lack of image understanding,…

机器学习 · 计算机科学 2025-09-03 Xiaojie Xu , Xinli Xu , Sirui Chen , Haoyu Chen , Fan Zhang , Ying-Cong Chen

Vision-and-Language Navigation (VLN) requires an embodied agent to ground complex natural-language instructions into long-horizon navigation in unseen environments. While Vision-Language Models (VLMs) offer strong 2D semantic understanding,…

机器人学 · 计算机科学 2026-03-19 Zihao Xin , Wentong Li , Yixuan Jiang , Ziyuan Huang , Bin Wang , Piji Li , Jianke Zhu , Jie Qin , Shengjun Huang

Multimodal language models (MLMs) integrate visual and textual information by coupling a vision encoder with a large language model through the specific adapter. While existing approaches commonly rely on a single pre-trained vision…

计算机视觉与模式识别 · 计算机科学 2025-02-24 Matvey Skripkin , Elizaveta Goncharova , Dmitrii Tarasov , Andrey Kuznetsov

When we look around and perform complex tasks, how we see and selectively process what we see is crucial. However, the lack of this visual search mechanism in current multimodal LLMs (MLLMs) hinders their ability to focus on important…

计算机视觉与模式识别 · 计算机科学 2023-12-27 Penghao Wu , Saining Xie