中文

多模态视觉语言模型中的人类驱动区域适应

人工智能 2026-04-20 v2 计算与语言 计算机视觉与模式识别

摘要

尽管视觉语言 (VL) 领域在整合多语言、多域的视觉与文本信息方面取得了显著成果,但仍缺乏专门的框架来评估视觉语言系统中的人类中心对齐性。我们为此提出两项贡献:第一,引入人类驱动区域适应 (Anthropogenic Regional Adaptation):一种旨在优化模型对特定区域语境的相关性,同时确保保持全局泛化能力的新范式;第二,提出一种简单而有效的适应方法,名为 Geographical-generalization-made-easy (GG-EZ),其利用区域数据过滤和模型合并。通过在 3 种 VL 架构上进行全面实验:大型视觉语言模型、文本到图像扩散模型和视觉语言嵌入模型,以及在东南亚 (SEA) 区域适应案例研究中,我们展示了人类驱动区域适应的重要性和 GG-EZ 的有效性,显示在 SEA 各方面文化相关性指标上实现 5-15% 的提升,同时保持超过 98% 的全局性能,甚至有时超过原始性能。我们的发现确立了人类驱动区域对齐作为多模态视觉语言模型在多样化地区可应用性的基础范式,并演示了一条简单而有效的基线方法,可在保持全局泛化性的同时优化区域价值对齐。

关键词

引用

@article{arxiv.2604.11490,
  title  = {Anthropogenic Regional Adaptation in Multimodal Vision-Language Model},
  author = {Samuel Cahyawijaya and Peerat Limkonchotiwat and Tack Hwa Wong and Hitesh Laxmichand Patel and Amit Agarwal and Manuel Antonio Rufino and Carlos Rafael Catalan and Muhammad Reza Qorib and Vicky Feliren and Holy Lovenia and Aye Hninn Khine and Frederikus Hudi and David Anugraha and Alham Fikri Aji and Romrawin Chumpu and Viet-Thanh Pham and Minghan Wang and Mohamed Fazli Imam and Ruochen Zhang and Joseph Marvin Imperial and Khumaisa Nur'aini and Do Xuan Long and Musa Izzanardi Wijanarko and Joel Ruben Antony Moniz and Patrick Amadeus Irawan and Hanif Muhammad Zhafran and Isaiah Flores and Salsabila Zahirah Pranida and Jun Kevin and Jostin Jerico Rosal and Patricia Nicole Monderin and Kun Kerdthaisong and Ahmad Mustafid and My Chiffon Nguyen and Natchapon Jongwiriyanurak and Siva Worajitwannakul and Haochen Li and Adrian Xuan Wei Lim and Bin Wang and Muhammad Ravi Shulthan Habibi and Lynnette Hui Xian Ng and Mithil Bangera and Yeshil Bangera and Priyaranjan Pattnayak and Dun Li Chan and Sherissa Caren Djuniwar and Cho Chan Myei Oo and Hee Ming Shan},
  journal= {arXiv preprint arXiv:2604.11490},
  year   = {2026}
}