MMA-ASIA:面向亚洲语境的多语言多模态对齐评估框架
计算与语言
2025-10-13 v1 人工智能
摘要
大型语言模型(LLM)已在全球范围内广泛应用,但其在西方以外、尤其是资源匮乏的地区的多模态理解与推理能力常常下降。我们提出MMA-ASIA,一个综合性框架,用于评估LLM在亚洲语境下的文化意识。MMA-ASIA聚焦于一个由人类策划的、覆盖8个亚洲国家、10种语言的、多模态对齐的多选题基准数据集,包含2.7万题;其中79%以上题目要求基于文化语境进行多步推理,超越简单记忆。我们所构建的数据集是首个在文本、图像(视觉问答)和语音三种模态层面进行对齐的数据集,能够进行跨模态迁移的直接测试。基于该基准,我们提出五维评估协议,衡量:(i)跨国家的文化意识差异,(ii)跨语言一致性,(iii)跨模态一致性,(iv)文化知识的泛化能力,(v) grounding的有效性。为确保评估严谨,我们设计了文化意识grounding验证模块(Cultural Awareness Grounding Validation Module),用于检测模型是否存在“捷径学习”,即正确答案是否仅凭必需的文化知识即可得到。最后,通过模型比较分析、注意力追踪以及创新的视觉剥离前缀回放(Vision-ablated Prefix Replay, VPR)方法,我们探讨了模型在不同语言和模态间差异的原因,为构建具备文化可靠性的多模态LLM提供了可操作的改进建议。
引用
@article{arxiv.2510.08608,
title = {MMA-ASIA: A Multilingual and Multimodal Alignment Framework for Culturally-Grounded Evaluation},
author = {Weihua Zheng and Zhengyuan Liu and Tanmoy Chakraborty and Weiwen Xu and Xiaoxue Gao and Bryan Chen Zhengyu Tan and Bowei Zou and Chang Liu and Yujia Hu and Xing Xie and Xiaoyuan Yi and Jing Yao and Chaojun Wang and Long Li and Rui Liu and Huiyao Liu and Koji Inoue and Ryuichi Sumida and Tatsuya Kawahara and Fan Xu and Lingyu Ye and Wei Tian and Dongjun Kim and Jimin Jung and Jaehyung Seo and Nadya Yuki Wangsajaya and Pham Minh Duc and Ojasva Saxena and Palash Nandi and Xiyan Tao and Wiwik Karlina and Tuan Luong and Keertana Arun Vasan and Roy Ka-Wei Lee and Nancy F. Chen},
journal= {arXiv preprint arXiv:2510.08608},
year = {2025}
}