多语言语言模型的文化嵌入式治理:权利、数据边界与可 accountable AI 设计
计算与语言
2026-02-03 v1 人工智能
摘要
多语言大语言模型(MLLMs)正在跨文化、语言和政治语境中部署,而现有治理框架大多假设以英语为中心的数据、同质化的用户群体以及抽象的公平概念。这会导致对低资源语言和文化被边缘化社区的系统性风险,其中数据实践、模型行为和问责机制常常无法与当地的规范、权利和期望相吻合。drawing on 跨文化人类计算和 AI 治理视角,本文综合了关于多语言模型行为、数据不平等和社会技术伤害的既有证据,提出了面向 MLLMs 的文化嵌入式治理框架。我们识别出三个相互关联的治理挑战:训练数据和评估实践中的文化与语言不平等、全球部署与当地 situ 上 norms、values 和权力结构之间的错位,以及针对受边缘化语言社区经历的伤害的有限问责机制。与提出新的技术基准不同,我们贡献了一个概念议程,将多语言 AI 治理重新框定为一个社会文化和基于权利的问题。我们概述了数据治理、透明度和参与式问责的设计和政策含义,主张文化嵌入式治理对于确保多语言语言模型在规模和中性的掩饰下不重现现有全球不平等至关重要。
引用
@article{arxiv.2602.00497,
title = {Culturally-Grounded Governance for Multilingual Language Models: Rights, Data Boundaries, and Accountable AI Design},
author = {Hanjing Shi and Dominic DiFranzo},
journal= {arXiv preprint arXiv:2602.00497},
year = {2026}
}