多语言能力下 LLM 道德回应测量
计算与语言
2025-10-13 v1 人工智能
摘要
随着 LLM 的使用在各国、各语言和人类社会中日益普及,理解和规范其多语言回应的需求也在增加。大规模数据集已被创建用于在多个维度上测试和基准评估 LLM 回应。在本研究中,我们评估了前沿模型和主流开源模型在五个维度上对低资源语言和高资源语言的回应,以测量 LLM 在多语言语境下的准确性和一致性。我们使用五分制评分标准和裁判 LLM 进行评估。研究结果显示 GPT-5 在每个类别上的平均表现最佳,而其他模型在语言和类别之间表现出更多不一致性。尤其值得注意的是,在 Consent & Autonomy 和 Harm Prevention & Safety 类别中,GPT 的平均得分最高,分别为 3.56 和 4.73,而 Gemini 2.5 Pro 的平均得分最低,分别为 1.39 和 1.98。这些发现强调了进一步测试语言变化如何影响 LLM 在各分类中回应的必要性,以及在这些领域进行改进的需求。
引用
@article{arxiv.2510.08776,
title = {Measuring Moral LLM Responses in Multilingual Capacities},
author = {Kimaya Basu and Savi Kolari and Allison Yu},
journal= {arXiv preprint arXiv:2510.08776},
year = {2025}
}
备注
10 pages, 5 figures; referenced articles: arXiv:2303.08774, arXiv:2303.12528, arXiv:2308.14132, arXiv:2505.12201, arXiv:2406.04428, arXiv:2407.02273, arXiv:2404.01268, arXiv:2502.09747, arXiv:2507.13474, arXiv:2505.21479, arXiv:2306.05685