评估大型语言模型中的跨语言语义一致性
计算与语言
2024-07-02 v1
摘要
本文探讨了大型语言模型(如 ChatGPT、Llama、Baichuan)在各种自然语言处理(NLP)任务中所表现出的跨语言不一致性。尽管这些模型在各方面取得了卓越的成绩, 但在处理不同语言中相同概念时常常表现出显著的不一致性。本研究聚焦于三个主要问题: 大型语言模型中是否存在跨语言不一致性, 这些不一致性具体表现为哪些方面, 以及跨语言一致性与大型语言模型多语言能力之间的相关性。为解决这些问题, 我们提出了一种用于跨语言语义一致性(xSC)的创新评估方法, 采用 LaBSE 模型。我们进一步引入了跨语言准确性一致性(xAC)和跨语言及时性一致性(xTC)指标, 以全面评估模型在语义、准确性和及时性方面的不一致性。通过对这些指标进行综合, 我们提供了对大型语言模型跨语言一致性的整体度量。我们的研究旨在增进对大型语言模型多语言能力和可解释性的理解, 为开发更稳健、更可靠的多语言语言模型贡献。
引用
@article{arxiv.2407.01358,
title = {Evaluating Knowledge-based Cross-lingual Inconsistency in Large Language Models},
author = {Xiaolin Xing and Zhiwei He and Haoyu Xu and Xing Wang and Rui Wang and Yu Hong},
journal= {arXiv preprint arXiv:2407.01358},
year = {2024}
}