多语言成语与比喻在大型语言模型中的比较研究
计算与语言
2025-03-11 v2
摘要
本研究针对大型语言模型在跨多语言环境中解释不同类型拟人化语言表现的差异,填补了该领域文献中的空白。通过对两种多语言数据集进行评估(分别针对比喻与成语解释),我们探讨了各种提示工程策略(包括链式思考、few-shot学习以及英语翻译提示)的有效性。我们通过构建两个新的评估集,将这些数据集扩展至波斯语。本研究的全面评估涉及闭源模型(GPT-3.5、GPT-4o mini、Gemini 1.5)和开源模型(Llama 3.1、Qwen2),揭示了不同语言和拟人类型之间性能的显著差异。我们的发现表明,提示工程方法通常是有效的,但其成功率因拟人类型、语言和模型而异。我们还观察到,开源模型在比喻中的低资源语言方面尤为困难。此外,成语解释的表现正趋于饱和, necessitating 更具挑战性的评估。
引用
@article{arxiv.2410.16461,
title = {Comparative Study of Multilingual Idioms and Similes in Large Language Models},
author = {Paria Khoshtab and Danial Namazifard and Mostafa Masoudi and Ali Akhgary and Samin Mahdizadeh Sani and Yadollah Yaghoobzadeh},
journal= {arXiv preprint arXiv:2410.16461},
year = {2025}
}
备注
22 pages, 4 figures