KatotohananQA:评估大型语言模型在菲律宾语中的真实性
计算与语言
2025-09-09 v1
摘要
大型语言模型(LLM)在各种任务中取得了显著性能,但其产生幻觉的倾向限制了其可靠采用。诸如TruthfulQA之类的基准测试已被开发用于衡量真实性,但它们主要提供英文版本,在评估低资源语言中的LLM方面留下了空白。为了解决这个问题,我们提出了KatotohananQA,即TruthfulQA基准测试的菲律宾语翻译版本。使用二元选择框架评估了七个免费专有模型。研究结果显示,英语和菲律宾语真实性之间存在显著性能差距,较新的OpenAI模型(GPT-5和GPT-5 mini)表现出强大的多语言鲁棒性。结果还揭示了不同问题特征之间的差异,表明某些问题类型、类别和主题对多语言迁移的鲁棒性较差,这凸显了进行更广泛多语言评估以确保LLM使用的公平性和可靠性的必要性。
引用
@article{arxiv.2509.06065,
title = {KatotohananQA: Evaluating Truthfulness of Large Language Models in Filipino},
author = {Lorenzo Alfred Nery and Ronald Dawson Catignas and Thomas James Tiam-Lee},
journal= {arXiv preprint arXiv:2509.06065},
year = {2025}
}
备注
14 pages, 1 figure, 9 tables, 1 listing. To appear in Proceedings of NLPIR 2025