中文

泰語Winograd測試方案: 泰語常識推理基準

计算与语言 2024-12-17 v2

摘要

常識推理是自然語言理解的重要方面,已發展出多個基準來評估其。然而,只有少數基準可用於英語以外的語言。發展平行基準有助於跨語言評估,有助於更好地理解不同語言。本研究引入了一套泰語Winograd測試方案,這是一個設計來評估泰語語境下常識推理能力的新數據集。通過本地語言使用者、專業翻譯者以及徹底驗證的方法,此類似設計旨在緊密反映泰語語言細微差異、成語和文化參考,同時保持歧義和常識挑戰。我們評估了流行的大型語言模型在此基準上的表現,揭示了其優勢、限制,並提供對當前最先進水平的洞察。結果顯示,雖然像GPT-4和Claude-3-Opus這樣的模型在英語中達到高準確率,但在泰語中的表現顯著下降,這凸顯了在多語言常識推理方面仍需進一步進步的必要性。

关键词

引用

@article{arxiv.2405.18375,
  title  = {Thai Winograd Schemas: A Benchmark for Thai Commonsense Reasoning},
  author = {Phakphum Artkaew},
  journal= {arXiv preprint arXiv:2405.18375},
  year   = {2024}
}

备注

Accepted to SEALP 2025 Workshop