关于 LLMs 自我评估的谶语统计分析
计算与语言
2024-10-23 v1
摘要
大型语言模型(LLM)如 ChatGPT、GPT-4、Claude-3 和 Llama 正在跨越多个行业。尽管迅速的普及带来了诸多应用,但专家们因其关联的伦理问题而对其解释和采纳持谨慎态度。研究也揭示了 LLM 在推理和逻辑能力方面的不足,使人们对其作为评估工具的潜力提出疑问。本文我们调查 LLM 在新颖的谶语推理任务上的自我评估能力。我们引入一个包含 300 对在意图相似但措辞不同的谶语对的数据库,涵盖性别、智慧和社会等主题。我们提出测试方法以评估相似谶语在文本一致性和数值一致性方面的表现,并展示了我们方法和数据集在识别 LLM 自我评估失败方面的有效性,这进而可指示与性别刻板印象和文化理解不足有关的 LLM 问题。
引用
@article{arxiv.2410.16640,
title = {A Statistical Analysis of LLMs' Self-Evaluation Using Proverbs},
author = {Ryosuke Sonoda and Ramya Srinivasan},
journal= {arXiv preprint arXiv:2410.16640},
year = {2024}
}