中文

从形式到意义:利用多义一致性探究语言模型的语义深度

计算与语言 2024-04-19 v1 人工智能

摘要

大型语言模型(LLM)的能力以惊人的速度增长,这通过一系列常用的自然语言理解(NLU)基准来衡量,这引发了许多关于“理解”对于语言模型意味着什么以及它如何与人类理解相比较的问题。这一点尤其真实,因为许多LLM仅通过文本进行训练,这让人怀疑它们出色的基准性能是否反映了对这些基准所代表问题的真正理解,或者LLM是否仅仅擅长说出与理解问题的人会说的话相关的文本形式。在这项受哲学启发的工作中,我们旨在通过一系列测试在形式和意义之间建立一些分离,这些测试利用了世界理解应在同一意义的不同呈现模式(受弗雷格含义启发)之间保持一致的想法。具体来说,我们关注跨语言以及释义之间的一致性。以GPT-3.5为研究对象,我们评估了五种不同语言和各种任务上的多义一致性。我们在受控环境中开始评估,向模型询问简单事实,然后继续在四个流行的NLU基准上进行评估。我们发现模型的多义一致性不足,并进行了几项后续分析以验证这种一致性的缺乏是由于依赖于意义的任务理解。我们得出结论,在这方面,LLM的理解仍然远非一致和类人的,并思考了这如何影响它们在了解人类语言和理解方面的效用。

关键词

引用

@article{arxiv.2404.12145,
  title  = {From Form(s) to Meaning: Probing the Semantic Depths of Language Models Using Multisense Consistency},
  author = {Xenia Ohmer and Elia Bruni and Dieuwke Hupkes},
  journal= {arXiv preprint arXiv:2404.12145},
  year   = {2024}
}