大型语言模型能否理解常见词的不常见含义?
计算与语言
2024-05-10 v1 人工智能
摘要
诸如 ChatGPT 的大型语言模型(LLM)在包括智能对话和自主智能体在内的各种自然语言理解(NLU)任务中展现出显著进步。然而,由于缺乏广泛认可的测试机制,回答“LLM 是随机鹦鹉还是真正理解世界”仍不明确,这促发了大量研究并引发激烈争论。现有研究主要关注表层 NLU,忽略了细粒度的探索。然而,此类探索对于理解其独特的理解机制、与人类认知对齐以及最终提升 LLM 的通用 NLU 能力至关重要。为填补这一空白,我们的研究深入探讨了 LLM 的细微语义理解能力,特别是关于具有不常见含义的常见词。该想法源于心理学中人类沟通的基础原则,强调对词汇语义的准确共识。具体而言,本文提出了创新构建的词汇语义理解数据集及新颖的评估指标,这是首个涵盖细粒度与跨语言维度的基准。通过引入开源与闭源、不同规模和架构的模型,我们广泛的实证实验表明,现有模型在此基础词汇含义理解任务中表现不佳。值得注意的是,即使是 SOTA 的 LLM GPT-4 和 GPT-3.5,也分别比 16 岁人类落后 3.9% 和 22.3%。此外,还引入了多种高级提示技术与检索增强生成来帮助缓解这一问题,但局限性依然存在。通过强调上述关键缺陷,本研究推动了进一步探索,并为开发更智能的 LLM 提供了新见解。
引用
@article{arxiv.2405.05741,
title = {Can large language models understand uncommon meanings of common words?},
author = {Jinyang Wu and Feihu Che and Xinxin Zheng and Shuai Zhang and Ruihan Jin and Shuai Nie and Pengpeng Shao and Jianhua Tao},
journal= {arXiv preprint arXiv:2405.05741},
year = {2024}
}