大型语言模型是否理解词义?
量子物理
2025-09-18 v1 材料科学
摘要
理解词语在上下文中的意义是大型语言模型(LLM)的基本能力。尽管已有大量评估工作,但LLMs是否表现出真正把握词义的证据仍不为人所了解。本文通过评估i)指令调优LLMs的词义消歧(WSD)能力,比较其性能与专为该任务设计的前沿系统,并ii)两款顶尖开源和闭源LLMs在三个生成性场景中的词义理解能力:定义生成、自由形式解释和示例生成。值得注意的是,在WSD任务中,领先模型如GPT-4o和DeepSeek-V3的性能与专门的WSD系统持平,同时在领域和难度水平方面表现出更好的鲁棒性。在生成任务中,结果显示LLMs在上下文中解释词语意义的准确率可达98%,在自由形式解释任务中表现最佳,这一任务最符合其生成式能力。
引用
@article{arxiv.2509.13904,
title = {Coherent Driving of a Quantum System with Modulated Free-Space Electrons},
author = {Matthias Kolb and Thomas Spielauer and Thomas Weigner and Giovanni Boero and Dennis Rätzel and Philipp Haslinger},
journal= {arXiv preprint arXiv:2509.13904},
year = {2025}
}
备注
18 pages, 13 figures