“你是一位专家级语言标注者”:LLM作为抽象意义表示分析器的局限
计算与语言
2023-12-12 v2 人工智能
摘要
大语言模型(LLM)在语言使用上展现出惊人的熟练度与流畅性。这是否意味着它们也已习得关于该语言的深刻语言学知识,以至于可充当“专家级语言标注者”?本文中,我们考察GPT-3、ChatGPT与GPT-4模型在句子意义结构分析中的成功与局限,聚焦于抽象意义表示(Abstract Meaning Representation, AMR; Banarescu等 2013)解析形式体系——其在脱离表层形式的同时提供句子意义结构的丰富图表示。我们在两种设定下比较模型对该语义结构的分析:1) 基于零样本与少样本提示直接生成AMR解析;2) 通过元语言自然语言查询(如“识别本句的主要事件及对应于该事件的谓词”)间接部分重建AMR。在这些设定中,我们发现模型能可靠复现AMR的基本格式,并常能捕捉核心事件、论元与修饰语结构——然而,模型输出易频繁出现重大错误,且对解析可接受性的整体分析表明,即便有少样本示范,模型生成完全准确解析的成功率几乎为0%。引发自然语言响应产生相似的错误模式。总体而言,我们的发现表明这些模型开箱即用可捕捉语义结构的若干方面,但其在支持完全准确的语义分析或解析方面仍存在关键局限。
引用
@article{arxiv.2310.17793,
title = {"You Are An Expert Linguistic Annotator": Limits of LLMs as Analyzers of Abstract Meaning Representation},
author = {Allyson Ettinger and Jena D. Hwang and Valentina Pyatkin and Chandra Bhagavatula and Yejin Choi},
journal= {arXiv preprint arXiv:2310.17793},
year = {2023}
}
备注
EMNLP 2023 Findings (short)