挑战 LLM 解释穷理性文本的 Drivel-ology
计算与语言
2025-10-17 v3
摘要
我们提出 Drivelology,一种独特的语言现象,称为“具有深度的废话”——语法连贯却在语用上具有悖论性、情感负载或修辞颠覆性的表达。虽然此类表达可能类似表面层级的废话,但编码了需要语境推断、道德推理或情感解释的隐含意义。我们发现,尽管当前大型语言模型(LLM)在许多自然语言处理(NLP)任务中表现卓越,但在理解 Drivelology 文本的多层语义时始终未能胜任。为此,我们构建了一个包含 1,200 多个经精心挑选且覆盖多语言(英语、中文、西班牙语、法语、日语、韩语)的样例数据集。每个样例均经多轮专家审阅验证其 Drivelological 特征,经过讨论和裁决以解决争议。使用该数据集,我们对 LLM 在分类、生成和推理任务中进行评估。我们的结果揭示了 LLM 的明确局限性:模型常将 Drivelology 误认为浅层废话,生成不连贯的论证,或完全忽略其隐含的修辞功能。这些发现凸显了 LLM 在语用理解深度存在的深层表征差距,挑战了统计流畅性等同于认知理解的假设。我们公开数据集和代码,以便进一步研究超越表面连贯性的语言深度建模。
引用
@article{arxiv.2509.03867,
title = {Drivel-ology: Challenging LLMs with Interpreting Nonsense with Depth},
author = {Yang Wang and Chenghao Xiao and Chia-Yi Hsiao and Zi Yan Chang and Chi-Li Chen and Tyler Loakman and Chenghua Lin},
journal= {arXiv preprint arXiv:2509.03867},
year = {2025}
}
备注
Accepted for oral presentation at the EMNLP 2025 Main Conference