中文

挑战 LLM 解释穷理性文本的 Drivel-ology

计算与语言 2025-10-17 v3

摘要

我们提出 Drivelology,一种独特的语言现象,称为“具有深度的废话”——语法连贯却在语用上具有悖论性、情感负载或修辞颠覆性的表达。虽然此类表达可能类似表面层级的废话,但编码了需要语境推断、道德推理或情感解释的隐含意义。我们发现,尽管当前大型语言模型(LLM)在许多自然语言处理(NLP)任务中表现卓越,但在理解 Drivelology 文本的多层语义时始终未能胜任。为此,我们构建了一个包含 1,200 多个经精心挑选且覆盖多语言(英语、中文、西班牙语、法语、日语、韩语)的样例数据集。每个样例均经多轮专家审阅验证其 Drivelological 特征,经过讨论和裁决以解决争议。使用该数据集,我们对 LLM 在分类、生成和推理任务中进行评估。我们的结果揭示了 LLM 的明确局限性:模型常将 Drivelology 误认为浅层废话,生成不连贯的论证,或完全忽略其隐含的修辞功能。这些发现凸显了 LLM 在语用理解深度存在的深层表征差距,挑战了统计流畅性等同于认知理解的假设。我们公开数据集和代码,以便进一步研究超越表面连贯性的语言深度建模。

关键词

引用

@article{arxiv.2509.03867,
  title  = {Drivel-ology: Challenging LLMs with Interpreting Nonsense with Depth},
  author = {Yang Wang and Chenghao Xiao and Chia-Yi Hsiao and Zi Yan Chang and Chi-Li Chen and Tyler Loakman and Chenghua Lin},
  journal= {arXiv preprint arXiv:2509.03867},
  year   = {2025}
}

备注

Accepted for oral presentation at the EMNLP 2025 Main Conference