当意义并非字面:跨语言和模态探索习语意义
计算与语言
2026-04-14 v1
摘要
习语推理与隐喻和文化紧密交织,仍然是当代语言模型的盲点,后者的进展偏向于表面的词汇和语义线索。例如,孟加拉语习语\textit{\foreignlanguage{bengali}{\char"0986\char"0999\char"09CD\char"0997\char"09C1 \char"09B0 \char"09AB\char"09B2 \char"099F\char"0995}}(angur fol tok,“葡萄是酸的”):它编码了由否认驱动的合理化,但幼稚的模型却执着于字面的狐狸和葡萄意象。为解决这一疏忽,我们提出了“Mediom”,一个包含3,533个印地语、孟加拉语和泰语习语的多语言、多模态习语语料库,每个习语都配有黄金标准解释、跨语言翻译和精心对齐的文本-图像表示。我们在Mediom上对大型语言模型(文本推理)和视觉-语言模型(比喻消歧)进行了基准测试,揭示了隐喻理解中的系统性失败。为弥补这些差距,我们提出了“HIDE”,一个基于提示的习语解释框架,该框架利用错误反馈检索和有针对性的诊断线索进行迭代推理优化。总的来说,Mediom和HIDE为下一代AI系统中嵌入推理提示的、基于文化的多模态习语理解建立了一个严格的测试平台和方法论。
引用
@article{arxiv.2604.10787,
title = {When Meaning Isn't Literal: Exploring Idiomatic Meaning Across Languages and Modalities},
author = {Sarmistha Das and Shreyas Guha and Suvrayan Bandyopadhyay and Salisa Phosit and Kitsuchart Pasupa and Sriparna Saha},
journal= {arXiv preprint arXiv:2604.10787},
year = {2026}
}