模拟意义,已无!引入 ICR:用于评估 LLM 文本摘要意义的半符号-阐释度度量
计算与语言
2026-03-09 v2 人工智能
摘要
人类语言中的意义是关联性的、情境依赖的,并从符号系统中产生的动态结构中体现。计算环境下,这种半符号性和阐释性复杂性 complicates了意义的生成与评估。本文提出了一个跨学科框架,通过整合符号学、阐释学与定性研究方法,来研究大语言模型(LLM)生成语言中的意义。我们审阅了关于意义与机器的先前学术文献,探讨了语言符号如何转化为静态和情境化嵌入模型中的向量化表征,识别了统计近似与人类阐释意义之间的差距。随后,我们引入归纳概念评估(ICR)指标,这是一种基于归纳内容分析和反思性主题分析的定性评估方法,旨在评估LLM输出中语义准确性和意义对齐,超越词汇相似度度量。我们在5个数据集(样本量 N 为50至800)上应用ICR,对LLM生成的主题摘要与人类生成的主题摘要进行实证比较。尽管LLM在语言相似性方面取得高分,但在语义准确性方面表现不佳,尤其是无法捕捉情境依赖性意义。随着数据集规模的增大,性能有所提升,但仍在不同模型之间保持变异,这可能反映了不同模型在概念和意义重复出现的频率和连贯性方面的差异。我们 concludes that,评估LLM生成输出时,应采用系统化的定性解释实践来评估参考文本中的意义。
引用
@article{arxiv.2603.04413,
title = {Simulating Meaning, Nevermore! Introducing ICR: A Semiotic-Hermeneutic Metric for Evaluating Meaning in LLM Text Summaries},
author = {Natalie Perez and Sreyoshi Bhaduri and Aman Chadha},
journal= {arXiv preprint arXiv:2603.04413},
year = {2026}
}