简化即绝对化:简化语言如何降低 LLM 生成定义中的词义感知
计算与语言
2025-07-17 v1
摘要
大语言模型(LLM)能够为任何语境提供准确的词语定义和解释。然而,针对不同目标群体(如儿童或语言学习者),定义的范围会发生变化。这对于同音异义词(具有多个含义的词)尤为关键,过度简化可能会因省略关键词义而导致信息丢失,从而可能误导信任 LLM 输出的用户。我们研究了简化如何影响 Normal、Simple 和 ELI5 三个目标群体的同音异义词定义质量。使用跨越多种语言的两个新颖评估数据集,我们通过 LLM-as-Judge 和人工标注测试了 DeepSeek v3、Llama 4 Maverick、Qwen3-30B A3B、GPT-4o mini 和 Llama 3.1 8B。结果表明,简化因忽视多义性而大幅降低了定义的完整性,增加了误解的风险。使用直接偏好优化微调 Llama 3.1 8B 在所有提示类型中显著提升了同音异义词的回复质量。这些发现凸显了在教育自然语言处理中平衡简洁性与完整性的必要性,以确保为所有学习者提供可靠且具备上下文感知能力的定义。
引用
@article{arxiv.2507.11981,
title = {Simplifications are Absolutists: How Simplified Language Reduces Word Sense Awareness in LLM-Generated Definitions},
author = {Lukas Ellinger and Miriam Anschütz and Georg Groh},
journal= {arXiv preprint arXiv:2507.11981},
year = {2025}
}
备注
Accepted by RANLP 2025