评估人类-LLM表示对齐:以增强与替代通信中的情感句子生成为案例研究
计算与语言
2025-11-11 v3
摘要
语言模型对概念的使用与人们的期望之间存在差距。当LLM生成文本以帮助人们通过增强与替代通信(AAC)工具进行交流时,这一差距尤为关键。在本工作中,我们引入了表示对齐的评估任务,通过人类判断来衡量这一差距。在我们的研究中,我们将关键词和情感表示扩展为完整句子。我们选择了四种情感表示:词汇和数值形式的效价-唤醒-支配度(VAD)维度,以及表情符号。除了表示对齐外,我们还衡量了人们对生成句子的准确性和真实性的判断。虽然VAD等表示将情感分解为易于计算的组成部分,但我们的发现表明,人们更同意LLM在以英文词汇(如"angry")为条件时生成的内容,而非VAD量表。这种差异在数值VAD与词汇的比较中尤为明显。此外,我们发现人们对生成句子传达情感程度的感知取决于表示类型和具体情感。
引用
@article{arxiv.2503.11881,
title = {Evaluating Human-LLM Representation Alignment: A Case Study on Affective Sentence Generation for Augmentative and Alternative Communication},
author = {Shadab Choudhury and Asha Kumar and Lara J. Martin},
journal= {arXiv preprint arXiv:2503.11881},
year = {2025}
}
备注
Published at IJCNLP-AACL 2025 Findings