大型语言模型生成的标签帮助测量人们体内的同理心
计算与语言
2026-03-17 v2 机器学习
摘要
大型语言模型 (LLMs) 在诸多领域取得了革命性进展,LLM-as-a-service (LLMSaaS) 提供了无需昂贵任务特定训练的可访问、通用解决方案。与广泛研究的提示工程用于直接解决任务 (in vivo) 不同,本文探索了 LLMs 在体内应用中的潜力:使用 LLM 生成的标签来改进监督训练主流模型。在体验计算 (empathy computing) 中,后者是一种从输入(如文本叙述)预测基于心理学的问卷结果的新兴任务。该领域的众所周知数据集常常存在标签噪声,无法准确代表底层同理心。我们表明,用基于心理学尺度的提示开发的 LLM 生成标签取代或补充这些众所周知的标签,可实现统计显著的准确率提升。值得注意的是,使用降低噪声的标签训练的 RoBERTa 预训练语言模型 (PLM) 在公开的 NewsEmp 数据集上实现了 0.648 的最高 Pearson 相关系数。这项工作进一步分析了评估指标选择和人口统计学偏见,以帮助指导未来更公平的体验计算模型的开发。代码和 LLM 生成的标签可在 https://github.com/hasan-rakibul/LLMPathy 上获得。
引用
@article{arxiv.2501.00691,
title = {Labels Generated by Large Language Models Help Measure People's Empathy in Vitro},
author = {Md Rakibul Hasan and Yue Yao and Md Zakir Hossain and Aneesh Krishna and Imre Rudas and Shafin Rahman and Tom Gedeon},
journal= {arXiv preprint arXiv:2501.00691},
year = {2026}
}
备注
This work has been submitted to the IEEE for possible publication