中文

大型语言模型的评分方法:关于对话中衡量同理心的研究

计算与语言 2024-12-31 v1

摘要

近年来,大型语言模型(Large Language Models, LLMs)在完成复杂任务方面的能力日益增强。在许多场景中,LLMs 被用于评分,即为某一主题分配一定尺度上的数值。在本文中,我们致力于理解 LLMs 的评分机制,特别是在衡量对话中同理心方面。我们发展了一个新颖且全面的框架,用于探讨 LLMs 在衡量和评估对话同理心方面的效果,以及可以采用的哪些方法来深化我们对 LLM 评分的理解。我们的策略是用显式且可解释的特征来近似状态最佳且微调过的 LLMs 的性能。我们使用包括嵌入向量、动机访谈治疗完整性(Motivational Interviewing Treatment Integrity, MITI)编码、LLM 提出的若干显式同理心子因子,以及 MITI 编码与显式子因子的组合等多种特征来训练分类器。我们的结果表明,仅使用嵌入向量即可实现接近通用 LLMs 的性能;而当利用 MITI 编码和由 LLM 评估的显式子因子时,训练好的分类器能够与微调过的 LLMs 的性能相匹配。我们采用特征选择方法以导出同理心评分过程中最关键的特征。本工作为理解 LLM 同理心评分提供了新的视角,帮助 LLM 社区探索 LLM 评分在社会科学研究中的潜在应用。

关键词

引用

@article{arxiv.2412.20264,
  title  = {Scoring with Large Language Models: A Study on Measuring Empathy of Responses in Dialogues},
  author = {Henry J. Xie and Jinghan Zhang and Xinhao Zhang and Kunpeng Liu},
  journal= {arXiv preprint arXiv:2412.20264},
  year   = {2024}
}

备注

Accepted by IEEE BigData 2024