SYNTHEMPATHY:一种无需众包的大规模同情心语料库生成方法
计算与语言
2025-02-26 v1
摘要
先前的研究表明,人类更愿意接受展现同情行为的语言模型。尽管同情心对开发有帮助的对话代理至关重要,但可供微调大型语言模型的大型包含同情对话的语料库仍稀少。已有的少数语料库主要依赖众包来模拟同情对话,这种过程昂贵、耗时且难以扩展到更大的数据集。我们提出了一个用于开发 SYNTHEMPATHY 的数据生成框架,该语料库包含 105k 条针对真实情境的同情响应,通过大语言模型生成。我们基于 SYNTHEMPATHY 语料库微调的基础 Mistral 7B 模型在平均同情评分上实现了提升。
引用
@article{arxiv.2502.17857,
title = {SYNTHEMPATHY: A Scalable Empathy Corpus Generated Using LLMs Without Any Crowdsourcing},
author = {Run Chen and Jun Shin and Julia Hirschberg},
journal= {arXiv preprint arXiv:2502.17857},
year = {2025}
}
备注
10 pages