中文

Synth-Empathy:面向高质量合成同情数据

计算与语言 2024-08-13 v2 机器学习

摘要

近年来,随着大语言模型 (LLM) 的快速发展,实现优异的同情响应能力已成为关键前提。因此,管理和理解同情数据集日益重要。然而,同情数据通常由人工标注,导致数据集不足且浪费人力。在本工作中,我们提出 Synth-Empathy,一个基于 LLM 的数据生成与质量和多样性筛选管道,能够自动生成高质量的同情数据并筛选低质量数据。通过来自低同情模型生成的数据,我们能够进一步提高同情响应性能,在多个基准测试中实现最先进 (SOTA) 结果。此外,我们的模型在 various 人类评估基准测试中实现 SOTA 性能,展示了其在实际应用中的有效性和鲁棒性。进一步地,我们展示了数据数量与质量之间的权衡,为同情数据生成与筛选提供了见解。

关键词

引用

@article{arxiv.2407.21669,
  title  = {Synth-Empathy: Towards High-Quality Synthetic Empathy Data},
  author = {Hao Liang and Linzhuang Sun and Jingxuan Wei and Xijie Huang and Linkun Sun and Bihui Yu and Conghui He and Wentao Zhang},
  journal= {arXiv preprint arXiv:2407.21669},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2407.01937