中文

HR-MultiWOZ:用于 HR 大语言模型代理的任务导向对话数据集

计算与语言 2024-02-05 v1 人工智能

摘要

最近的大语言模型(LLM)在多个领域的自然语言处理(NLP)任务中取得了显著进展。其在人力资源(HR)领域的应用仍有潜在的扩展空间,对于解决多项耗时的任务具有重要价值。例如,时间-off 提交、医疗索赔办理以及访问请求等案例值得关注,但它们绝非唯一的实例。然而,这些进展必须面对构建高质量训练数据集的核心挑战。一方面,大多数对话数据集是为解决客户问题而设计的,而非针对员工;另一方面,收集涉及 HR 的对话可能引发隐私问题。为此,我们引入 HR-Multiwoz,这是一个涵盖 10 个 HR 领域的 550 组 fully-labeled 对话数据集,用于评估 LLM 代理。我们的工作包含以下贡献:(1)这是第一个面向 NLP 研究在 HR 领域的开放源码标注对话数据集;(2)我们提供了详细的数据生成流程、数据分析以及人类评估的配方。数据生成管道是可迁移的,可轻松适用于其他领域的标注对话数据生成;(3)我们提出的数据收集管道主要基于 LLM,标注人工参与minimal,因而在时间和成本效率方面具有优势。

关键词

引用

@article{arxiv.2402.01018,
  title  = {HR-MultiWOZ: A Task Oriented Dialogue (TOD) Dataset for HR LLM Agent},
  author = {Weijie Xu and Zicheng Huang and Wenxiang Hu and Xi Fang and Rajesh Kumar Cherukuri and Naumaan Nayyar and Lorenzo Malandri and Srinivasan H. Sengamedu},
  journal= {arXiv preprint arXiv:2402.01018},
  year   = {2024}
}

备注

13 pages, 9 figures