中文

LLM在人力资源领域的单 vs 双提示对话生成

计算与语言 2025-09-19 v2

摘要

优化语言模型用于对话代理的性能需要大量示例对话。特别是在获取真实人类数据具有挑战性的领域,越来越多地使用强大的大型语言模型(LLM)合成生成这些对话。其中一个这样的领域是人力资源(HR)。在此背景下,我们比较了两种LLM-based对话生成方法,用于生产HR职业面试,评估哪种方法生成的对话质量更高,即更难以区分于真正的人类语言。第一种方法使用单个提示生成完整的面试对话。第二种方法使用两个与彼此对话的代理。为了评估两种方法下的对话质量,我们要求一个评判LLM确定AI是否用于面试生成,使用成对的面试进行比较。我们经验性地发现,尽管采用双提示方法的token数增加了六倍,但使用双提示方法生成的面试得分率是单提示方法生成的面试得分率的2到10倍。这种差异在无论是使用GPT-4o还是Llama 3.3 70B进行面试生成或质量评判时都保持一致。

关键词

引用

@article{arxiv.2502.18650,
  title  = {Single- vs. Dual-Prompt Dialogue Generation with LLMs for Job Interviews in Human Resources},
  author = {Joachim De Baer and A. Seza Doğruöz and Thomas Demeester and Chris Develder},
  journal= {arXiv preprint arXiv:2502.18650},
  year   = {2025}
}

备注

12 pages. Accepted to the Fourth Workshop on Generation, Evaluation and Metrics (GEM^2) at ACL 2025. ACL Anthology version available at https://aclanthology.org/2025.gem-1.74