通智能招聘:零样本和少样本预训练大语言模型是否准备好用于 HR 口语面试记录分析?
计算与语言
2025-04-09 v1 人工智能
摘要
本研究论文对了对数前沿预训练大语言模型(LLM),包括 GPT-4 Turbo、GPT-3.5 Turbo、text-davinci-003、text-babbage-001、text-curie-001、text-ada-001、llama-2-7b-chat、llama-2-13b-chat 和 llama-2-70b-chat,在为提供分数、识别错误以及为候选人在模拟 HR(人力资源)面试中提供反馈和改进建议方面与专家人类评估员的表现进行全面分析。我们引入了一个称为 HURIT(Human Resource Interview Transcripts)的数据集,其中包含 3,890 份来自真实世界 HR 面试情景的面试记录。我们的发现表明,预训练 LLM,特别是 GPT-4 Turbo 和 GPT-3.5 Turbo,表现出色,能够产生与专家人类评估员相当的评估。尽管这些 LLM 在人类评估指标方面能够提供与人类专家相当的分数,但它们经常无法识别错误,也无法为候选人绩效改进提供具体可操作的建议。我们的研究表明,当前最先进的预训练 LLM 尚不完全适用于 HR 面试评估的自动部署。相反,我们的发现主张采用人类在环方法,以纠正不一致性和提供改进反馈质量的机会,作为更合适的策略。
引用
@article{arxiv.2504.05683,
title = {Towards Smarter Hiring: Are Zero-Shot and Few-Shot Pre-trained LLMs Ready for HR Spoken Interview Transcript Analysis?},
author = {Subhankar Maity and Aniket Deroy and Sudeshna Sarkar},
journal= {arXiv preprint arXiv:2504.05683},
year = {2025}
}
备注
32 pages, 24 figures