中文

JobResQA:面向多语言简历与职位描述的 LLM 机器阅读理解基准

计算与语言 2026-02-02 v1

摘要

我们引入 JobResQA,这是一个面向评估大语言模型(LLM)在人力资源场景下处理简历与职位描述机器阅读理解(Machine Reading Comprehension, MRC)能力的多语言问答基准。该数据集包含 581 对问答对,覆盖 105 对来自英语、西班牙语、意大利语、德语和中文的合成简历-职位描述配对,问题涵盖从基础事实抽取到复杂跨文档推理的三个难度层次。我们提出的数据生成管道源自真实场景,通过脱敏与数据合成确保真实性与隐私,同时通过占位符实现人口统计与专业属性的可控,从而支持系统性偏差与公平性研究。我们还基于 TEaR 方法提供一种成本效益高的、人类在环翻译管道,纳入 MQM 错误标注与选择性后编辑,确保高质量的多向平行基准。我们提供了跨多个开源 LLM 家族的基线评估,使用 LLM 作为判官,结果显示模型在英语和西班牙语上表现更佳,但其他语言性能显著下降,凸显了面向 HR 应用的多语言 MRC能力之间的关键差距。JobResQA 为推动公平可靠的 LLM 人力资源系统提供可复现的基准。该基准已公开:https://github.com/Avature/jobresqa-benchmark

关键词

引用

@article{arxiv.2601.23183,
  title  = {JobResQA: A Benchmark for LLM Machine Reading Comprehension on Multilingual R\'esum\'es and JDs},
  author = {Casimiro Pio Carrino and Paula Estrella and Rabih Zbib and Carlos Escolano and José A. R. Fonollosa},
  journal= {arXiv preprint arXiv:2601.23183},
  year   = {2026}
}

备注

Under review