中文

TalentMine:基于LLM的多模态人才表格信息提取与问答

人工智能 2025-07-02 v1 计算机视觉与模式识别 信息检索

摘要

在人才管理系统中,关键信息通常以复杂的表格形式存在,这对传统语言模型的信息检索构成了重大挑战。在处理需要精确解读表格关系以进行准确信息检索和下游决策的人才文档时,这些挑战尤为突出。当前的表格提取方法在语义理解方面存在不足,导致在集成到检索增强的聊天应用中时性能不佳。本文识别出一个关键瓶颈——虽然可以提取表格的结构信息,但表格元素之间的语义关系会丢失,从而导致下游查询失败。为了解决这个问题,我们引入了TalentMine,一种新颖的、基于LLM增强的框架,它将提取的表格转换为语义丰富的表示。与依赖CSV或文本线性化的传统方法不同,我们的方法采用专门的多模态推理来保留表格数据的结构和语义维度。在员工福利文档集合上的实验评估表明,TalentMine具有优越的性能,在问答任务中实现了100%的准确率,而标准的AWS Textract提取为0%,AWS Textract Visual Q&A为40%。我们的比较分析还揭示,Claude v3 Haiku模型在人才管理应用中实现了最佳性能。这项工作的主要贡献包括:(1) 对当前表格提取流程中语义信息丢失的系统分析,(2) 一种新颖的、基于LLM的语义丰富表格表示方法,(3) 一个用于检索增强系统作为端到端系统的高效集成框架,以及 (4) 在人才分析任务上的全面基准测试,显示在多个类别上的显著改进。

关键词

引用

@article{arxiv.2507.00041,
  title  = {TalentMine: LLM-Based Extraction and Question-Answering from Multimodal Talent Tables},
  author = {Varun Mannam and Fang Wang and Chaochun Liu and Xin Chen},
  journal= {arXiv preprint arXiv:2507.00041},
  year   = {2025}
}

备注

Submitted to KDD conference, workshop: Talent and Management Computing (TMC 2025), https://tmcworkshop.github.io/2025/