中文

SemEval-2025 Task 5 中的 Annif:传统 XMTC 辅以 LLM

计算与语言 2025-08-22 v2 人工智能 数字图书馆 信息检索 机器学习

摘要

本文介绍了在 SemEval-2025 Task 5(LLMs4Subjects)中的 Annif 系统,该任务聚焦于使用大型语言模型(LLM)进行主题索引。该任务要求为来自双语 TIBKAT 数据库的书目记录创建主题预测,使用 GND 主题词汇表。我们的 метод结合了在 Annif 工具包中实现的传统自然语言处理和机器学习技术,以及创新的 LLM 翻译和合成数据生成方法,以及来自单语义模型的预测合并。该系统在所有主题类别中排名第一,在 tib-core-subjects 类别中排名第二,在定性评估中排名第四。这些发现表明,将传统 XMTC 算法与现代 LLM 技术结合用于多语言语境下的主题索引,可提高准确率和效率。

关键词

引用

@article{arxiv.2504.19675,
  title  = {Annif at SemEval-2025 Task 5: Traditional XMTC augmented by LLMs},
  author = {Osma Suominen and Juho Inkinen and Mona Lehtinen},
  journal= {arXiv preprint arXiv:2504.19675},
  year   = {2025}
}

备注

6 pages, 4 figures, published at SemEval-2025 workshop Task 5: LLMs4Subjects: https://aclanthology.org/2025.semeval-1.315/