SemEval-2025 Task 5 中的 Annif:传统 XMTC 辅以 LLM
计算与语言
2025-08-22 v2 人工智能
数字图书馆
信息检索
机器学习
摘要
本文介绍了在 SemEval-2025 Task 5(LLMs4Subjects)中的 Annif 系统,该任务聚焦于使用大型语言模型(LLM)进行主题索引。该任务要求为来自双语 TIBKAT 数据库的书目记录创建主题预测,使用 GND 主题词汇表。我们的 метод结合了在 Annif 工具包中实现的传统自然语言处理和机器学习技术,以及创新的 LLM 翻译和合成数据生成方法,以及来自单语义模型的预测合并。该系统在所有主题类别中排名第一,在 tib-core-subjects 类别中排名第二,在定性评估中排名第四。这些发现表明,将传统 XMTC 算法与现代 LLM 技术结合用于多语言语境下的主题索引,可提高准确率和效率。
引用
@article{arxiv.2504.19675,
title = {Annif at SemEval-2025 Task 5: Traditional XMTC augmented by LLMs},
author = {Osma Suominen and Juho Inkinen and Mona Lehtinen},
journal= {arXiv preprint arXiv:2504.19675},
year = {2025}
}
备注
6 pages, 4 figures, published at SemEval-2025 workshop Task 5: LLMs4Subjects: https://aclanthology.org/2025.semeval-1.315/