极端多标签文本分类(XMTC)图书馆数据集:若干人工智能方法在数字图书馆中的实际应用
计算与语言
2026-03-12 v1 人工智能
数字图书馆
信息检索
摘要
主题索引对于发现至关重要,但在规模化和跨语言环境中难以维持。我们发布了一个大型双语(英语/德语)语料库,其中包含使用 Integrated Authority File(GND)标注的目录记录,另外附带可机器操作的 GND 分类学。该资源支持本体感知多标签分类、将文本映射到权威术语以及代理辅助目录编目,并提供可复现、权威导向的评估。我们提供简要的统计概述和三个系统的定性误差分析。我们邀请社区不仅评估准确性,还评估实用性和可解释性,以实现权威锚定的 AI 协作助理,从而放大目录编者的工作。
引用
@article{arxiv.2603.10876,
title = {An Extreme Multi-label Text Classification (XMTC) Library Dataset: What if we took "Use of Practical AI in Digital Libraries" seriously?},
author = {Jennifer D'Souza and Sameer Sadruddin and Maximilian Kähler and Andrea Salfinger and Luca Zaccagna and Francesca Incitti and Lauro Snidaro and Osma Suominen},
journal= {arXiv preprint arXiv:2603.10876},
year = {2026}
}
备注
9 pages, 5 figures. Accepted to appear in the Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026)