基于LLM的跨类型作品归属 Attribution 检索-重排序
计算与语言
2025-10-21 v1
摘要
作品归属 Attribution(AA)是从预定义的候选作者集合中识别查询文档最可能作者的任务。我们引入了一个两阶段检索-重排序框架,用于跨类型AA的LLM微调。与信息检索(IR)领域不同,跨类型AA系统必须避免依赖主题线索,而应学习识别独立于文本主题(类型/领域/主题)的作者特定语言模式。因此,我们表明,IR中常用的训练策略在跨类型AA中本质上是误配的,导致次优行为。为此,我们引入了针对性的数据精选策略,使重排序器能够有效学习作者判别性信号。通过我们的LLM基于检索-重排序管道,我们在HIATUS具有挑战性的HRS1和HRS2跨类型AA基准上实现了22.3和34.4个绝对Success@8分数的显著提升。
引用
@article{arxiv.2510.16819,
title = {Cross-Genre Authorship Attribution via LLM-Based Retrieve-and-Rerank},
author = {Shantanu Agarwal and Joel Barry and Steven Fincke and Scott Miller},
journal= {arXiv preprint arXiv:2510.16819},
year = {2025}
}