利用PubMed用户查询日志为相似文章推荐提供事后解释
信息检索
2024-02-07 v1 计算与语言
摘要
基于一篇参考文章搜索相关文章是科学研究不可或缺的一部分。PubMed与许多学术搜索引擎一样,具有“相似文章”功能,可向用户推荐与当前浏览文章相关的文章。解释推荐项目对用户非常有用,尤其是在文献检索过程中。每年有超过一百万篇生物医学论文发表,解释推荐的相似文章将有助于研究人员和临床医生查找相关文章。然而,当前大多数文献推荐系统缺乏对其建议的解释。我们采用一种事后方法,通过识别相似文章标题中的相关词元来解释推荐。我们的主要贡献是通过重新利用PubMed用户查询日志中的560万对共点击文章,构建了PubCLogs数据集。利用我们的PubCLogs数据集,我们训练了高亮相似文章标题模型(Highlight Similar Article Title,HSAT),这是一个基于Transformer的模型,旨在根据种子文章的标题和摘要,从相似文章的标题中选择最相关的部分。HSAT在我们的实证评估中表现出色,在PubCLogs测试集上取得了91.72%的F1分数,显著优于包括BM25(70.62)、MPNet(67.11)、MedCPT(62.22)、GPT-3.5(46.00)和GPT-4(64.89)在内的多个基线模型。在一个独立的、人工标注的测试集上的额外评估进一步验证了HSAT的性能。此外,我们用户研究的参与者表示更偏好HSAT,因为它在简洁性和全面性之间取得了优越的平衡。我们的研究表明,重新利用学术搜索引擎的用户查询日志是训练用于解释文献推荐的最先进模型的一种有前景的方法。
引用
@article{arxiv.2402.03484,
title = {Harnessing PubMed User Query Logs for Post Hoc Explanations of Recommended Similar Articles},
author = {Ashley Shin and Qiao Jin and James Anibal and Zhiyong Lu},
journal= {arXiv preprint arXiv:2402.03484},
year = {2024}
}