中文

Talk2Ref:面向科学讲座的参考预测数据集

计算与语言 2025-10-29 v1

摘要

科学讲座正成为 disseminate 研究的日益流行的媒介,自动识别为讲座提供相关文献以 grounding 或丰富讲座内容对研究人员和学生而言将极其有价值。我们引入参考预测从讲座(RPT),一个新任务,将长且非结构化的科学演示映射到相关论文。为支持RPT的研究,我们present Talk2Ref,首个大规模数据集,包含6,279个讲座和43,429篇被引论文(平均每场讲座约26篇),其中相关性由讲座对应源出版物中引用的论文所近似表示。我们通过评估零-shot 检索场景中的最新文本嵌入模型,建立了强有力的基线,并提出一个双编码器架构在Talk2Ref上进行训练。我们进一步探讨了处理长转录本的策略,以及领域适应的训练方法。我们的结果表明,在Talk2Ref上进行微调显著提高了引用预测性能,既展示了该任务的挑战,也证明了该数据集对学习来自口头科学内容的语义表示具有有效性。该数据集和训练好的模型以开放许可证发布,以促进将口头科学交流集成到引用推荐系统中的未来研究。

关键词

引用

@article{arxiv.2510.24478,
  title  = {Talk2Ref: A Dataset for Reference Prediction from Scientific Talks},
  author = {Frederik Broy and Maike Züfle and Jan Niehues},
  journal= {arXiv preprint arXiv:2510.24478},
  year   = {2025}
}