中文

MultiSChuBERT:面向学术文档质量预测的有效多模态融合

计算与语言 2023-08-17 v1 机器学习

摘要

学术文档质量的自动评估是一项具有高潜在影响的困难任务。多模态,特别是除文本外加入视觉信息,已被证明可提升学术文档质量预测(SDQP)任务的性能。我们提出了多模态预测模型MultiSChuBERT。它将基于分块全文文本并聚合所计算的BERT分块编码(SChuBERT)的文本模型,与基于Inception V3的视觉模型相结合。我们的工作在SDQP的当前最优水平方面以三种方式做出贡献。首先,我们表明结合视觉与文本嵌入的方法会实质影响结果。其次,我们证明视觉子模型权重的渐进解冻可降低其过拟合数据的倾向,改善结果。第三,我们展示了在用更近期的最优文本嵌入模型替代标准BERTBASE_{\textrm{BASE}}嵌入时多模态保留的益处。使用BERTBASE_{\textrm{BASE}}嵌入,在ACL-BiblioMetry数据集的(对数)引用数预测任务上,我们的MultiSChuBERT(文本+视觉)模型获得0.454的R2R^{2}分数,而SChuBERT(仅文本)模型为0.432。在PeerRead接收/拒稿预测任务上获得了类似改进。在我们使用SciBERT、scincl、SPECTER和SPECTER2.0嵌入的实验中,我们表明这些专用嵌入各自相较标准BERTBASE_{\textrm{BASE}}嵌入带来进一步改进,其中SPECTER2.0嵌入表现最佳。

关键词

引用

@article{arxiv.2308.07971,
  title  = {MultiSChuBERT: Effective Multimodal Fusion for Scholarly Document Quality Prediction},
  author = {Gideon Maillette de Buy Wenniger and Thomas van Dongen and Lambert Schomaker},
  journal= {arXiv preprint arXiv:2308.07971},
  year   = {2023}
}