MultiSChuBERT:面向学术文档质量预测的有效多模态融合
计算与语言
2023-08-17 v1 机器学习
摘要
学术文档质量的自动评估是一项具有高潜在影响的困难任务。多模态,特别是除文本外加入视觉信息,已被证明可提升学术文档质量预测(SDQP)任务的性能。我们提出了多模态预测模型MultiSChuBERT。它将基于分块全文文本并聚合所计算的BERT分块编码(SChuBERT)的文本模型,与基于Inception V3的视觉模型相结合。我们的工作在SDQP的当前最优水平方面以三种方式做出贡献。首先,我们表明结合视觉与文本嵌入的方法会实质影响结果。其次,我们证明视觉子模型权重的渐进解冻可降低其过拟合数据的倾向,改善结果。第三,我们展示了在用更近期的最优文本嵌入模型替代标准BERT嵌入时多模态保留的益处。使用BERT嵌入,在ACL-BiblioMetry数据集的(对数)引用数预测任务上,我们的MultiSChuBERT(文本+视觉)模型获得0.454的分数,而SChuBERT(仅文本)模型为0.432。在PeerRead接收/拒稿预测任务上获得了类似改进。在我们使用SciBERT、scincl、SPECTER和SPECTER2.0嵌入的实验中,我们表明这些专用嵌入各自相较标准BERT嵌入带来进一步改进,其中SPECTER2.0嵌入表现最佳。
引用
@article{arxiv.2308.07971,
title = {MultiSChuBERT: Effective Multimodal Fusion for Scholarly Document Quality Prediction},
author = {Gideon Maillette de Buy Wenniger and Thomas van Dongen and Lambert Schomaker},
journal= {arXiv preprint arXiv:2308.07971},
year = {2023}
}