融入版式的语言模型对版式分布偏移是否稳健?以科学文档为例的研究
计算与语言
2023-06-05 v1
摘要
近期研究表明,将版式特征融入语言模型(LMs)可改进对科学论文等富视觉文档的处理。融入版式的 LMs 常在具有熟悉版式特征(如同出版商的论文)的文档上评估,但在实际中模型会遇到具有陌生版式特征分布的文档,例如文本尺寸与样式的新组合,或文本元素的新空间配置。本工作中我们检验融入版式的 LMs 对版式分布偏移是否稳健。作为案例研究,我们采用科学文档结构恢复任务,将科学论文分割为其结构类别(如“标题”、“图注”、“参考文献”)。为模拟实际中出现的分布偏移,我们对 GROTOAP2 数据集进行重新划分。我们发现,在版式分布偏移下模型性能下降多达 20 F1。简单的训练策略(如增加训练多样性)可将此下降相对 F1 减少逾 35%;然而,在任何测试的域外条件下模型均未能达到域内性能。本工作凸显了在模型评估中考虑版式分布偏移的必要性,并给出了开展此类评估的方法论。
引用
@article{arxiv.2306.01058,
title = {Are Layout-Infused Language Models Robust to Layout Distribution Shifts? A Case Study with Scientific Documents},
author = {Catherine Chen and Zejiang Shen and Dan Klein and Gabriel Stanovsky and Doug Downey and Kyle Lo},
journal= {arXiv preprint arXiv:2306.01058},
year = {2023}
}
备注
To appear in ACL Findings 2023