中文

元数据或可使语言模型更优

计算与语言 2022-11-21 v1 数字图书馆

摘要

本文讨论了在历史语料上训练语言模型时加入元数据的益处。以19世纪报纸为案例,我们扩展了 Rosin 等人(2022)提出的时间掩码方法,并比较了将时间、政治和地理信息插入掩码语言模型的不同策略。在增强输入数据上微调若干 DistilBERT 后,我们在一组评估任务上对这些模型进行了系统评估:伪困惑度、元数据掩码填充和监督分类。我们发现向语言模型展示相关元数据具有有益影响,甚至可能产生更鲁棒和更公平的模型。

关键词

引用

@article{arxiv.2211.10086,
  title  = {Metadata Might Make Language Models Better},
  author = {Kaspar Beelen and Daniel van Strien},
  journal= {arXiv preprint arXiv:2211.10086},
  year   = {2022}
}