中文

HTLM:超文本预训练与语言模型提示

计算与语言 2021-07-16 v1 机器学习

摘要

我们介绍 HTLM,一种在大规模网络爬取数据上训练的超文本语言模型。对超文本建模具有若干优势:(1)易于大规模收集;(2)提供丰富的文档级及与终端任务邻近的监督(例如 class 与 id 属性常编码文档类别信息);(3)允许遵循 HTML 既定语义的新结构化提示(例如,通过对包含输入文本的网页填充 title 标签来进行零样本摘要)。我们表明,以 BART 风格的去噪损失直接在简化 HTML 上预训练,可为广泛的终端任务与监督层级提供高效迁移。HTLM 在分类基准的零样本提示与微调上匹配或超越同等规模纯文本 LM 的性能,同时为零样本摘要设定了新的最先进水平。我们还发现,就数据效率而言,超文本提示对 HTLM 比纯文本提示对现有 LM 提供更大价值,且 HTLM 能通过仅为任意可用训练数据生成最可能的超文本格式而高度有效地自动提示自身。我们将发布所有代码与模型以支持未来 HTLM 研究。

关键词

引用

@article{arxiv.2107.06955,
  title  = {HTLM: Hyper-Text Pre-Training and Prompting of Language Models},
  author = {Armen Aghajanyan and Dmytro Okhonko and Mike Lewis and Mandar Joshi and Hu Xu and Gargi Ghosh and Luke Zettlemoyer},
  journal= {arXiv preprint arXiv:2107.06955},
  year   = {2021}
}