中文

XF2T:面向低资源语言的跨语言事实到文本生成

计算与语言 2022-09-26 v1

摘要

多种业务场景需要从结构化输入数据自动生成描述性、人类可读的文本。因此,针对各类下游任务(如生成足球报道、天气与财经报告、医疗报告、人物传记等)已开发了事实到文本(F2T)生成系统。遗憾的是,先前 F2T 生成的工作主要聚焦于英语,主要因相关数据集的高可用性。直到最近,跨语言事实到文本(XF2T)问题才被提出用于跨多种语言生成,并伴随一个涵盖八种语言的数据集 XALIGN。然而,关于实际 XF2T 生成问题尚无严格工作。我们用四种更多语言的标注数据扩展 XALIGN 数据集:旁遮普语、马拉雅拉姆语、阿萨姆语和奥里亚语。我们利用流行的基于 Transformer 的文本生成模型在我们扩展的多语言数据集(称为 XALIGNV2)上进行广泛研究。进一步,我们考察了不同文本生成策略的性能:预训练的多种变体、事实感知嵌入和结构感知输入编码。我们广泛的实验表明,使用事实感知嵌入与结构感知输入编码的多语言 mT5 模型在十二种语言上平均取得最佳结果。我们公开了代码、数据集和模型,希望这有助于推进这一关键领域的进一步研究。

关键词

引用

@article{arxiv.2209.11252,
  title  = {XF2T: Cross-lingual Fact-to-Text Generation for Low-Resource Languages},
  author = {Shivprasad Sagare and Tushar Abhishek and Bhavyajeet Singh and Anubhav Sharma and Manish Gupta and Vasudeva Varma},
  journal= {arXiv preprint arXiv:2209.11252},
  year   = {2022}
}