文本扩展基准:数据集、度量与基线
计算与语言
2023-09-19 v1
摘要
本工作提出一项新任务——文本扩展(TE),旨在将细粒度修饰语插入纯文本的合理位置,以使人类写作具体化或生动化。不同于现有的基于插入的写作辅助任务,TE要求模型在定位与生成上更具灵活性,并在保持基本语义上更为谨慎。我们利用四种互补方法构建了一个数据集,包含1200万自动生成实例以及面向中英文的各2K人工标注参考。为便于自动评估,我们从多视角设计了各类度量。特别地,我们提出Info-Gain以有效度量扩展的信息量,这是TE中的重要质量维度。基于预训练文本填充模型,我们构建了流水线式与联合式Locate&Infill模型,其展现出优于Text2Text基线的性能,尤其在扩展信息量方面。实验验证了TE任务的可行性,并指出了未来迈向更优自动文本扩展研究的潜在方向。
引用
@article{arxiv.2309.09198,
title = {A Benchmark for Text Expansion: Datasets, Metrics, and Baselines},
author = {Yi Chen and Haiyun Jiang and Wei Bi and Rui Wang and Longyue Wang and Shuming Shi and Ruifeng Xu},
journal= {arXiv preprint arXiv:2309.09198},
year = {2023}
}