中文

数据稀疏约束下带人在回路的医学科学表格到文本生成

计算与语言 2022-07-15 v2

摘要

临床前与临床领域的结构化(表格)数据包含关于个体的有价值信息,高效的表格到文本摘要系统可大幅减少将这些数据浓缩为报告的人工工作量。然而在实践中,该问题严重受制于数据匮乏、数据稀疏,以及最先进的自然语言生成模型(包括 T5、PEGASUS 和 GPT-Neo)无法产生准确可靠的输出。本文中,我们提出一种新颖的表格到文本方法,并以一种新颖的两步架构应对这些问题,该架构通过自动校正、拷贝机制和合成数据增强得到增强。研究表明,所提方法以改进的精度(拷贝表格数值的绝对提升高达 0.13)从结构化数据中选择显著的生物医学实体与数值,从而为分析验证报告和毒理学报告生成连贯且准确的文本。此外,我们还展示通过对少至 40% 训练样本进行微调,所提系统可向新数据集的轻量适配。我们模型的输出在人在回路场景中得到人类专家验证。

关键词

引用

@article{arxiv.2205.12368,
  title  = {Medical Scientific Table-to-Text Generation with Human-in-the-Loop under the Data Sparsity Constraint},
  author = {Heng-Yi Wu and Jingqing Zhang and Julia Ive and Tong Li and Vibhor Gupta and Bingyuan Chen and Yike Guo},
  journal= {arXiv preprint arXiv:2205.12368},
  year   = {2022}
}