中文

为摘要评测寻找适度自动化程度

计算与语言 2021-09-24 v1 人工智能

摘要

摘要任务的人工评测可靠,但带来可复现性与高成本问题。自动指标廉价且可复现,但有时与人类判断相关性较差。本工作中,我们遵循Pyramid人工评测方法,提出从灵活半自动到全自动的摘要评测指标。半自动Lite2Pyramid保留可复用的参考文献人工标注摘要内容单元(SCUs),但以自然语言推理(NLI)模型替代判断系统摘要中SCU存在与否的人工工作。全自动Lite3Pyramid进一步通过语义角色标注(SRL)模型以自动提取的语义三元组单元(STUs)替代SCUs。最后,我们提出中间指标Lite2.xPyramid,使用简单回归器预测STUs模拟SCUs的效果,并保留较难模拟的SCUs,从而在自动化与人工评测间提供平滑过渡与平衡。与15种现有指标相比,我们在3个现有元评测数据集及新收集的PyrXSum(含100/10个XSum示例/系统)上评测人类-指标相关性。结果表明:Lite2Pyramid在摘要级相关性上始终最佳;Lite3Pyramid优于或可比于其他自动指标;Lite2.xPyramid以微小相关性下降换取更大人工投入削减,可降低未来数据收集成本。我们的代码与数据公开于:https://github.com/ZhangShiyue/Lite2-3Pyramid

关键词

引用

@article{arxiv.2109.11503,
  title  = {Finding a Balanced Degree of Automation for Summary Evaluation},
  author = {Shiyue Zhang and Mohit Bansal},
  journal= {arXiv preprint arXiv:2109.11503},
  year   = {2021}
}

备注

EMNLP 2021 (17 pages)