StoryER:基于排序、评分与推理的自动故事评估
计算与语言
2022-10-24 v2
摘要
现有的自动故事评估方法侧重于故事词法层面的连贯性,偏离了人类偏好。我们超越这一局限,考虑一种新颖的\textbf{故事}(\textbf{Story})\textbf{评估}(\textbf{E}valuation)方法,其在评判故事时模仿人类偏好,即\textbf{StoryER},它由三个子任务组成:\textbf{排}序(\textbf{R}anking)、\textbf{评}分(\textbf{R}ating)与\textbf{推}理(\textbf{R}easoning)。给定机器生成或人类书写的故事,StoryER要求机器输出 1) 对应于人类偏好的偏好分数,2) 具体评分及其对应置信度,以及 3) 针对各方面(如开头、人物塑造)的评论。为支持这些任务,我们引入了一个标注良好的数据集,包含 (i) 10万对排序故事对;以及 (ii) 一组针对故事各方面共 4.6万条评分与评论。我们在收集的数据集上微调 Longformer-Encoder-Decoder (LED),其中编码器负责偏好分数与方面预测,解码器负责评论生成。我们全面的实验为每个任务建立了具有竞争力的基准,显示出与人类偏好的高度相关性。此外,我们观察到偏好分数、方面评分与评论的联合学习为每个单独任务带来了增益。我们的数据集与基准已公开,以推进故事评估任务的研究。\footnote{数据集与预训练模型演示可在匿名网站 \url{http://storytelling-lab.com/eval} 与 \url{https://github.com/sairin1202/StoryER} 获取}
引用
@article{arxiv.2210.08459,
title = {StoryER: Automatic Story Evaluation via Ranking, Rating and Reasoning},
author = {Hong Chen and Duc Minh Vo and Hiroya Takamura and Yusuke Miyao and Hideki Nakayama},
journal= {arXiv preprint arXiv:2210.08459},
year = {2022}
}
备注
accepted by EMNLP 2022