EMTeC:机器生成文本眼动语料库
计算与语言
2024-08-09 v1
摘要
机器生成文本眼动语料库 (EMTeC) 是由 107 名母语为英语的受试者阅读机器生成文本时记录的自然态度眼动语料库。这些文本由三种大型语言模型使用五种不同的解码策略生成,涵盖六种不同的文本类型类别。EMTeC 提供了各阶段预处理的眼动数据,包括以 2000 Hz 采样率采集的原始坐标数据、眼动序列以及阅读度量指标。此外,语料库提供了原始版本与纠正后版本的眼动序列,后者考虑了垂直校准漂移。更重要的是,语料库包含支撑刺激文本生成的语言模型内部信息:转换得分、注意力得分以及隐藏状态。这些刺激物在文本层面和词层面均标注了多种语言特征。我们预计 EMTeC 将被用于各种用例,例如但不限于:调查机器生成文本上的阅读行为及不同解码策略的影响;不同文本类型的阅读行为;开发新的预处理、数据过滤和漂移校正算法;语言模型的认知可解释性与增强;以及评估 surprisal 与 entropy 对人类阅读时间的预测能力。语料库在各预处理阶段的数据、模型内部信息以及可复现刺激生成、数据预处理和分析的代码,均可通过 https://github.com/DiLi-Lab/EMTeC/ 获得。
引用
@article{arxiv.2408.04289,
title = {EMTeC: A Corpus of Eye Movements on Machine-Generated Texts},
author = {Lena Sophia Bolliger and Patrick Haller and Isabelle Caroline Rose Cretton and David Robert Reich and Tannon Kew and Lena Ann Jäger},
journal= {arXiv preprint arXiv:2408.04289},
year = {2024}
}