评估二语习语加工中的认知努力:一个眼动追踪数据集
计算与语言
2026-05-07 v1 人工智能
计算机视觉与模式识别
摘要
本文介绍了一个眼动追踪数据集的开发与验证,该数据集旨在研究第二语言(L2)学习者如何加工习语表达。尽管母语者通常依赖直接提取比喻义,但L2说话者经常采用字面优先的方法,这会产生可测量的认知成本。该资源通过记录以葡萄牙语为L1的英语说话者跨越所有CEFR熟练度水平(A1-C2)的眼动指标来捕获这些成本。尽管该研究使用的是入门级60 Hz硬件(Tobii Pro Spark),我们证明该采样率提供了足够的数据密度来检测阅读中的注视和回视等宏观认知事件。初步分析通过揭示语言熟练度与回视性眼动之间的强负相关性来验证数据集。作为MIA(人类与人工智能语言处理中的习语性建模)倡议的一部分,该数据集作为一个基于认知的基准,用于评估人类加工模型以及大型语言模型与类人比喻理解的对齐程度。
引用
@article{arxiv.2605.04857,
title = {Assessing Cognitive Effort in L2 Idiomatic Processing: An Eye-Tracking Dataset},
author = {Eduardo Santos and Juliana Carvalho and César Rennó-Costa},
journal= {arXiv preprint arXiv:2605.04857},
year = {2026}
}