中文

NU HLT在CMCL 2022共享任务:通用语言空间中人类阅读行为的多语言与跨语言预测

计算与语言 2022-03-01 v2 机器学习

摘要

本文中,我们提出了一个统一模型,可用于多种语言中词阅读时间的多语言与跨语言预测。该模型成功的关键在于预处理步骤:所有词均通过国际音标(IPA)转换为其通用语言表征。据我们所知,这是首项有利地利用语言的这一语音属性来完成这两项任务的研究。我们提取了多种特征类型,涵盖基本频率、n-gram、信息论以及受心理语言学驱动的预测因子用于模型训练。一个微调后的随机森林模型在两项任务上均取得最佳性能,其平均首次注视时长(FFDAvg)与平均总阅读时间(TRTAvg)的 MAE 分数分别为 3.8031 与 3.9065。

关键词

引用

@article{arxiv.2202.10855,
  title  = {NU HLT at CMCL 2022 Shared Task: Multilingual and Crosslingual Prediction of Human Reading Behavior in Universal Language Space},
  author = {Joseph Marvin Imperial},
  journal= {arXiv preprint arXiv:2202.10855},
  year   = {2022}
}