词汇束频率作为自动化L2学术写作评分中的解释相关特征候选
计算与语言
2025-04-14 v1
摘要
自动化评分(Automated scoring, AS)系统日益增多地用于评估L2写作,但需要不断精炼以实现构建有效性。虽然先前的工作表明,词汇束(lexical bundles, LBs)——满足 certain frequency criteria 的多词序列——可为评估提供信息,但其在AS模型中的经验整合仍需进一步调查。本研究测试了将LB频率特征纳入用于TOEFL独立写作任务的AS模型的影响。分析来自TOEFL11语料库的子语料库(样本量N=1,225篇作文,9种母语),由ETS培训的评分员(低、中、高)对其评分,提取3-至9词的LBs,区分特定提示相关型与非提示型。将采用既定语言特征(如语法、连贯性、复杂性)构建的基线支持向量机(Support Vector Machine, SVM)评分模型与包含三个综合LB频率特征(总prompt频率、总non-prompt频率、整体总频率)的扩展模型进行比较。结果显示,LB频率(尤其是非提示型词汇束)与水平 proficiency 之间存在显著但通常较小的关系(p < .05)。平均频率表明,较低水平的作文使用了更多LBs。关键在于,LB增强模型提高了与人类评分员的一致性(二次 Cohen's Kappa 提升+2.05%,总体 Cohen's Kappa 提升+5.63%),尤其是对低水平(+10.1% 精确一致)和中水平(+14.3% Cohen's Kappa)作文的提升尤为显著。这些发现表明,整合综合LB频率为开发更具语言学依据性和准确性的AS系统提供了潜力,尤其适用于区分正在发展的L2作文家。
引用
@article{arxiv.2504.08537,
title = {Lexical Bundle Frequency as a Construct-Relevant Candidate Feature in Automated Scoring of L2 Academic Writing},
author = {Burak Senel},
journal= {arXiv preprint arXiv:2504.08537},
year = {2025}
}