中文

基于上下文对齐对比学习与 Ridge 集成提升词汇难度预测

计算与语言 2026-05-12 v1 人工智能

摘要

词汇难度预测是语言学习和可读性评估中的一个基本问题,需要模型估计不同第一语言 (L1) 背景下的词汇难度。然而,现有方法依赖仅使用标量监督的回归训练,这不会显式地结构化表示空间,限制其捕获跨语言对齐和序数难度的能力。为缓解这些问题,我们提出 Context-Aligned Contrastive Regression,将 Ridge 回归集成与两种互补目标集成,即 Cross-View Context 和 Ordinal Soft Contrastive Learning。实验在三个 L1 数据集上显示:(i) 对比目标改善了跨语言表示对齐,同时保留语言特定细微差异;(ii) 学习到的表示捕获了词汇难度的序数结构;(iii) 集成有效缓解了单个模型的系统偏差,导致在不同难度水平上实现更稳定的性能。

关键词

引用

@article{arxiv.2605.08950,
  title  = {Improving Lexical Difficulty Prediction with Context-Aligned Contrastive Learning and Ridge Ensembling},
  author = {Wicaksono Leksono Muhamad and Joanito Agili Lopo and Tsamarah Rana Nugraha and Ahmad Cahyono Adi and Muhammad Oriza Nurfajri},
  journal= {arXiv preprint arXiv:2605.08950},
  year   = {2026}
}