中文

面向教育情感分析的受控合成基准

计算与语言 2026-05-26 v1 人工智能

摘要

教育情感分析(ABSA)可支持课程改进,但公共的面向教育的情感分析数据集因教育评论私有、学校特定且标注昂贵而稀缺。本研究引入了一个用于教育ABSA的受控合成基准,基于10,000条合成课程评论构建,包含明确的训练-验证-测试划分,以及覆盖教学质量、评估与课程管理、学习需求、学习环境和参与度的20维教学模式架构。该语料库通过抽样目标标签、抽样细微属性以及经三轮裁判-编辑程序精炼后得到的真实感调优提示词生成。在该基准上,本地基线(TF-IDF、两阶段变换模型和联合编码器)表明该任务并非易事;最强的未微调模型BERT在held-out检测上达到0.2760的微观F1分数,而采用保守的BERT调度策略可将其提升至0.2930。完全测试的GPT模型在零样模式下达到0.2519的微观F1,经过检索式few-shot提示后为0.2501,使批量推理置于经典基线之上,并接近紧凑型联合编码器。对2,829条从Herath等人映射而来的学生反馈评论进行保守的外部评估显示,BERT在9维重叠上的微观F1为0.4593,表明合成到真实的迁移具有部分效果。报告了现实感和忠实性分析作为生成器诊断,阐明了基准如何稳定以及标签噪声残存的地方。该研究因此贡献了一个教育ABSA合成语料库、一套记录下的生成程序以及一个在公共标注数据困难获取的领域中可复现的基准设置。

关键词

引用

@article{arxiv.2605.25502,
  title  = {A Controlled Synthetic Benchmark for Educational Aspect-Based Sentiment Analysis},
  author = {Yehudit Aperstein and Alexander Apartsin},
  journal= {arXiv preprint arXiv:2605.25502},
  year   = {2026}
}

备注

39 pages, 14 figures