中文

TR-EduVSum:面向土耳其语的教育视频摘要数据集与共识框架

计算与语言 2026-04-10 v1 人工智能

摘要

本研究提出了一个框架,用于基于多个人类摘要自动且可复现地生成黄金标准摘要。研究范围内创建了一个新数据集,称为 TR-EduVSum,涵盖 82 份土耳其语课程视频,主题为“数据结构与算法”,包含 3281 条独立的人类摘要。借鉴现有的金字塔式评估方法,提出了 AutoMUP(Automatic Meaning Unit Pyramid)方法,从多个人类摘要中提取共识内容。AutoMUP 使用嵌入技术对从人类摘要中提取的意义单位进行聚类,统计建模参与者间的一致性,并基于共识权重生成分级摘要。在此框架中,黄金摘要对应于最高共识的 AutoMUP 配置,由来自人类摘要中最频繁支持的意义单位构成。实验结果表明,AutoMUP 生成的摘要在语义重叠度上与鲁棦型 LLM(如 Flash 2.5 和 GPT-5.1)摘要表现良好。此外,消融研究清晰地表明,共识权重和聚类在决定摘要质量方面起决定性作用。该方法可在低成本下推广到其他土耳其语国家。

关键词

引用

@article{arxiv.2604.07553,
  title  = {TR-EduVSum: A Turkish-Focused Dataset and Consensus Framework for Educational Video Summarization},
  author = {Figen Eğin and Aytuğ Onan},
  journal= {arXiv preprint arXiv:2604.07553},
  year   = {2026}
}

备注

8 pages, 2 figures, 3 tables. Accepted at the Second Workshop on Natural Language Processing for Turkic Languages (SIGTURK 2026), EACL 2026, Rabat, Morocco