TR-EduVSum:面向土耳其语的教育视频摘要数据集与共识框架
计算与语言
2026-04-10 v1 人工智能
摘要
本研究提出了一个框架,用于基于多个人类摘要自动且可复现地生成黄金标准摘要。研究范围内创建了一个新数据集,称为 TR-EduVSum,涵盖 82 份土耳其语课程视频,主题为“数据结构与算法”,包含 3281 条独立的人类摘要。借鉴现有的金字塔式评估方法,提出了 AutoMUP(Automatic Meaning Unit Pyramid)方法,从多个人类摘要中提取共识内容。AutoMUP 使用嵌入技术对从人类摘要中提取的意义单位进行聚类,统计建模参与者间的一致性,并基于共识权重生成分级摘要。在此框架中,黄金摘要对应于最高共识的 AutoMUP 配置,由来自人类摘要中最频繁支持的意义单位构成。实验结果表明,AutoMUP 生成的摘要在语义重叠度上与鲁棦型 LLM(如 Flash 2.5 和 GPT-5.1)摘要表现良好。此外,消融研究清晰地表明,共识权重和聚类在决定摘要质量方面起决定性作用。该方法可在低成本下推广到其他土耳其语国家。
引用
@article{arxiv.2604.07553,
title = {TR-EduVSum: A Turkish-Focused Dataset and Consensus Framework for Educational Video Summarization},
author = {Figen Eğin and Aytuğ Onan},
journal= {arXiv preprint arXiv:2604.07553},
year = {2026}
}
备注
8 pages, 2 figures, 3 tables. Accepted at the Second Workshop on Natural Language Processing for Turkic Languages (SIGTURK 2026), EACL 2026, Rabat, Morocco