MockConf:一个学生解释数据集:分析、词级与片段级对齐及基线
计算与语言
2025-06-06 v1
摘要
在同步解释中,解释员会在源语音几乎完成前将其渲染为另一种语言。为了理解并稍后自动复现这一动态和复杂的任务,我们需要针对分析、监控和评估而构建专门的数据集和工具,例如平行语音语料库及其自动标注工具。现有的平行文本语料库及其对齐算法几乎无法填补这一差距,因为它们未能建模语音片段之间的长程相互作用或特定类型的差异(例如缩短、简化、功能概括化)在原始语音与解释语音之间。本文我们介绍 MockConf,一个来自学生解释模拟会议收集的学生解释数据集。该数据集包含 5 种欧洲语言、总计 7 小时的录音,按词级和片段级进行转录与对齐。我们进一步实现并发布 InterAlign,一个面向长文本平行词级和片段级标注的现代 Web 标注工具,适用于同步解释对齐。我们提出了评估指标并给出一个基线用于自动对齐。数据集和工具已发布给社区。
引用
@article{arxiv.2506.04848,
title = {MockConf: A Student Interpretation Dataset: Analysis, Word- and Span-level Alignment and Baselines},
author = {Dávid Javorský and Ondřej Bojar and François Yvon},
journal= {arXiv preprint arXiv:2506.04848},
year = {2025}
}
备注
Accepted to ACL 2025 Main Conference