语音搜索词表的最佳规模、新鲜度与时间窗口
计算与语言
2012-11-01 v1 信息检索
摘要
本文研究如何优化语音搜索语言模型的词表。我们优化的指标是未登录词(OoV)率,因为它是用户体验的强指示器。不同于通常测量 OoV 率的方法,网络搜索日志使我们能够计算每次会话的 OoV 率,从而估算经历特定 OoV 率的用户百分比。在非常保守的文本归一化条件下,我们发现,由从 1 周搜索查询数据中提取的 200 万至 250 万个单词组成的语音搜索词表,将产生 1% 的聚合 OoV 率;在该规模下,90% 的用户也会经历相同的 OoV 率。词表中包含的单词数量是 OoV 率的稳定指标。改变词表的新鲜度或收集训练数据的时间窗口持续时间,并不会显著改变 OoV 率。令人惊讶的是,要保证 95% 的用户的 OoV 率低于 1%,则需要显著更大的词表(约 1000 万个单词)。
引用
@article{arxiv.1210.8436,
title = {Optimal size, freshness and time-frame for voice search vocabulary},
author = {Maryam Kamvar and Ciprian Chelba},
journal= {arXiv preprint arXiv:1210.8436},
year = {2012}
}