迈向利用机器翻译技术构建话语标记多语词汇集
计算与语言
2015-04-01 v1
摘要
话语标记是受语言变异影响的普遍性语言事件。尽管已有大量文献报道了这些事件的语种特定特征,但关于其跨语言行为以及构建话语标记多语词汇集的研究甚少。本文描述了在欧洲议会语料库(Europarl corpus)这一特定领域内,用于描述、分类和标注话语标记的新方法与途径。由于这些结构具有习语特性,在翻译背景下研究话语标记至关重要。多语词汇集连同此类结构的功能分析,是将话语标记翻译为另一种语言中可能对应项的艰巨任务的有用工具。利用 Daniel Marcu 从 Brown 语料库中提取的经过验证的英语话语标记,我们的目标是基于机器翻译技术为其他语言构建话语标记的多语词汇集。本研究的主要假设是话语标记的使用独立于语言,即一种语言中句子中话语标记的修辞功能等同于另一语言中相同话语标记的修辞功能。
引用
@article{arxiv.1503.09144,
title = {Towards Using Machine Translation Techniques to Induce Multilingual Lexica of Discourse Markers},
author = {António Lopes and David Martins de Matos and Vera Cabarrão and Ricardo Ribeiro and Helena Moniz and Isabel Trancoso and Ana Isabel Mata},
journal= {arXiv preprint arXiv:1503.09144},
year = {2015}
}
备注
6 pages