用于句子级双语等价数据提取的含噪平行与可比语料过滤方法
计算与语言
2015-10-16 v1
摘要
文本对齐与文本质量对于机器翻译(MT)系统、一些NLP工具以及任何其他需要双语数据的文本处理任务的准确性至关重要。本研究提出了一种基于波兰语(非位置敏感语言)到英语实验的、与语言无关的 bilingual sentence filtering 方法。该清洗方法在TED Talks语料库上开发,并初步在Wikipedia可比语料库上测试,但其可用于任何文本领域或语言对。所提方法实现了多种用于句子比较的启发式规则。其中一些利用同义词以及文本的语义和结构分析作为附加信息。确保了数据损失最小化。文中讨论了使用该方法处理文本后MT系统评分的提升。
引用
@article{arxiv.1510.04500,
title = {Noisy-parallel and comparable corpora filtering methodology for the extraction of bi-lingual equivalent data at sentence level},
author = {Krzysztof Wołk},
journal= {arXiv preprint arXiv:1510.04500},
year = {2015}
}
备注
arXiv admin note: text overlap with arXiv:1509.09093, arXiv:1509.08881