Anusaaraka:克服印度的语言障碍
计算与语言
2007-05-23 v1
摘要
Anusaaraka 系统使一种印度语言的文本能以另一种印度语言的形式获取。在 Anusaaraka 方法中,人机分工使得语言负担由机器承担,而文本理解留给人。机器用一种接近目标语言的语言呈现源文本的映像。在该映像中,源语言中一些没有对应形式的结构会溢出到输出中。也设计了一些特殊符号。用户经过一些训练后学会阅读和理解输出。由于印度语言彼此接近,输出语言的学习时间很短,预计约为 2 周。输出也可以由受过训练的用户后编辑,使其在目标语言中语法正确。如有必要也可更改风格。因此,在这种场景下,它可以作为人工辅助翻译系统运行。目前,从泰卢固语、卡纳达语、马拉地语、孟加拉语和旁遮普语到印地语的 Anusaaraka 正在构建中。它们在不久的将来可为所有印度语言构建。每个人都必须参与进来,利用自由软件模型构建连接所有印度语言的此类系统。
引用
@article{arxiv.cs/0308018,
title = {Anusaaraka: Overcoming the Language Barrier in India},
author = {Akshar Bharati and Vineet Chaitanya and Amba P. Kulkarni and Rajeev Sangal and G Umamaheshwara Rao},
journal= {arXiv preprint arXiv:cs/0308018},
year = {2007}
}
备注
Published in "Anuvad: Approaches to Translation", Rukmini Bhaya Nair, (editor), Sage, New Delhi, 2001