文本的谱分析:语言与话语边界的自动检测
计算与语言
2008-10-08 v1 信息检索
摘要
我们提出了一个理论框架,在该框架内,可以基于从给定语料库收集的统计信息来推断该语料库词汇的信息。可以对词汇中单词的类别及其在特定语言中的句法属性进行推断。基于相同的统计数据,可以构建组合相似性矩阵(二元组转移矩阵)或聚合相似性矩阵(任何一对单词共享上下文的概率)。当根据组合相似性进行聚类时,单词倾向于分组到子语言词汇中;当根据聚合相似性进行聚类时,则倾向于分组到句法或语义类中。实验探索了这两种可能性中的第一种。其结果在语料库生成过程的马尔可夫链建模框架内进行了解释:我们表明,对转移矩阵进行谱分析的结果可以解释为聚类内单词的概率分布。该方法实现了词汇到子语言的软聚类,这些子语言有助于生成异质语料库。作为一个应用,我们展示了如何将多语言文本可视地分割成语言同质的片段。我们的方法在语料库中混合了相关语言的情况下特别有用。
引用
@article{arxiv.0810.1212,
title = {Analyse spectrale des textes: d\'etection automatique des fronti\`eres de langue et de discours},
author = {Pascal Vaillant and Richard Nock and Claudia Henry},
journal= {arXiv preprint arXiv:0810.1212},
year = {2008}
}
备注
In French. 10 pages, 5 figures, LaTeX 2e using EPSF and custom package taln2006.sty (designed by Pierre Zweigenbaum, ATALA). Proceedings of the 13th annual French-speaking conference on Natural Language Processing: `Traitement Automatique des Langues Naturelles' (TALN 2006), Louvain (Leuven), Belgium, 10-13 April 2003