用于机器文本理解的神经模型训练:Brain2Text 算法
计算与语言
2018-04-03 v1 机器学习
摘要
如今,互联网代表了一个呈指数级增长的庞大信息空间,相关数据的检索问题变得空前重要。本文提出的算法可对文档内容进行自然语言查询并给出全面而有意义的答案。该问题在英语上已部分解决,因为 SQuAD 包含足够训练数据,但俄语尚无此类数据集,因此科学家当前使用的方法不适用于俄语。Brain2 框架能够应对该问题——其突出之处在于可应用于小数据集且不需要惊人的计算力。该算法以俄罗斯联邦储蓄银行战略文本为例进行说明,并假定使用一个由 6500 万突触组成的神经模型。训练后的模型能够基于给定文本逐词构造问题答案。现有局限是其目前无法识别同义词、代词关系与讽喻。尽管如此,实验结果表明所提方法具有较高能力与泛化能力。
引用
@article{arxiv.1804.00551,
title = {The Training of Neuromodels for Machine Comprehension of Text. Brain2Text Algorithm},
author = {A. Artemov and A. Sergeev and A. Khasenevich and A. Yuzhakov and M. Chugunov},
journal= {arXiv preprint arXiv:1804.00551},
year = {2018}
}
备注
5 pages, 2 figures, 6 tables