时间序列数据的真值条件描述生成
计算与语言
2021-10-06 v1 机器学习
摘要
在本文中,我们探索了自动生成时间序列中显著模式的自然语言描述的任务,例如某公司一周的股票价格。该任务的模型应能够提取高层模式,如峰值或谷值的存在。虽然典型的具有注意力机制的当代神经模型可以为此任务生成流畅的输出描述,但它们经常生成事实不正确的描述。我们提出了一种具有真值条件架构的计算模型,该架构首先对输入时间序列运行小型已学习程序,然后识别对给定输入成立(为真)的程序/模式,最后仅以所选有效程序(而非输入时间序列)为条件来生成输出文本描述。我们模型中的程序由模块构成,这些模块是旨在捕获数值模式和时间信息的小型神经网络。这些模块在多个程序间共享,从而实现组合性以及模块参数的高效学习。模块以及模块的组合在数据中是不可观测的,我们以端到端方式学习它们,唯一的训练信号来自 accompanying 的自然语言文本描述。我们发现,尽管我们考虑了小而简单的模块类型空间,所提出的模型仍能够生成高精度的描述。
引用
@article{arxiv.2110.01839,
title = {Truth-Conditional Captioning of Time Series Data},
author = {Harsh Jhamtani and Taylor Berg-Kirkpatrick},
journal= {arXiv preprint arXiv:2110.01839},
year = {2021}
}
备注
EMNLP 2021