通过特权时间序列文本蒸馏改进基于文本的早预测
计算与语言
2023-01-27 v1
摘要
对基于文本的时间序列建模以预测未来事件或结果是一项具有重要广泛应用任务。标准方法是在相同的输入窗口上训练和测试模型,但该方法忽略了预测时间与最终结果之间更长输入窗口中收集的数据,而这些数据在训练时通常是可用的。在本研究中,我们提议将这一被忽略的文本视为训练时可用的特权信息,通过知识蒸馏增强早预测建模,称为利用特权时间序列文本学习(Learning using Privileged tIme-sEries Text, LuPIET)。我们在临床和社交媒体文本上评估该方法,包括基于临床记录的四个临床预测任务和基于社交媒体帖子的两个心理健康预测任务。我们的结果表明 LuPIET 能有效增强基于文本的早预测,尽管可能需要选择适当的文本表示和特权文本窗口以实现最优性能。与另外两种使用迁移学习和混合训练的方法相比,LuPIET 相较基线标准训练提供了更稳定的改进。据我们所知,这是首项在自然语言处理(NLP)背景下研究利用特权信息对时间序列进行学习的工作。
引用
@article{arxiv.2301.10887,
title = {Improving Text-based Early Prediction by Distillation from Privileged Time-Series Text},
author = {Jinghui Liu and Daniel Capurro and Anthony Nguyen and Karin Verspoor},
journal= {arXiv preprint arXiv:2301.10887},
year = {2023}
}
备注
Accepted by ALTA 2022