2877.
针对低资源语言社交媒体文本的情感分类是低资源语言舆情分析的基础。低资源语言数据集资源不足,标注困难。数据集的大小以及标签的不平衡会影响情感分类模型的性能。针对上述问题,该文提出了一种适用于低资源语言情感分析的数据增强方法,该方法改进了传统的数据增强方法,提高了数据增强样本生成的质量,用于缓解低资源和标签不平衡情况下的过拟合问题。同时,除了提取文本本身的情感特征,还通过引入主题特征,与语义信息进行融合编码,最终完成情感分类任务。实验结果表明,在构建的维吾尔语数据集上,其准确率与F
1值和多个基线模型相比均有提升,分别达到89.8%和90.3%的分类效果。最后,该模型在公开的英文数据集上也有很好的性能,具有良好的跨语言理解能力。… …
相似文献