304.
该文针对中文分词问题提出一种新颖的神经网络分词方法,将词语切分过程看作连续片段的多标签分类问题,有助于模型从句子的全局语义出发预测其包含的词语。在解码阶段,提出采用贪心策略确定最优切分结果,比条件随机场解码效率更高。此外,该文方法可以有效利用目标领域的有噪标注语料,将源领域分词模型迁移至目标领域,提高模型在目标领域的分词性能。在7个常用中文分词数据集上的实验结果表明,该文方法在有监督分词任务上取得了与基线模型相同的分词性能,在CTB6和MSR数据集上分词F
1值分别达到97.73%和98.24%。在跨领域分词任务上该文方法显著优于基线模型,在Weibo和ZX数据集上的未登录词召回率分别提高了7.6%和1.02%。… …
相似文献