当前位置:首页 > 实用文档 > 计算机软件及计算机应用 > 正文

针对长尾问题的二重加权多音字消歧算法

中文信息学报 页数: 8 2022-11-15
摘要: 数据的长尾分布问题是NLP实践领域中的常见问题。以语音合成前端的多音字消歧任务为例,多音字数据的极度不均衡、尾部数据的缺乏,影响着语音合成系统的工业实用效果。该文观察到,汉语多音字的分布在“字符”与“字音”两个维度上都呈长尾特性,因此该文针对性地提出一种二重加权算法(Double Weighted, DW)。DW算法可分别与两种长尾算法:MARC,Decouple-cRT结合,...
...

科技文献多音字消歧;长尾分布;重加权;解耦特征与分类器