一种提高语音合成自然度的方法
基本信息
申请号 | CN202110906779.3 | 申请日 | - |
公开(公告)号 | CN113488021A | 公开(公告)日 | 2021-10-08 |
申请公布号 | CN113488021A | 申请公布日 | 2021-10-08 |
分类号 | G10L13/02;G10L13/08 | 分类 | 乐器;声学; |
发明人 | 盛乐园 | 申请(专利权)人 | 杭州小影创新科技股份有限公司 |
代理机构 | 杭州中港知识产权代理有限公司 | 代理人 | 张晓红 |
地址 | 310000 浙江省杭州市西湖区文三路478号华星时代广场A座22层 | ||
法律状态 | - |
摘要
摘要 | 本发明公开了一种提高语音合成自然度的方法。它包括如下步骤:将文本通过字形到音素的工具得到与文本对应的音素,所有的音素组成一个音素字典,音素字典的个数作为嵌入层的维度,对文本的音素进行表征,由CBHG模块对表征的特征进行编码;将文本编码的结果作为输入,对每个音素的持续时间进行预测,预测结果与真实的标签作比对,对时长模型进行优化;将经过时长模型扩充后的特征进行解码,解码出的结果组合成一个复数的特征,解码出的复数特征经原始音频中短时傅里叶逆变换,还原为语音波形。本发明的有益效果是:可以降低模型的复杂度,减少计算量,节约计算及部署成本;提高合成语音的自然度,发音更加像真人。 |
