一种提高语音合成自然度的方法

基本信息

申请号 CN202110906779.3 申请日 -
公开(公告)号 CN113488021A 公开(公告)日 2021-10-08
申请公布号 CN113488021A 申请公布日 2021-10-08
分类号 G10L13/02;G10L13/08 分类 乐器;声学;
发明人 盛乐园 申请(专利权)人 杭州小影创新科技股份有限公司
代理机构 杭州中港知识产权代理有限公司 代理人 张晓红
地址 310000 浙江省杭州市西湖区文三路478号华星时代广场A座22层
法律状态 -

摘要

摘要 本发明公开了一种提高语音合成自然度的方法。它包括如下步骤:将文本通过字形到音素的工具得到与文本对应的音素,所有的音素组成一个音素字典,音素字典的个数作为嵌入层的维度,对文本的音素进行表征,由CBHG模块对表征的特征进行编码;将文本编码的结果作为输入,对每个音素的持续时间进行预测,预测结果与真实的标签作比对,对时长模型进行优化;将经过时长模型扩充后的特征进行解码,解码出的结果组合成一个复数的特征,解码出的复数特征经原始音频中短时傅里叶逆变换,还原为语音波形。本发明的有益效果是:可以降低模型的复杂度,减少计算量,节约计算及部署成本;提高合成语音的自然度,发音更加像真人。