技术新讯 > 乐器声学设备的制造及制作,分析技术 > 语音合成方法、装置、设备以及计算机可读存储介质与流程 > 正文

语音合成方法、装置、设备以及计算机可读存储介质与流程

国知局
2024-06-21 11:57:53

本申请涉及语音合成，具体涉及一种语音合成方法、装置、设备以及计算机可读存储介质。

背景技术：

1、随着人工智能技术的发展，越来越多的电子设备提供了个性化语音合成服务。相关技术中，提供个性化语音合成服务的电子设备一般需要用户录制并上传多句语音，在服务器端通过这多句语音启动针对该用户的模型单独训练流程，得到一个与该用户的音色匹配的模型，在该用户在进行语音合成时使用该对应的模型进行语音合成处理。这种方式不仅需要用户录制较多的语音数据，并且在将录制的语音数据上传到服务器之后，需要经过较长时间的等待才能使用个性化语音合成服务，存在个性化语音合成效率低的技术问题。

技术实现思路

1、本申请实施例提供一种语音合成方法、装置、设备以及计算机可读存储介质，能够提高个性化语音合成的效率。

2、第一方面，本申请实施例提供一种语音合成方法，包括：

3、获取待合成文本以及目标用户的第一参考语音；

4、提取所述第一参考语音的音色嵌入特征和韵律嵌入特征；

5、根据第一语音合成模型、所述音色嵌入特征和所述韵律嵌入特征对所述待合成文本进行处理，得到具有所述目标用户的音色和韵律的语音数据。

6、第二方面，本申请实施例还提供一种语音合成装置，包括：

7、确定单元，用于确定目标用户和待合成文本；

8、获取单元，用于获取所述目标用户的音色嵌入特征和韵律嵌入特征；

9、合成单元，用于根据第一语音合成模型、所述音色嵌入特征和所述韵律嵌入特征对所述待合成文本进行处理，得到具有所述目标用户的音色和韵律的语音数据。

10、第三方面，本申请实施例还提供一种计算机可读存储介质，所述计算机可读存储介质上存储有计算机程序，所述计算机程序被处理器执行时实现如本申请任一实施例提供的语音合成方法中的步骤。

11、第四方面，本申请实施例还提供一种电子设备，所述电子设备包括处理器、存储器以及存储于所述存储器中并可在所述处理器上运行的计算机程序，所述处理器执行所述计算机程序时实现如本申请任一实施例提供的语音合成方法中的步骤。

12、本申请实施例提供的技术方案，确定目标用户和待合成文本；获取目标用户的音色嵌入特征和韵律嵌入特征；根据第一语音合成模型、音色嵌入特征和韵律嵌入特征对待合成文本进行处理，得到具有目标用户的音色的语音数据。本申请的方案在对目标用户进行语音合成时，无需获取该用户的大量语音来训练模型，而是根据通用的语音合成模型，以及能够表征该用户的音色的音色嵌入特征和韵律嵌入特征对所述待合成文本进行合成，得到具有该用户的音色和韵律的语音数据，提高了个性化语音合成的效率。

技术特征：

1.一种语音合成方法，其特征在于，包括：

2.如权利要求1所述的方法，其特征在于，所述获取所述目标用户的音色嵌入特征和韵律嵌入特征，包括：

3.如权利要求2所述的方法，其特征在于，所述根据第一参考语音，生成所述目标用户的音色嵌入特征和韵律嵌入特征，包括：

4.如权利要求1所述的方法，其特征在于，所述第一语音合成模型包括第一音素编码器、第一变量适配器、第一梅尔解码器以及第一声码器；

5.如权利要求4所述的方法，其特征在于，所述第一音素编码器包括多个第一前馈网络；所述第一前馈网络包括多头注意力模块和第一归一化模块；

6.如权利要求5所述的方法，其特征在于，所述通过所述多个第一前馈网络和所述音色嵌入特征对所述音素嵌入特征进行编码处理，得到第一音素隐藏特征，包括：

7.如权利要求5所述的方法，其特征在于，所述第一归一化模块包括第一全连接层、第二全连接层和归一化层；所述归一化参数包括增益参数和偏置参数；

8.如权利要求4所述的方法，其特征在于，所述第一变量适配器包括变量适配模块和第二归一化模块；

9.如权利要求1所述的方法，其特征在于，所述获取待合成文本以及目标用户的第一参考语音之前，所述方法还包括：

10.如权利要求9所述的方法，其特征在于，所述第二语音合成模型包括第二音素编码器、第二变量适配器、第二梅尔解码器以及第二声码器；

11.一种语音合成装置，其特征在于，包括：

12.一种计算机可读存储介质，其特征在于，所述计算机可读存储介质上存储有计算机程序，所述计算机程序被处理器执行时实现如权利要求1至10任一项所述的语音合成方法中的步骤。

13.一种电子设备，其特征在于，所述电子设备包括处理器、存储器以及存储于所述存储器中并可在所述处理器上运行的计算机程序，所述处理器执行所述计算机程序时实现如权利要求1至10任一项所述的语音合成方法中的步骤。

技术总结本申请公开了一种语音合成方法、装置、设备以及计算机可读存储介质。该方法包括：确定目标用户和待合成文本；获取目标用户的音色嵌入特征和韵律嵌入特征；根据第一语音合成模型、音色嵌入特征和韵律嵌入特征对待合成文本进行处理，得到具有目标用户的音色的语音数据。本申请的方案在对目标用户进行语音合成时，无需获取该用户的大量语音来训练模型，而是根据通用的语音合成模型，以及能够表征该用户的音色的音色嵌入特征和韵律嵌入特征对所述待合成文本进行合成，得到具有该用户的音色和韵律的语音数据，提高了个性化语音合成的效率。技术研发人员：陈崇明受保护的技术使用者：TCL科技集团股份有限公司技术研发日：技术公布日：2024/6/11