视频合成模型的训练方法、合成方法、装置、介质和设备.pdf
山梅****ai
亲,该文档总共19页,到这已经超出免费预览范围,如果喜欢就直接下载吧~
相关资料
视频合成模型的训练方法、合成方法、装置、介质和设备.pdf
本公开提供一种视频合成模型的训练方法、视频合成方法、装置、存储介质、程序产品和电子设备,其中方法包括:获取样本文本以及样本视频,其中样本视频是真人朗读样本文本的视频;将样本文本输入语音合成子模型,得到特征向量;将特征向量输入语音重建人脸子模型,得到人脸特征参数;将人脸特征参数和样本视频输入可微分渲染子模型,得到人脸特征图;将人脸特征图输入生成式对抗网络子模型,得到虚拟真人视频,基于虚拟真人视频和样本视频,迭代训练语音重建人脸子模型、可微分渲染子模型和生成式对抗网络子模型,直至生成式对抗网络子模型的损失函数
语音合成模型的训练方法、合成方法、系统、设备和介质.pdf
本发明公开了一种语音合成模型的训练方法、合成方法、系统、设备和介质,该训练方法包括:获取若干个历史文本信息及其历史语音信息;获取历史文本信息的历史文本向量;基于CNN网络和双向LSTM网络构建初始声学模型;基于历史文本向量及其历史语音信息的第一梅尔谱,对初始声学模型进行模型训练以得到目标声学模型;基于第二梅尔谱以及历史语音信息,对预设神经网络模型进行模型训练以得到目标声码器模型。本发明中通过基于CNN网络、双向LSTM网络以及线性层搭建声学模型,基于生成式对抗网络GAN构建声码器模型,实现在保证语音合成质
语音合成模型的训练方法、装置、电子设备及存储介质.pdf
本申请公开了语音合成模型的训练方法、装置、电子设备及存储介质。方法包括:获取待处理的初始文本,并检测初始文本携带的字符,得到初始文本对应的初始韵律结构;获取初始文本对应的目标个性化语音,并确定目标个性化语音所包括每一个音素的对齐结果;利用对齐结果修正初始文本对应的初始韵律结构,得到目标韵律结构,并基于目标音律结构生成目标文本;基于目标文本的目标韵律结构以及目标个性化语音训练预设神经网络模型,得到语音合成模型。本申请通过对齐结果对初始韵律结构中不连贯的部分进行修正,通过目标文本保证录音和文本的韵律结构一致。
语音合成模型的训练方法、装置、电子设备及存储介质.pdf
本公开提供了一种语音合成模型的训练方法、装置、电子设备及存储介质,所述方法包括:将第一语音样本对应的音乐信息,输入至时长提取模块,获取乐谱样本嵌入值;将乐谱样本嵌入值和乐谱样本嵌入值对应的音高样本嵌入值输入至线性变换模块,进行降维;将线性变换模块的输出,作为框架网络模块的输入,获取音乐信息对应的第一预测样本特征;获取第一语音样本对应的隐特征;将隐特征输入至解码器中,获取隐特征对应的预测语音样本;基于第一语音样本和所述预测语音样本,调整解码器的参数;基于第一预测样本特征和隐特征,调整所述线性变换模块和框架网
语音合成模型训练和语音合成方法、装置、设备及介质.pdf
本发明公开了一种语音合成模型训练和语音合成方法、装置、设备及介质。由于样本集中的任一第一语音样本对应的文本特征,均是根据预先配置的第一语言的语音单元集合与第二语言的语音单元集合的对应关系确定的,从而实现了将第一语音样本转换为第二语言的语音样本,增加了第二语言的语音样本的数量,后续基于样本集中的第一语音样本对应的文本特征样本和第一语音样本的第一声学特征,即可对原始语音合成模型进行训练,从而获取到第二语言对应的目标语音合成模型,从而实现无需大量的采集第二语言的语音样本,即可获取到第二语言的目标语音合成模型。