FunAudioLLM

FunAudioLLM,这是一个旨在增强人类与大型语言模型 (LLM) 之间自然语音交互的框架。其核心是两款创新模型:SenseVoice,用于高精度多语言语音识别、情感识别和音频事件检测 CosyVoice,用于生成具有多语言、音色和情感控制的自然语音。SenseVoice 提供极低的延迟并支持 50 多种语言,而 CosyVoice 在多语言语音生成、零样本语音生成、跨语言语音克隆和指令跟踪功能方面表现出色。SenseVoice 和 CosyVoice 相关的模型已经在 Modelscope 和 Huggingface 上开源,相应的训练、推理和微调代码也发布在 GitHub 上。通过将这些模型与 LLM 集成,FunAudioLLM 实现了语音翻译、情感语音聊天、交互式播客和富有表现力的有声读物旁白等应用,从而突破了语音交互技术的界限。

ChatTTS

一款适用于日常对话的生成式语音模型。

  1. 对话式 TTS: ChatTTS 针对对话式任务进行了优化,能够实现自然且富有表现力的合成语音。它支持多个说话者,便于生成互动式对话。

  2. 精细的控制: 该模型可以预测和控制精细的韵律特征,包括笑声、停顿和插入语。

  3. 更好的韵律: ChatTTS 在韵律方面超越了大多数开源 TTS 模型。我们提供预训练模型以支持进一步的研究和开发。

RVC

RVC介绍
全称 Retrieval-based-Voice-Conversion-WebUI 简称 RVC
一个基于VITS的简单易用的语音转换(变声器)框架

  • RVC 是一款前沿的音色替换项目,可以进行歌曲的翻唱,和实时的变声,具有低延迟、优秀的变声效果、声音模型扩展性、个性化和先进的深度学习技术等特点。

  • 该项目的核心功能之一是有更高的自由性和声音模型扩展性,可以对任意动漫角色和人物进行实时的声音转换,前提是进行训练声音模型。这为用户提供了极大的自由度和创新空间。,这种声音模型的转换是通过深度学习实现的,可以通过简单的设置和选择输入输出,将自己的声音转换成不同的声音音色,从而实现声音的个性化和可玩性。

so-vite-svc

Sovits

首先介绍一下今天要讲的Sovits,So-vits-svc(也称Sovits)是由是中国民间歌声合成爱好者Rcell基于VITS、soft-vc、VISinger2等一系列项目开发的一款开源免费AI语音转换软件,通过SoftVC内容编码器提取源音频语音特征,与F0同时输入VITS替换原本的文本输入达到歌声转换的效果。

由于某些原因,原作者Rcell删除了原代码仓库,现由svc-develop-team接手进行后续维护