Skip to content

[开源推荐] revoice-asr-tts:一个面向 Windows 的实时语音变声工具 #3500

Description

@aklws

项目地址

https://github.com/aklws/revoice-asr-tts

类别

Python

项目标题

【工具自荐】revoice-asr-tts:一个面向 Windows 的实时语音变声工具

项目描述

revoice-asr-tts 是一个面向 Windows 桌面场景的实时语音变声工具,核心目标是把“说话 -> 识别 -> 生成目标语音 -> 实时播放”串成一条尽量低延迟、可以直接落地使用的链路。

它既支持麦克风实时输入,也支持文本直接合成,适合用于实时变声、参考音色复刻、多语言语音输出,以及直播、配音、互动演示等场景。

它的一大优势是:不需要为了使用先单独训练一个声音模型。只要准备参考音频,就可以更快进入实际体验和调试阶段,这对想直接上手的人会友好很多。

另外,如果你之前接触过 RVC 一类方案,这个工具还有一个很直观的特点:在当前这类实时使用场景里,输出会更偏清晰、直接,整体更适合拿来做实时说话和即时播放。

这个工具是什么

它可以把用户输入的语音或文本,转换成目标声音风格的语音输出。相比只关注单点功能的工具,它更强调一整条桌面实时使用链路,而不是单纯做一个离线合成器。

当前支持两种主要使用方式:

  • 麦克风实时模式:用户直接对着麦克风说话,系统识别后快速生成并播放目标语音
  • 文本模式:直接输入文本,流式生成语音

除了基本的语音输入输出,它还支持参考音频音色克隆、输出语言切换、情感风格控制,以及在需要时先把输入内容自动翻译成目标输出语言,再进入语音合成。

亮点

  • 实时链路完整:支持从麦克风输入到语音输出的一体化桌面体验
  • 双输入模式:既能实时说话,也能直接输入文本生成语音
  • 无需预训练个人声音:不需要先准备一整套训练流程,就能基于参考音频快速开始使用
  • 输出更清晰:相比常见的实时变声思路,在当前场景里更偏清晰、直接,适合连续说话和实时播放
  • 参考音频复刻:可以基于参考音频快速贴近目标说话风格
  • 多语言输出:支持中文、英文、日语三种输出语言
  • 可指定输出风格:可以按需要选择目标输出语言,并指定情感表现
  • 按需翻译:当输入语言与输出语言一致时自动跳过翻译,减少不必要处理
  • 翻译节点可配置:可以接入兼容接口的翻译服务,方便按自己的使用习惯切换节点
  • 更适合本地实时场景:强调桌面端可操作性、反馈速度和连续使用体验

示例代码

截图或演示视频

B 站宣传视频

##运行截图

Image Image Image

Metadata

Metadata

Assignees

Labels

No labels
No labels

Projects

No projects

Milestone

No milestone

Relationships

None yet

Development

No branches or pull requests

Issue actions