纯离线 · 本地部署
将文字转化为
自然语音
AI TTS(Offline version) 基于扩散模型,支持中文 / 英文语音合成、音色克隆、音调语速调节。完全本地运行,保护数据隐私。
10+
内置音色
中文/英文
双语支持
GPU/CPU
灵活运行
核心功能
不止于合成
从文本输入到最终音频输出,完整闭环。支持翻译、克隆、后处理,每一步都可控可调。
语音合成
输入中文或英文文本,选择内置音色,快速生成高质量 WAV 音频。支持最长 500 字文本分段合成。
TTS Engine
音色克隆
上传 5~30 秒参考音频,自动 ASR 识别文本,用该音色朗读任意内容。保留音色特征,高相似度还原。
Voice Clone
中英互译
内置翻译模块,输入中文自动译英文,输入英文自动译中文。实时预览翻译结果,方便快捷。
Translator
音频后处理
合成后可对音频进行后处理:音调调节(±12 半音)、语速调整(0.5x~2.0x)、响度归一化、动态压缩。FFmpeg 驱动,处理快速稳定。
Audio Post-Processing
音调调节
+3 半音
语速调整
1.2x
响度归一化
LUFS -16
SenseVoice ASR
内置阿里 SenseVoice 语音识别引擎,自动将参考音频转为文字,精准用于音色克隆的 prompt 构建。
ASR Engine
参数可视化
CFG 强度、推理步数、音调、语速等核心参数均可视化调节。实时预览效果,所见即所得。
Inference Control
技术架构
端到端完整链路
从文本到音频,每一环节均有保护机制,稳定可靠
文本输入
中文 / 英文文本,最长500字
翻译模块
中英双向翻译
AI 扩散
扩散模型合成mel频谱
AudioVAE 解码
声码器转换为波形
FFmpeg 后处理
音调·语速·响度·压缩
输出音频
WAV 格式本地保存
音色克隆
用你的声音说话
上传任意语音参考,AI 自动识别音色特征,用该音色朗读任意文本。适合品牌音色定制、有声内容创作。
标准男声
中文 · 内置
播放演示
温柔女声
中文 · 内置
播放演示
英文播音
英文 · 内置
播放演示
克隆音色 A
自定义 · 用户上传
播放演示
克隆音色 B
自定义 · 用户上传
播放演示
上传你的参考音频
支持 WAV/MP3/FLAC,5~30秒,安静环境下录音效果更佳。ASR 自动识别文字,无需手动输入。
参数控制
所见即所得
每一项参数均可视化调节,实时预览效果,找到最适合你的音色与表达方式。
-
音调调节-12 到 +12 半音,调整声音的高低,适配不同场景需求。
-
语速调整0.5x 到 2.0x,FFmpeg atempo 滤镜驱动,音质无损。
-
响度归一化loudnorm 算法统一到 LUFS -16,符合广播标准。
-
CFG 强度 & 推理步数CFG 0.5~4.0,步数 5~20,平衡质量与速度。
CFG 强度1.5
推理步数10
音调+3 半音
语速1.0x
响度归一化LUFS -16
探索产品详情
语音合成
AI TTS
扩散模型语音合成 · 中文/英文双语支持 · 音色克隆 · 本地部署,数据不上云
语音合成
最长500字文本分段合成
音色克隆
5~30秒参考音频,高相似度还原
中英互译
内置翻译模块,实时双向转换
音频后处理
音调·语速·响度·动态压缩
文本输入
500字
→
翻译
中英互译
→
AI
扩散合成
→
AudioVAE
声码器
→
FFmpeg
后处理
→
WAV
输出
设置中心
灵活配置
一站式设置中心,模型管理、音色管理、合成参数、输出格式,全部可控可调
模型管理
GPU / CPU 切换,模型下载与删除
音色管理
克隆音色库,添加、预览、删除
合成参数
CFG强度 / 推理步数 / 音调 / 语速
输出设置
WAV 格式 / 采样率 / 本地保存路径
音色克隆
5~30秒
→
SenseVoice
ASR识别
→
音色入库
本地存储
→
参数调节
实时预览
→
合成输出
WAV保存
本地部署 · 隐私优先
立即体验 AI TTS
完全本地运行,数据不上传云端
支持 GPU 加速,中英双语语音合成