纯离线 · 本地部署

将文字转化为
自然语音

AI TTS(Offline version) 基于扩散模型,支持中文 / 英文语音合成、音色克隆、音调语速调节。完全本地运行,保护数据隐私。

10+
内置音色
中文/英文
双语支持
GPU/CPU
灵活运行
AI TTS 产品界面
核心功能

不止于合成

从文本输入到最终音频输出,完整闭环。支持翻译、克隆、后处理,每一步都可控可调。

语音合成
输入中文或英文文本,选择内置音色,快速生成高质量 WAV 音频。支持最长 500 字文本分段合成。
TTS Engine
音色克隆
上传 5~30 秒参考音频,自动 ASR 识别文本,用该音色朗读任意内容。保留音色特征,高相似度还原。
Voice Clone
中英互译
内置翻译模块,输入中文自动译英文,输入英文自动译中文。实时预览翻译结果,方便快捷。
Translator
音频后处理
合成后可对音频进行后处理:音调调节(±12 半音)、语速调整(0.5x~2.0x)、响度归一化、动态压缩。FFmpeg 驱动,处理快速稳定。
Audio Post-Processing
音调调节 +3 半音
语速调整 1.2x
响度归一化 LUFS -16
SenseVoice ASR
内置阿里 SenseVoice 语音识别引擎,自动将参考音频转为文字,精准用于音色克隆的 prompt 构建。
ASR Engine
参数可视化
CFG 强度、推理步数、音调、语速等核心参数均可视化调节。实时预览效果,所见即所得。
Inference Control
技术架构

端到端完整链路

从文本到音频,每一环节均有保护机制,稳定可靠

文本输入
中文 / 英文文本,最长500字
翻译模块
中英双向翻译
AI 扩散
扩散模型合成mel频谱
AudioVAE 解码
声码器转换为波形
FFmpeg 后处理
音调·语速·响度·压缩
输出音频
WAV 格式本地保存
音色克隆

用你的声音说话

上传任意语音参考,AI 自动识别音色特征,用该音色朗读任意文本。适合品牌音色定制、有声内容创作。

标准男声
中文 · 内置
播放演示
温柔女声
中文 · 内置
播放演示
英文播音
英文 · 内置
播放演示
克隆音色 A
自定义 · 用户上传
播放演示
克隆音色 B
自定义 · 用户上传
播放演示
上传你的参考音频
支持 WAV/MP3/FLAC,5~30秒,安静环境下录音效果更佳。ASR 自动识别文字,无需手动输入。
参数控制

所见即所得

每一项参数均可视化调节,实时预览效果,找到最适合你的音色与表达方式。

  • 音调调节
    -12 到 +12 半音,调整声音的高低,适配不同场景需求。
  • 语速调整
    0.5x 到 2.0x,FFmpeg atempo 滤镜驱动,音质无损。
  • 响度归一化
    loudnorm 算法统一到 LUFS -16,符合广播标准。
  • CFG 强度 & 推理步数
    CFG 0.5~4.0,步数 5~20,平衡质量与速度。
CFG 强度1.5
推理步数10
音调+3 半音
语速1.0x
响度归一化LUFS -16

探索产品详情

AI TTS 产品界面
语音合成
AI TTS
扩散模型语音合成 · 中文/英文双语支持 · 音色克隆 · 本地部署,数据不上云
语音合成 最长500字文本分段合成
音色克隆 5~30秒参考音频,高相似度还原
中英互译 内置翻译模块,实时双向转换
音频后处理 音调·语速·响度·动态压缩
文本输入
500字
翻译
中英互译
AI
扩散合成
AudioVAE
声码器
FFmpeg
后处理
WAV
输出
扩散模型 GPU 加速 SenseVoice ASR 本地部署 FFmpeg 后处理
设置中心界面
实时波形 · 语音合成中
设置中心
灵活配置
一站式设置中心,模型管理、音色管理、合成参数、输出格式,全部可控可调
模型管理 GPU / CPU 切换,模型下载与删除
音色管理 克隆音色库,添加、预览、删除
合成参数 CFG强度 / 推理步数 / 音调 / 语速
输出设置 WAV 格式 / 采样率 / 本地保存路径
音色克隆
5~30秒
SenseVoice
ASR识别
音色入库
本地存储
参数调节
实时预览
合成输出
WAV保存
GPU / CPU 切换 音色克隆管理 参数可视化 本地存储
本地部署 · 隐私优先

立即体验 AI TTS

完全本地运行,数据不上传云端
支持 GPU 加速,中英双语语音合成