从语音识别到成片合成,每个环节都做到专业级,开箱即用的完整工作流
三种本地引擎 + 三种云端引擎,自由选择
OpenAI 开源模型,支持 90+ 语言,CPU 即可运行。四档精度可选(base/small/medium/large-v3),从快速到极准自由权衡。
阿里开源,中/英/日/韩/粤,速度快 5 倍以上,中文口音识别效果好,适合短视频批量处理。
阿里达摩院,中文识别最准,自动分段 + 标点,适合长视频与专业内容。
阿里百炼 Paraformer-v2 / 火山引擎 / 腾讯云,三种云端引擎,填 Key 即用,识别率行业顶级。
10+ 家大模型接入,自动降级兜底
Kimi(kimi-k3)、DeepSeek、OpenAI 兼容(通义/302.AI 等)、百度翻译。每个模型独立 Key 配置,互不影响。
默认自动模式:Kimi DeepSeek OpenAI 百度逐级兜底,一个 Key 挂了自动切换下一个,任务不中断。
中英日韩法德西葡俄阿越泰印尼意土马来菲高棉印地乌尔都孟加拉波斯波兰荷兰捷克匈罗乌希伯来哈萨克维吾尔斯瓦希里。
Kimi 擅长复杂句子与专业术语翻译,适合科技、医疗、法律等垂直内容。
300+ 音色,从免费到顶级全覆盖
微软 Edge TTS,开箱即用零成本,覆盖全球主要语言,语速可调 -20% ~ +30%。
接入 OpenAI 兼容引擎:CosyVoice / MiniMax / IndexTTS 云端模型,音色自然度媲美真人。
支持自部署 IndexTTS / ChatTTS / CosyVoice 服务,数据完全不出内网,隐私安全。
每个音色一键试听,喜欢的点 收藏自动置顶,下次直接选。
不只是翻译,更是完整的视频工作流
自动识别多位说话人(男声/女声/儿童/老人),每人分配不同音色,还原对话场景,适合访谈、课堂、影视解说。
AI 分离人声与伴奏:影院级保留环境音氛围,录音棚级提取纯净 BGM,极速模式直接替换音轨。
双语/单语字幕、字号颜色位置描边自定义、长句折行(短剧多行)、SRT 导出、烧录进视频。
转写后逐句编辑译文、拆分合并长句、拖拽时间轴、导出 SRT 或带字幕视频,支持说话人标注。
一次选择多个视频逐个排队执行,适合批量翻译、多平台内容分发工作流。
粘贴 YouTube / B站 / 抖音等 1000+ 网站链接,自动下载并处理,无需手动保存文件。
每个工具单独使用,随取随用
输入文字 AI 语音,支持多语言多音色。
SRT 字幕 配音音频,批量上传批量合成。
音视频 SRT 字幕,多引擎多精度。
SRT AI 翻译 新 SRT,34 种语言。
视频链接 下载 转字幕,一步完成。
模糊遮挡原字幕区域,为替换新字幕做准备。
擦除原字幕 + 烧录新字幕,一步替换完成。
转写 + AI 提炼核心要点,快速掌握内容。
按起止时间秒级截取视频片段。