首页 价格 使用文档 新闻博客 关于我们 使用指南 English
注册
语音转文字 · 说话即出文字

语音转文字

在线把语音变成文字:直接用浏览器麦克风录制,或上传已有的录音,得到带时间轴、自动加标点的文字稿,可导出 TXT、SRT 或纯文本。

无需信用卡 · 无水印 · 浏览器直接使用
免费额度试用 67 种语言 隐私安全
speakvid.com/zh/tools/transcribe/workbench
任务
语音转文字
字幕
配音
文字转语音
S
语音转文字
进度实时可见
麦克风 · MP3 · WAV · M4A 文字 AI
麦克风 · MP3 · WAV · M4A
输出
SRT 字幕✓
配音视频✓
转写文本✓
进度72%
67+翻译语言
300+AI 音色
90识别语言
100%导出无水印
这些场景熟悉吗

传统方式又慢又贵

人工翻译、花钱请配音、等上好几天。每一条视频,创作者和团队都在浪费时间和金钱。

跳过老流程

我想把想法说出来就直接变成文字,而不是说完再回头打字。

试过的听写功能会把咳嗽声也打进去、还会自己重启,长一点的内容根本没法用。

录音已经有文件了,我只是想把文字取出来,而且要带时间轴方便回头找。

怎么用

四步搞定

上传、选语言,剩下交给 AI。无需安装任何软件。

01

打开工作台点一下麦克风——或上传已有的录音(MP3、WAV、M4A、MP4…)

几下点击就够了。

02

开始说话,需要时随时暂停、继续

几下点击就够了。

03

停止后音频会自动转写成带时间轴的稿子

几下点击就够了。

04

在编辑器里改掉人名和术语,再导出 TXT、SRT 或纯文本

几下点击就够了。

「语音转文字」其实是两种不同的产品共用一个名字,很多不爽都来自选错了那一种。第一种是实时听写:边说边出字,发消息很方便,但你每一声咳嗽、每一次停顿都会进结果里,两小时的会议根本撑不住。第二种是先录、后转:得到的是一份文档——只有说出来的内容、做完清理、带时间轴和标点。这个工具属于第二种,而且它连录音也一起做了:打开工作台点麦克风,想暂停就暂停、想继续就继续,停止后音频会自动转写成带时间轴的稿子,和上传文件完全一样。如果音频已经有了,直接上传也行:MP3、WAV、M4A、AAC、FLAC 以及各种视频容器都支持。清晰音源下准确率最高可达 98%,但该说的实话也要说——互相抢话、电话线路压缩、人声底下压着音乐,都会把准确率拉下来。要笔记和文章就导出 TXT;音频要配回视频就导出 SRT;还能翻成 67+ 种语言。计费 1 积分 / 分钟音频,注册赠 20 积分。

视语用户故事
为什么选视语

该有的都有,不该有的没有

<path d="M12 2a3 3 0 0 0-3 3v7a3 3 0 0 0 6 0V5a3 3 0 0 0-3-3z"/><path d="M19 10v2a7 7 0 0 1-14 0v-2"/><line x1="12" y1="19" x2="12" y2="22"/>

录音和转写在一个地方

不用另开录音 App 再导文件:麦克风就在工作台里,暂停/继续按正常逻辑工作,停止后音频直接进入转写。

<path d="M14 2H6a2 2 0 0 0-2 2v16a2 2 0 0 0 2 2h12a2 2 0 0 0 2-2V8z"/><polyline points="14 2 14 8 20 8"/><path d="M8 13h8"/><path d="M8 17h5"/>

产出的是文档,不是噪音记录

音频先完整录下再转写,所以输出是做完清理、带断句标点和时间轴的文档,而不是一路直播下来的口水话。

<polygon points="13 2 3 14 12 14 11 22 21 10 12 10 13 2"/>

转成文字后还能继续用

要笔记、文章就导出 TXT / 纯文本;音频属于某个视频就导出 SRT;还可以翻成别的语言,或把文字交给配音生成语音。

支持范围

输入范围与限制

浏览器里录音,直接出文字 录音中可随时暂停、继续
麦克风 · MP3 · WAV · M4A · MP4 可导出 TXT、SRT 或纯文本
无水印 导出永远干净
处理快速 几分钟,不是几天
FAQ

常见问题

怎么在线把语音变成文字?+

打开工作台点麦克风开始录音,需要时随时暂停或继续;停止后音频会自动转写成带时间轴的稿子。如果录音已经是文件,直接上传也可以(支持 MP3、WAV、M4A、AAC、FLAC 以及视频容器)。转写按 1 积分 / 分钟音频计费,注册赠 20 积分。

它和实时听写有什么区别?+

实时听写是边说边出字,咳嗽、语气词、中断全都会留在结果里;这个工具是先录完再转写,产出的是做完断句、加标点、带时间轴的干净文档——所以长录音也不会像听写那样散架。

准确率怎么样?+

清晰音源下最高约 98%:单人说话、环境安静、麦克风正常。多人抢话、电话压缩音质、口音重、人声下面有音乐,都会让准确率下降。因为每行都带时间轴,你可以直接跳到存疑的那几句去核对,不用通读全文。

支持哪些语言?+

平台覆盖 67+ 种语言,中文、英语、日语、韩语、粤语属于识别较准的。任务开始前选择音频语言(也可以交给自动识别),完成后的文字稿还能翻成 67+ 种目标语言。

转出来的文字还能做什么?+

要笔记、纪要、文章就导出 TXT 或纯文本;音频属于某个视频就导出 SRT。还可以接着翻译、配成别的语言,或把文字交给语音合成生成旁白——都在同一个任务里完成,不用把音频再跑一遍。

录音会被保留吗?+

音频只用于你发起的这次任务,完成即清理;不与第三方共享,也不用于训练。任务失败不扣积分,完成的任务会留在历史里,可以随时换格式重新导出。

还有问题? 联系我们
更多场景

你还可以做这些

准备好触达全球观众了吗?

现在试试——免费、快速、隐私安全。

进入工作台