把录音变成带时间戳的文字稿:每一行都带 HH:MM:SS 时间码,可以直接跳回原音里的那一秒。上传音频或视频,导出 SRT、VTT 或 TXT。
我有文字稿,但想找某个话题是哪一刻说的,只能在整段录音里来回拖动。
字幕对不上,因为文字是直接粘进去的,完全没有时间信息。
我需要引用一个来源,并说清它出现在音频的哪一分哪一秒。
上传、选语言,剩下交给 AI。无需安装任何软件。
几下点击就够了。
几下点击就够了。
几下点击就够了。
几下点击就够了。
文字稿告诉你“说了什么”,带时间戳的文字稿还告诉你“什么时候说的”。时间码转录就是同一份文字,只是每一行前面多了一个开始时间——而正是这一点,让文字稿不再只能用来读:你可以直接跳到某一刻,而不用在一个小时的音频里反复拖动去找;同一批句子不用手动对轴就能直接变成字幕;引用访谈时可以说“第 12 分 30 秒”;同事想核对一句话,几秒钟就能回到原音。你上传录音——播客、访谈、讲座、会议、语音条、录屏都行——选好语言,拿回来的文字稿里每一段话都锚定着一个时间码。接着你可以导出 SRT 或 VTT(它们带的就是这套时间码,正是剪辑软件期望的格式),也可以只导出 TXT 拿文字,还可以继续把文字稿翻成 30+ 种语言。时间轴来自音频本身,所以两个小时的素材也不需要先播放一遍才有时码。计费 1 积分 / 分钟音频,注册赠 20 积分,另有每日免费额度;任务失败不扣积分。
时间码来自录音本身,而不是有人重听一遍估出来的。每一段话都有自己的 HH:MM:SS 开始时间,文字和音频指的是同一个时钟。
SRT 和 VTT 按剪辑软件期望的格式带着时间码,文字可以直接回到视频上做字幕;TXT 则是你只想要文字时的选择。
带时间戳的文字稿可以翻成 30+ 种语言——这正是做外语字幕需要的:翻译后的每一行依然知道自己该在第几秒出现。
每段话前面都标有开始时间的文字稿,通常写成 HH:MM:SS。文字本身和普通文字稿一样,区别在于每一行都指向音频里的一个位置——所以这份文字可以被定位、被引用、被对轴,而不只是被读。
换了个说法的同一件事。时间码就是在生成文字的同时,把时间信息绑到每一段文字上。由于时间来自录音本身,你不需要再听一遍去标位置;如果导出成 SRT 或 VTT,这些标记本身就已经是字幕格式。
上传音频或视频文件,选好说话语言,开始处理。结果就是每行带时间码的文字稿,可导出 SRT、VTT 或 TXT。事前不需要任何设置,原文件也不会被改动。
是逐行的:每一段话(一个短语或句子)带一个开始时间,这正是字幕和引用所需要的。我们不提供逐词时间轴;对做字幕来说逐词出现通常也不好读。
常见格式的音频和视频文件都行——MP3、M4A、WAV、MP4、MOV 之类。被转写的只有音轨,所以低分辨率的视频没问题;如果你手上有单独的音轨文件,那就更好。
转录按 1 积分 / 分钟音频计费,注册赠 20 积分,另有每日免费额度,任务失败不扣积分。你可以先免费跑一个短文件看看格式,再决定要不要为长录音买积分。
我们仅使用本地存储保存您的登录状态与偏好,不使用追踪 Cookie,也不展示第三方广告。 详见 隐私政策
视语 SpeakVid 不使用追踪或广告类 Cookie,实际使用的存储仅以下一项。