把会议、访谈或播客转成带说话人标注的文字:每一行都标明是谁说的,并带时间码。在线说话人分离,免费开始。
文字稿是一整片,看不出哪一句是哪个人说的。
我得不停倒回去听,才能判断现在是谁在说。
配音版里,一段对话的两方是用同一个声音念完的。
上传、选语言,剩下交给 AI。无需安装任何软件。
几下点击就够了。
几下点击就够了。
几下点击就够了。
几下点击就够了。
访谈或会议文字稿真正难的地方不是词,而是归属。没有说话人标注时,两个人的对话会读成一整片连续的声音,你最后还是要重听一遍才能判断哪句是谁说的——那这份文字稿的意义就少了一半。转录时打开说话人分离,就会按音色把录音切开,并给每一段话标上说话人,读起来像剧本:一行一个人,带时间码,可以自上而下读完而不用回去对音频。它改变的东西比听起来多:不需要录音就能整理会议纪要,引用时能放心地标明出处,一集播客可以顺手变成一篇书面访谈。同一套标注还会延续到配音环节——当你翻译并配音一段多人录音时,可以给每个说话人配不同的声音,这样译制版不会塌缩成一个人念完整段对话。它对“少数几个、音色区分明显”的录音效果最好;同一个房间麦上抢话严重的情况,需要自己检查一遍。计费 1 积分 / 分钟音频,注册赠 20 积分,另有每日免费额度;任务失败不扣积分。
每一段话都带说话人标注,文字稿读起来像剧本而不是流水。你可以顺着某一个人的线索往下看,或者在引用时明确知道这话是谁说的。
说话人标注是加在时间码之上的,不是替换它——谁说的、什么时候说的都在,整体可以直接导出 SRT 或 VTT。
在配音环节可以为每个说话人指定不同的声音,这样译制后的多人录音听起来仍是对话,而不是一个人的独白。
就是按音色把一段录音切开,并给每一段话标上说话人的过程,这样文字稿显示的就变成“谁说了什么”,而不是一整片连续文本。这里产出的,是每一行上一个说话人标注,外加时间码。
上传录音,在转录环节打开说话人分离即可。拿回来的文字稿每一行都标有说话人和时间码,可以导出 SRT、VTT 或 TXT。不需要单独的工具——它在同一次转录里完成。
它是为常见场景做的:会议、访谈或播客里的两到四个人,音色区别比较明显。人数更多,或者几个人共用一个房间麦还频繁打断时,分界就没那么可靠了——值得通读一遍,顺手改掉个别标错的行。
标注出来的是中性标签(SPEAKER 1、SPEAKER 2 之类),因为音频本身并没有说名字。在编辑器或笔记里把它们替换成真实姓名即可——不过是几个标签的查找替换。到了配音环节,正是这套标签让你能给每个说话人配不同的声音。
行,这是很常见的做法,效果通常也不错:两个声音轮着说,每一轮都会被标上。它没法完全解决的是同时开口——当两个声音重叠在一起时,分界只能靠猜,如果发现某行归属不对,重点检查的就是这种地方。
转录按 1 积分 / 分钟音频计费,注册赠 20 积分,另有每日免费额度,任务失败不扣积分。说话人分离属于转录环节的一部分,不是额外的付费项。
我们仅使用本地存储保存您的登录状态与偏好,不使用追踪 Cookie,也不展示第三方广告。 详见 隐私政策
视语 SpeakVid 不使用追踪或广告类 Cookie,实际使用的存储仅以下一项。