Skip to content

保留说话人上下文的转写

把多人对话转成可编辑、可追溯的文字。

将录音中的交叠发言转成可搜索、可编辑的文字,同时保留谁在何时说了什么。Seply 自动检测说话人变化,让每句台词对应原音,并在导出前提供完整的在线校对工作区。

用户访谈.mp4

42:18 · 中文 · 2 位说话人

可以开始校对
检测到交叠发言
林悦 · 主持人18:42

第一个原型完成后,最大的变化是什么?

陈默 · 嘉宾18:43当前台词

我们不再猜测,而是开始认真听用户的电话。

  • 交叠语音识别
  • 说话人分段标注
  • 台词与时间轴联动
  • 在线修改台词

在线转写工作区

在线完成语音转文字,再逐句校对。

上传最大 1 GB 或 10 小时的音频与视频。自动检测语言、生成逐词时间信息和说话人标签,并在私密保存 30 天的工作区中完成复核。

将音频或视频拖到这里

支持 MP3、WAV、M4A、MP4、MOV 等格式 · 最大 1 GB 或 10 小时

Transcript settings

为对话和会议中检测到的不同声音自动添加标签。

每开始 3 分钟消耗 1 Credit,最低 1 Credit

为真实对话而设计

不只生成文字,更保留对话中的说话人和时间。

一份真正可用的转写结果需要上下文。以下五项能力共同帮助你检查复杂对话、纠正归属、核对原音,并把文字送入下一步工作。

交叠发言,也保留对话上下文

多人同时开口时,Seply 会把检测到的发言按时间放在同一个对话视图中。你可以查看交叠位置、播放原音并直接纠正台词,而不必手工重建对话。

复杂串音、背景噪声和录音质量会影响自动转写结果,发布前应结合原音复核。

准确的说话人分段标注

Speaker diarization 按检测到的声音整理带时间的词语,用于回答“谁在什么时候说话”。它会生成稳定的说话人标签,但不会把声音识别成现实中的具体身份。

检测结果默认使用“说话人 1”“说话人 2”等中性标签。

筛选、改名并重新指定说话人

只查看某位参与者的台词,比较检测到的发言时长,全局修改说话人名称,或把单句台词重新指定给另一位说话人。保存后的修改会进入复制文本和导出文件。

处理完成后,说话人名称和台词归属仍可继续调整。

全部说话人24:16
Maya

13:48 · 56.9%

Daniel

10:28 · 43.1%

Maya · 筛选已开启改名

每句台词都与时间轴对应

每段台词都保留开始和结束时间。点击时间即可播放对应原音,播放时自动跟随当前台词,也可以暂停跟随并搜索或检查某段引用。

逐词时间信息让核对更精确,无需反复播放整段文件。

正在跟随播放18:43 / 42:18

当前台词 · 18:43

我们不再猜测,而是开始认真听用户的电话。

直接在线修改台词

在原音旁边修改措辞、保存校对后的对话,无需再切换到其他文档。下载 TXT、SRT、VTT 或 JSON 时,将使用保存后的台词和说话人名称。

可编辑转写结果与源文件会私密保存 30 天。

已修改台词 已保存
第一个原型完成后,最大的变化是什么?
可以导出
TXTSRTVTTJSON

可编辑转写结果与源文件会私密保存 30 天。

不止一份平面文本

Seply 为基础语音转文字增加了什么

普通转换工具可以返回若干段落;Seply 将原音、时间、说话人和修改持续关联,让自动转写结束后的结果仍然可以检查和使用。

交叠对话

基础平面转写结果

内容合并或难以追溯

Seply 工作区

带时间的发言保留上下文

说话人归属

基础平面转写结果

只有普通段落

Seply 工作区

每轮发言都有声音标签

说话人管理

基础平面转写结果

手工重写全文

Seply 工作区

筛选、改名或重新指定

核对原音

基础平面转写结果

需要单独打开播放器

Seply 工作区

点击台词即可播放对应位置

修改内容

基础平面转写结果

移动到其他编辑器

Seply 工作区

在原音旁修改并保存

交付结果

基础平面转写结果

静态文本文件

Seply 工作区

校对后的 TXT、SRT、VTT 或 JSON

工作方式

从录音到可编辑文字,只需三步。

  1. 01

    私密上传

    选择支持的音频或视频。大文件会直接上传到私有存储,处理前即可看到预计消耗。

  2. 02

    带上下文转写

    自动检测语言、语音、时间、声音事件和说话人变化,同时保留源录音供后续复核。

  3. 03

    检查、修改与导出

    搜索台词、筛选说话人、定位时间轴、在线修改,并按下一项工作的需要下载结果。

服务真实语音工作

为需要上下文的多人对话生成文字。

会议

区分参与者,根据原音核对决定,并把校对后的对话整理成可靠会议记录。

播客

清楚区分主持人与嘉宾,寻找可引用片段,并生成带姓名的文稿或字幕。

访谈

筛选单个声音、搜索回答、播放精确时间点,为研究或编辑保留原始措辞。

视频字幕

在线修改带时间的台词,直接导出校对后的 SRT 或 WebVTT。

概念说明

什么是说话人分段标注?

说话人分段标注(speaker diarization)是按照“谁在说话”把录音切分成带时间片段的过程。它为检测到的不同声音添加稳定标签,用于回答“谁在什么时候说了什么”。

Diarization 只标注转写文本中的不同声音,不会生成独立音轨,也不会验证现实身份。如果你需要为每位说话人生成单独的音频文件,请使用 Speaker Separation。

常见问题

关于语音转文字,你可能还想了解这些。

什么是语音转文字?

语音转文字把音频中的话语转换成书面文字。Seply 进一步加入说话人标签、逐词时间、原音播放、搜索、编辑和导出,让文字始终可以追溯到录音。

Seply 可以转写重叠语音吗?

Seply 会尽量保留转写引擎检测到的交叠发言及其上下文。严重串音、背景噪声、麦克风距离和录音质量会影响结果,因此工作区会保留台词与原音的关联供复核。

说话人分段标注如何工作?

系统按照检测到的声音整理带时间的词语,并为每轮发言添加标签。这些标签用于区分文件中的声音,不用于确认任何人的现实身份。

可以修改说话人名称或归属吗?

可以。你可以全局修改说话人名称,把台词指定给现有说话人,新增标签,或清除错误归属后再保存。

可以把台词对应到原始音频吗?

可以。点击时间即可跳转到对应原音。播放过程中,当前台词可以自动跟随音频位置。

可以在线修改转写结果吗?

可以。在工作区中逐段修改台词并保存,复制和下载时会使用校对后的文字与说话人名称。

支持哪些文件与导出格式?

支持 MP3、WAV、M4A、AAC、FLAC、OGG、WebM、MP4、MOV、MKV 和 AVI 等常见格式,可导出 TXT、SRT、WebVTT 或 JSON。

文件会保存多久?

源媒体和生成的转写结果会私密保存 30 天,也可以在 Dashboard 中提前删除。

对话结束后,工作才刚开始

把语音变成经得起复核的文字。

上传一段录音,在同一个私密工作区中查看说话人和时间、核对原音、修改台词,并导出已经校对的结果。

开始转写