交叠发言,也保留对话上下文
多人同时开口时,Seply 会把检测到的发言按时间放在同一个对话视图中。你可以查看交叠位置、播放原音并直接纠正台词,而不必手工重建对话。
复杂串音、背景噪声和录音质量会影响自动转写结果,发布前应结合原音复核。
在线转写工作区
上传最大 1 GB 或 10 小时的音频与视频。自动检测语言、生成逐词时间信息和说话人标签,并在私密保存 30 天的工作区中完成复核。
支持 MP3、WAV、M4A、MP4、MOV 等格式 · 最大 1 GB 或 10 小时
Transcript settings
为对话和会议中检测到的不同声音自动添加标签。
每开始 3 分钟消耗 1 Credit,最低 1 Credit
为真实对话而设计
一份真正可用的转写结果需要上下文。以下五项能力共同帮助你检查复杂对话、纠正归属、核对原音,并把文字送入下一步工作。
多人同时开口时,Seply 会把检测到的发言按时间放在同一个对话视图中。你可以查看交叠位置、播放原音并直接纠正台词,而不必手工重建对话。
复杂串音、背景噪声和录音质量会影响自动转写结果,发布前应结合原音复核。
Speaker diarization 按检测到的声音整理带时间的词语,用于回答“谁在什么时候说话”。它会生成稳定的说话人标签,但不会把声音识别成现实中的具体身份。
检测结果默认使用“说话人 1”“说话人 2”等中性标签。
第一个原型完成后,最大的变化是什么?
我们不再猜测,而是开始认真听用户的电话。
2 检测到的声音
只查看某位参与者的台词,比较检测到的发言时长,全局修改说话人名称,或把单句台词重新指定给另一位说话人。保存后的修改会进入复制文本和导出文件。
处理完成后,说话人名称和台词归属仍可继续调整。
13:48 · 56.9%
10:28 · 43.1%
每段台词都保留开始和结束时间。点击时间即可播放对应原音,播放时自动跟随当前台词,也可以暂停跟随并搜索或检查某段引用。
逐词时间信息让核对更精确,无需反复播放整段文件。
当前台词 · 18:43
我们不再猜测,而是开始认真听用户的电话。
在原音旁边修改措辞、保存校对后的对话,无需再切换到其他文档。下载 TXT、SRT、VTT 或 JSON 时,将使用保存后的台词和说话人名称。
可编辑转写结果与源文件会私密保存 30 天。
可编辑转写结果与源文件会私密保存 30 天。
不止一份平面文本
普通转换工具可以返回若干段落;Seply 将原音、时间、说话人和修改持续关联,让自动转写结束后的结果仍然可以检查和使用。
内容合并或难以追溯
带时间的发言保留上下文
只有普通段落
每轮发言都有声音标签
手工重写全文
筛选、改名或重新指定
需要单独打开播放器
点击台词即可播放对应位置
移动到其他编辑器
在原音旁修改并保存
静态文本文件
校对后的 TXT、SRT、VTT 或 JSON
工作方式
选择支持的音频或视频。大文件会直接上传到私有存储,处理前即可看到预计消耗。
自动检测语言、语音、时间、声音事件和说话人变化,同时保留源录音供后续复核。
搜索台词、筛选说话人、定位时间轴、在线修改,并按下一项工作的需要下载结果。
服务真实语音工作
区分参与者,根据原音核对决定,并把校对后的对话整理成可靠会议记录。
清楚区分主持人与嘉宾,寻找可引用片段,并生成带姓名的文稿或字幕。
筛选单个声音、搜索回答、播放精确时间点,为研究或编辑保留原始措辞。
在线修改带时间的台词,直接导出校对后的 SRT 或 WebVTT。
概念说明
说话人分段标注(speaker diarization)是按照“谁在说话”把录音切分成带时间片段的过程。它为检测到的不同声音添加稳定标签,用于回答“谁在什么时候说了什么”。
Diarization 只标注转写文本中的不同声音,不会生成独立音轨,也不会验证现实身份。如果你需要为每位说话人生成单独的音频文件,请使用 Speaker Separation。
常见问题
语音转文字把音频中的话语转换成书面文字。Seply 进一步加入说话人标签、逐词时间、原音播放、搜索、编辑和导出,让文字始终可以追溯到录音。
Seply 会尽量保留转写引擎检测到的交叠发言及其上下文。严重串音、背景噪声、麦克风距离和录音质量会影响结果,因此工作区会保留台词与原音的关联供复核。
系统按照检测到的声音整理带时间的词语,并为每轮发言添加标签。这些标签用于区分文件中的声音,不用于确认任何人的现实身份。
可以。你可以全局修改说话人名称,把台词指定给现有说话人,新增标签,或清除错误归属后再保存。
可以。点击时间即可跳转到对应原音。播放过程中,当前台词可以自动跟随音频位置。
可以。在工作区中逐段修改台词并保存,复制和下载时会使用校对后的文字与说话人名称。
支持 MP3、WAV、M4A、AAC、FLAC、OGG、WebM、MP4、MOV、MKV 和 AVI 等常见格式,可导出 TXT、SRT、WebVTT 或 JSON。
源媒体和生成的转写结果会私密保存 30 天,也可以在 Dashboard 中提前删除。
对话结束后,工作才刚开始
上传一段录音,在同一个私密工作区中查看说话人和时间、核对原音、修改台词,并导出已经校对的结果。