本地音频 · 带时间戳文字

音频转文字与 SRT 字幕

把你有权处理的录音整理成可检索、可选句的文字。先检查文件,核对时长与额度,再明确确认转写。

从自己的音频文件开始

Vidleaf 支持上传 MP3、M4A、WAV、AAC、FLAC、OGG、Opus、AMR、WMA 等常见音频,也可以直接选择 MP4 / MOV 视频:网页在你的设备上拆出音轨,只上传声音,视频本身不上传。音频文件单个最多 60 MiB;AAC 编码的 M4A 和从视频拆出的音轨,平均码率不超过 320 kbps 的不受 60 MiB 限制,按素材时长上限计。免费额度、资料包 S 和单次包支持的素材时长上限为 120 分钟;有效资料包 L 转写权益可支持最多 180 分钟,提交时还须有足够的 L 转写分钟处理整个文件。时长上限和账号可用分钟是两件事:能上传,不代表已有足额转写权益。

上传需要登录。这个入口会打开工作台的「上传本地音频或视频」;登录后返回原入口,不会替你选择文件、同意条款或开始转写。

上传前,先检查这四件事

重新压缩不会恢复听不清的声音;多人重叠讲话、噪声或远距离收音的内容,需要回听原录音核对。

实际操作:选择、同意、核对

1

打开上传并选择文件

登录后打开「上传本地音频或视频」,使用文件选择或拖放区域,一次选择一个音频或视频文件。未登录时先登录、返回后再选文件;登录不会自动发送设备上的录音。

2

阅读音频处理告知

首次使用或需要重新确认时,页面会先展示音频出境告知,列明相关处理方、数据和用途。未同意时不上传所选音频。取消后可以重新选择;同意这份告知也不等于已经确认消耗转写额度。

3

核对时长和本次用量

上传并完成文件检查后,页面展示检测到的时长、预计转写用量和可用额度。仔细核对后,再点击开始处理。需要已购权益时按确认框选择或授权相应来源;不要把「上传完成」理解为「已开始识别」。

如果文件已在同一账号下产生可用结果,重新上传相同文件可能直接打开已有文字,不需要再次创建转写任务。这个复用范围限于你的账号;它不是把其他用户的私人录音结果共享给你。

界面示例:确认之前会看到什么

下面是当前前端在隔离演示环境中的操作截图。示例时长、额度和文件名只用于说明界面;没有提交转写、调用语音服务或产生付款,不代表真实任务或账号记录。

音频或视频上传区域,展示文件选择入口、支持的格式与大小说明
① 选择入口:先检查格式和文件限制,再选择自己有权处理的音频或视频。
音频出境告知弹窗,展示处理方说明及同意和取消按钮
② 单独告知:在音频发出前阅读处理说明;取消不会替你记录同意。
转写前确认框,列出示例音频时长、预计用量、额度及开始和取消操作
③ 开始前确认:这里展示的是示例数值,使用时以你当前确认框为准。

真实案例:一段 4 分 23 秒朗读录音的转写与核对

这一节不是演示环境:2026 年 9 月 25 日在 vidleaf.app 用本站运营者的账号实际上传、转写并导出。识别服务可能更新,同一文件以后的结果可能不同。

素材是 LibriVox 发布的鲁迅《一件小事》朗读录音,Jing Li 朗读(Internet Archive 条目),MP3 格式,4 分 23 秒,约 4.2 MB。录音和作品都属于公有领域。对照用的原文取自维基文库收录的《呐喊》版本。

转写前确认框:素材时长 4.38 分钟,预计免费用量为转写 4 分 23 秒、人物 0 分 0 秒、AI 0 次
① 上传并完成文件检查后,确认框显示素材时长 4.38 分钟,预计使用免费额度转写 4 分 23 秒。点击「确认本次用量并开始」之后才开始转写。

从确认到完成约 7 秒(按任务记录的创建和完成时间),得到 26 条带时间戳的字幕。第 1–3 条是录音开头的书名、篇名和 LibriVox 声明,第 26 条是片尾的朗读者声明,整理正文时要删掉。

阅读页顶部:标题为一件小事_鲁迅_LibriVox朗读,下方显示自动语言、语音转写、26 条字幕,右侧已勾选以简体显示
② 阅读页顶部:标题下显示「26 条字幕」,右侧是「以简体显示」开关。
阅读页:已选 3 / 26 句,第 5 至 7 条被勾选,第 7 条含「固定」「扶城」「车坝上」等识别错误
③ 选中第 5–7 条后,工具栏显示「已选 3 / 26 句」,可以只导出这几句(画面已开启「以简体显示」)。第 7 条里的「固定了」「扶城」「刮尽」「刚进」「车坝上」都与原文不符。

和原文逐字对照的结果

正文(第 4–24 条)去掉标点后共 877 字,识别结果里有 57 个字与原文不一致(替换 51、少字 2、多字 4),字错率约 6.5%。计算前把繁体统一成简体,并把 1919 年原文的旧写法「罷/吧」「教/叫」「的/地」「麽/吗」算作同一个字。错字大多是同音或近音字;少数是漏字,例如「马路边上」只识别出「马路上」,无法确定是朗读还是识别造成的。

字幕识别结果原文错误类型
第 7 条路上扶城早已刮尽路上浮尘早已刮净同音字
第 7 条忽而车坝上带着一个人忽而车把上带着一个人同音字
第 9 条否则一定要在一个大尽头否则伊定要栽一个大斤斗旧用字「伊」、近音词
第 11 条便很怪她多事便很怪他多事「他」「她」同音,这里指车夫
第 17 条大约有些宁静了大约有些凝滞了近音词
第 19 条铜元Jockey寻景说铜元,交给巡警,说混入英文
第 23 条还是时时忌器还是时时记起同音词
第 24 条文质武力……紫月诗云文治武力……子曰诗云同音词、文言词

导出的 SRT 原样节选(第 18–19 条,错误未改):

18
00:03:11,100 --> 00:03:15,204
巡警走近我说你自己顾车吧他不能拉你了

19
00:03:16,316 --> 00:03:22,756
我没有思索地从外套袋里抓出一大把铜元Jockey寻景说请你给他

「顾车」应为「雇车」,「Jockey寻景」应为「交给巡警」;两条都没有标点。

这次暴露的问题和处理办法

这是安静环境里的单人朗读。会议、访谈等多人录音条件更复杂,结果可能不同;发布或引用前都应核对原录音。

当前限制与对应处理方式

项目当前边界你可以怎么做
文件类型MP3、M4A、WAV、AAC、FLAC、OGG、Opus、AMR、WMA 等音频;MP4 / MOV 视频只上传在你设备上拆出的 AAC 音轨。视频的声音不是 AAC 编码时,先在设备上导出音频;不要只修改扩展名。
单文件大小音频文件最多 60 MiB,L 包也不提高这一项。AAC 编码的 M4A 和拆出的音轨,平均码率不超过 320 kbps 的不受 60 MiB 限制,按素材时长上限计。检查文件属性;WAV 可在本地转成 AAC 编码的 M4A,或合理分段。
普通素材时长免费额度、S、单次包:单素材最多 120 分钟。同时检查剩余分钟;时长上限并非赠送分钟数。
L 长音频有效 L 转写权益支持最多 180 分钟;超过 120 分钟的整项转写仅使用 L 对应分钟。提交时须有足额 L 权益,不能靠免费额度、S 或单次包补足长音频任务。
人物识别转写完成后可以使用自动人物识别;原件从上传起最多保留约 6 小时,过期后需要重新上传同一份文件(已转写过的文件不再次计费)。人物识别按时长计量,是独立于转写的权益;请在保留期内完成,或重传后再识别。
原音播放清理原件后不提供原音回放。保留本地原录音,按文本时间戳回听核对。
格式与时长检查实际音轨、容器或时长无法读取时,文件可能被拒绝。先确认文件已导出完成且能正常播放,再重新导出或重试。
识别结果文字、标点和时间戳可能有误,不保证逐字准确。发布、引用或交付前核对关键段落,不把自动结果当作人工校对稿。

额度怎么核对:用一个长音频例子说明

假设录音长 150 分钟,文件大小也符合上传限制:即使账号还有免费分钟或 S 包分钟,也不能把这些分钟拼进这项超过 120 分钟的转写。你需要足够处理完整 150 分钟的 L 转写权益,并在提交时通过实际用量检查。L 包的 180 分钟是单素材时长上限,不是每次任务免费增加的额度。

对于不超过 120 分钟的普通任务,系统通常先使用基础额度和注册赠额,再按有效权益规则使用已购额度。具体来源和预计用量以提交前的确认框为准;额度可能因其他任务预留、已消耗、到期或冻结而变化。页面显示不可开始时,先去「我的账号 → 额度与用量」核对,不要连续反复提交。

单次包按同一素材使用:首次实际使用时绑定,启动及剩余权益有各自期限。摘要和翻译使用 AI 次数,人物识别是独立权益。转写已经完成,并不意味着后续每一项处理都不再消耗额度。当前售卖状态、价格和售后条件请查看套餐页及购买确认,不以截图里的示例数值为准。

生成文字后:核对、选择与导出

任务完成后,搜索文字里的人名、金额、日期、专业词和否定词,再回听原录音。少了「不」或小数点位置不对,含义就可能改变。重叠讲话可能被合成一个段落,不能从段落顺序推断说话人。

需要全部内容时,使用「全部 TXT / 全部 SRT」,不用逐句勾选。只保存相关几句话时先勾选,再使用所选内容导出;检查导出范围,避免把没选中的语句误认为丢失。TXT 便于继续编辑;SRT 为每条文字附带起止时间,适合导入支持字幕的工具。后续编辑文本时也应核对相应时间轴,尤其是合并或删除了句子以后。

下面仅说明 SRT 的结构,不是某次真实录音的识别结果:

1
00:00:00,000 --> 00:00:02,400
[第一段识别文字]

2
00:00:02,400 --> 00:00:05,100
[第二段识别文字]

如果继续生成摘要或翻译,应把它们当作整理与理解的辅助。需要引用原话时,返回转写文字并回听录音;摘要会压缩内容,翻译会改变表达,都不能替代对原始语句的核对。

隐私、保存与清理

本地上传生成的字幕、译文和摘要按账号隔离,不进入公开视频的跨用户结果复用。原件暂存在服务器目录,从上传起最多保留约 6 小时:转写成功的在这段时间内留给人物识别使用,转写失败或取消的当场删除;服务故障或存储错误可能使清理延迟。文字结果单独保存,原件被清理不等于文字结果也已删除。

在「我的任务」隐藏记录只是隐藏历史入口,不等于删除保存的文字。需要删除已处理结果时,按隐私政策的保留与删除说明联系支持。发送问题反馈时先提供任务状态、错误提示和发生时间;不要直接附上私人录音、登录凭证或不必要的个人信息。处理方及数据用途以当前音频告知和隐私政策为准。

常见问题

为什么选完文件还不能立即看到文字?

上传结束后还须核对时长和用量,明确点击开始。若已提交,到「我的任务」查看排队或处理状态;重复选择同一文件不会加速运行中的任务。

录音只有十几分钟,为什么仍提示额度不足?

时长上限不等于自动拥有的转写分钟。已有任务可能预留额度,权益也可能到期。先查看基础、赠额和已购部分,再核对确认框。

上传到一半失败,或者点开始后网络断了,要重来吗?

先看页面错误与「我的任务」状态。上传失败和任务已提交后失去响应不是一回事;后一种情况下服务器可能仍在处理。不要仅凭浏览器断线判断任务没有创建,也不要连续提交新的处理请求。确认没有任务后,再根据错误提示检查网络或重新导出文件。

可以给录音里的每个人自动标名字吗?

转写完成后可以使用自动人物识别:它只区分「谁在什么时候说话」,不会根据声音猜出真实姓名。原件从上传起最多保留约 6 小时,过期后重新上传同一份文件即可再识别。请自行回听并核实人物对应关系。

取消后是否一定不会再消耗额度?

在开始确认前取消不会新建转写任务。提交后的取消取决于任务所处阶段:已经被服务商接收的工作可能继续处理并产生费用。任务预留和最终用量以任务状态与账号用量记录为准,不应把关闭网页当作取消已提交的处理。

同一个文件重新上传,会重复识别吗?

同账号有可用结果时,可能直接打开已有文字。换账号、改变文件内容或原结果不可用时,不保证复用;他人的私人结果不会向你开放。

下一步