打开上传并选择文件
登录后打开「上传本地音频或视频」,使用文件选择或拖放区域,一次选择一个音频或视频文件。未登录时先登录、返回后再选文件;登录不会自动发送设备上的录音。
把你有权处理的录音整理成可检索、可选句的文字。先检查文件,核对时长与额度,再明确确认转写。
Vidleaf 支持上传 MP3、M4A、WAV、AAC、FLAC、OGG、Opus、AMR、WMA 等常见音频,也可以直接选择 MP4 / MOV 视频:网页在你的设备上拆出音轨,只上传声音,视频本身不上传。音频文件单个最多 60 MiB;AAC 编码的 M4A 和从视频拆出的音轨,平均码率不超过 320 kbps 的不受 60 MiB 限制,按素材时长上限计。免费额度、资料包 S 和单次包支持的素材时长上限为 120 分钟;有效资料包 L 转写权益可支持最多 180 分钟,提交时还须有足够的 L 转写分钟处理整个文件。时长上限和账号可用分钟是两件事:能上传,不代表已有足额转写权益。
上传需要登录。这个入口会打开工作台的「上传本地音频或视频」;登录后返回原入口,不会替你选择文件、同意条款或开始转写。
重新压缩不会恢复听不清的声音;多人重叠讲话、噪声或远距离收音的内容,需要回听原录音核对。
登录后打开「上传本地音频或视频」,使用文件选择或拖放区域,一次选择一个音频或视频文件。未登录时先登录、返回后再选文件;登录不会自动发送设备上的录音。
首次使用或需要重新确认时,页面会先展示音频出境告知,列明相关处理方、数据和用途。未同意时不上传所选音频。取消后可以重新选择;同意这份告知也不等于已经确认消耗转写额度。
上传并完成文件检查后,页面展示检测到的时长、预计转写用量和可用额度。仔细核对后,再点击开始处理。需要已购权益时按确认框选择或授权相应来源;不要把「上传完成」理解为「已开始识别」。
如果文件已在同一账号下产生可用结果,重新上传相同文件可能直接打开已有文字,不需要再次创建转写任务。这个复用范围限于你的账号;它不是把其他用户的私人录音结果共享给你。
下面是当前前端在隔离演示环境中的操作截图。示例时长、额度和文件名只用于说明界面;没有提交转写、调用语音服务或产生付款,不代表真实任务或账号记录。



这一节不是演示环境:2026 年 9 月 25 日在 vidleaf.app 用本站运营者的账号实际上传、转写并导出。识别服务可能更新,同一文件以后的结果可能不同。
素材是 LibriVox 发布的鲁迅《一件小事》朗读录音,Jing Li 朗读(Internet Archive 条目),MP3 格式,4 分 23 秒,约 4.2 MB。录音和作品都属于公有领域。对照用的原文取自维基文库收录的《呐喊》版本。

从确认到完成约 7 秒(按任务记录的创建和完成时间),得到 26 条带时间戳的字幕。第 1–3 条是录音开头的书名、篇名和 LibriVox 声明,第 26 条是片尾的朗读者声明,整理正文时要删掉。


正文(第 4–24 条)去掉标点后共 877 字,识别结果里有 57 个字与原文不一致(替换 51、少字 2、多字 4),字错率约 6.5%。计算前把繁体统一成简体,并把 1919 年原文的旧写法「罷/吧」「教/叫」「的/地」「麽/吗」算作同一个字。错字大多是同音或近音字;少数是漏字,例如「马路边上」只识别出「马路上」,无法确定是朗读还是识别造成的。
| 字幕 | 识别结果 | 原文 | 错误类型 |
|---|---|---|---|
| 第 7 条 | 路上扶城早已刮尽 | 路上浮尘早已刮净 | 同音字 |
| 第 7 条 | 忽而车坝上带着一个人 | 忽而车把上带着一个人 | 同音字 |
| 第 9 条 | 否则一定要在一个大尽头 | 否则伊定要栽一个大斤斗 | 旧用字「伊」、近音词 |
| 第 11 条 | 便很怪她多事 | 便很怪他多事 | 「他」「她」同音,这里指车夫 |
| 第 17 条 | 大约有些宁静了 | 大约有些凝滞了 | 近音词 |
| 第 19 条 | 铜元Jockey寻景说 | 铜元,交给巡警,说 | 混入英文 |
| 第 23 条 | 还是时时忌器 | 还是时时记起 | 同音词 |
| 第 24 条 | 文质武力……紫月诗云 | 文治武力……子曰诗云 | 同音词、文言词 |
导出的 SRT 原样节选(第 18–19 条,错误未改):
18 00:03:11,100 --> 00:03:15,204 巡警走近我说你自己顾车吧他不能拉你了 19 00:03:16,316 --> 00:03:22,756 我没有思索地从外套袋里抓出一大把铜元Jockey寻景说请你给他
「顾车」应为「雇车」,「Jockey寻景」应为「交给巡警」;两条都没有标点。
这是安静环境里的单人朗读。会议、访谈等多人录音条件更复杂,结果可能不同;发布或引用前都应核对原录音。
| 项目 | 当前边界 | 你可以怎么做 |
|---|---|---|
| 文件类型 | MP3、M4A、WAV、AAC、FLAC、OGG、Opus、AMR、WMA 等音频;MP4 / MOV 视频只上传在你设备上拆出的 AAC 音轨。 | 视频的声音不是 AAC 编码时,先在设备上导出音频;不要只修改扩展名。 |
| 单文件大小 | 音频文件最多 60 MiB,L 包也不提高这一项。AAC 编码的 M4A 和拆出的音轨,平均码率不超过 320 kbps 的不受 60 MiB 限制,按素材时长上限计。 | 检查文件属性;WAV 可在本地转成 AAC 编码的 M4A,或合理分段。 |
| 普通素材时长 | 免费额度、S、单次包:单素材最多 120 分钟。 | 同时检查剩余分钟;时长上限并非赠送分钟数。 |
| L 长音频 | 有效 L 转写权益支持最多 180 分钟;超过 120 分钟的整项转写仅使用 L 对应分钟。 | 提交时须有足额 L 权益,不能靠免费额度、S 或单次包补足长音频任务。 |
| 人物识别 | 转写完成后可以使用自动人物识别;原件从上传起最多保留约 6 小时,过期后需要重新上传同一份文件(已转写过的文件不再次计费)。 | 人物识别按时长计量,是独立于转写的权益;请在保留期内完成,或重传后再识别。 |
| 原音播放 | 清理原件后不提供原音回放。 | 保留本地原录音,按文本时间戳回听核对。 |
| 格式与时长检查 | 实际音轨、容器或时长无法读取时,文件可能被拒绝。 | 先确认文件已导出完成且能正常播放,再重新导出或重试。 |
| 识别结果 | 文字、标点和时间戳可能有误,不保证逐字准确。 | 发布、引用或交付前核对关键段落,不把自动结果当作人工校对稿。 |
假设录音长 150 分钟,文件大小也符合上传限制:即使账号还有免费分钟或 S 包分钟,也不能把这些分钟拼进这项超过 120 分钟的转写。你需要足够处理完整 150 分钟的 L 转写权益,并在提交时通过实际用量检查。L 包的 180 分钟是单素材时长上限,不是每次任务免费增加的额度。
对于不超过 120 分钟的普通任务,系统通常先使用基础额度和注册赠额,再按有效权益规则使用已购额度。具体来源和预计用量以提交前的确认框为准;额度可能因其他任务预留、已消耗、到期或冻结而变化。页面显示不可开始时,先去「我的账号 → 额度与用量」核对,不要连续反复提交。
单次包按同一素材使用:首次实际使用时绑定,启动及剩余权益有各自期限。摘要和翻译使用 AI 次数,人物识别是独立权益。转写已经完成,并不意味着后续每一项处理都不再消耗额度。当前售卖状态、价格和售后条件请查看套餐页及购买确认,不以截图里的示例数值为准。
任务完成后,搜索文字里的人名、金额、日期、专业词和否定词,再回听原录音。少了「不」或小数点位置不对,含义就可能改变。重叠讲话可能被合成一个段落,不能从段落顺序推断说话人。
需要全部内容时,使用「全部 TXT / 全部 SRT」,不用逐句勾选。只保存相关几句话时先勾选,再使用所选内容导出;检查导出范围,避免把没选中的语句误认为丢失。TXT 便于继续编辑;SRT 为每条文字附带起止时间,适合导入支持字幕的工具。后续编辑文本时也应核对相应时间轴,尤其是合并或删除了句子以后。
下面仅说明 SRT 的结构,不是某次真实录音的识别结果:
1 00:00:00,000 --> 00:00:02,400 [第一段识别文字] 2 00:00:02,400 --> 00:00:05,100 [第二段识别文字]
如果继续生成摘要或翻译,应把它们当作整理与理解的辅助。需要引用原话时,返回转写文字并回听录音;摘要会压缩内容,翻译会改变表达,都不能替代对原始语句的核对。
本地上传生成的字幕、译文和摘要按账号隔离,不进入公开视频的跨用户结果复用。原件暂存在服务器目录,从上传起最多保留约 6 小时:转写成功的在这段时间内留给人物识别使用,转写失败或取消的当场删除;服务故障或存储错误可能使清理延迟。文字结果单独保存,原件被清理不等于文字结果也已删除。
在「我的任务」隐藏记录只是隐藏历史入口,不等于删除保存的文字。需要删除已处理结果时,按隐私政策的保留与删除说明联系支持。发送问题反馈时先提供任务状态、错误提示和发生时间;不要直接附上私人录音、登录凭证或不必要的个人信息。处理方及数据用途以当前音频告知和隐私政策为准。
上传结束后还须核对时长和用量,明确点击开始。若已提交,到「我的任务」查看排队或处理状态;重复选择同一文件不会加速运行中的任务。
时长上限不等于自动拥有的转写分钟。已有任务可能预留额度,权益也可能到期。先查看基础、赠额和已购部分,再核对确认框。
先看页面错误与「我的任务」状态。上传失败和任务已提交后失去响应不是一回事;后一种情况下服务器可能仍在处理。不要仅凭浏览器断线判断任务没有创建,也不要连续提交新的处理请求。确认没有任务后,再根据错误提示检查网络或重新导出文件。
转写完成后可以使用自动人物识别:它只区分「谁在什么时候说话」,不会根据声音猜出真实姓名。原件从上传起最多保留约 6 小时,过期后重新上传同一份文件即可再识别。请自行回听并核实人物对应关系。
在开始确认前取消不会新建转写任务。提交后的取消取决于任务所处阶段:已经被服务商接收的工作可能继续处理并产生费用。任务预留和最终用量以任务状态与账号用量记录为准,不应把关闭网页当作取消已提交的处理。
同账号有可用结果时,可能直接打开已有文字。换账号、改变文件内容或原结果不可用时,不保证复用;他人的私人结果不会向你开放。