AI 智能识别
把本地音频里的语音内容转成可复制文本,适合播客、采访和会议音频的后续整理。
上传本地音频文件,生成逐字稿、分段文本和可直接继续改写的文案底稿,适合播客、采访、会议和语音备忘录整理。
本地音频转写同样会消耗套餐里的转写分钟;如果当前环境还没准备好 Whisper 模型,系统会先保留原始文件供后续下载和重试。
上传前先看当前机器是否已经准备好本地转写或 OCR 依赖,避免传完才发现 Whisper 或 OCR 还没就绪。
下载可直接执行的排查脚本,覆盖 `GET /api/public/runtime-health` 预检、`WHISPER_MODEL` 检查与本地 Whisper 缓存预热,专门处理 `cache-required` 与 cached snapshot folder 缺失这类本地转写问题。
这页按音频上传工具的公开结构组织内容,能力描述只基于当前可验证的处理链路。
把本地音频里的语音内容转成可复制文本,适合播客、采访和会议音频的后续整理。
只要本地 Whisper 模型可用,常见多语种音频都可以尝试转写,但质量仍取决于音源条件。
前端按 `audio/*` 接受上传,常见 MP3、WAV、M4A、AAC、FLAC 等格式通常更稳。
音频页比视频页更纯粹,不需要额外处理视频容器,所以更适合高频做会议纪要和播客留档。
短音频通常更快完成;长音频则更依赖本地机器性能、说话人数和背景噪音复杂度。
上传文件默认保存在 `storage/uploads`,并通过任务权限控制结果访问。
上传后自动进入任务队列,结果页可直接复制文本、导出文件或继续改写。
很多内容团队的原始资料其实来自语音,而不是视频,这页就是为了这些高频场景准备的。
把会议录音快速转成可搜索文本,再抽取待办项、决策点和重点结论。
把节目、访谈和调研录音转成可引用文本,方便后续写稿或分析。
将播客、口播和采访录音转成摘要、图文或短视频脚本,为多渠道分发做准备。
针对课程音频、语音笔记和随手录音做统一转写,便于建立长期知识库。
这里保留公开用户最关心的使用说明,只写当前实现已经落地的上传限制、准确率预期和处理节奏。
新账号默认带月度本地转写分钟,适合先跑通基础音频文案提取流程。
本地音频成功进入转写链路后,会按结果时长计入套餐分钟,而不是按上传次数简单扣减。
服务端会对本地音频执行 100MB 硬限制,更长录音建议按章节拆分、压缩或整理成多个任务。
单人清晰发音通常更稳,多人重叠、远场录音和强背景音乐会显著降低结果质量。
如果本地还没准备好 Whisper 模型,系统会先保留原始音频文件并明确提示后续重试。
章节化处理更方便做人工校对、摘要整理和后续知识归档。
这页按音频上传工具的公开结构组织内容,重点是本地上传、转写和后续文本整理。
点击或拖拽上传本地音频文件。适合播客、采访、语音会议、录音备忘和课程音频整理。
系统会按任务方式识别音频时长并执行本地转写;若当前环境缺少 Whisper 模型,则会保留原始文件并返回明确的降级提示。
完成后可以复制逐字稿、整理摘要、导出文件,或者继续进入文案改写与口播稿改写流程。
这里整理的是本地音频上传页最常先被问到的公开问题。
前端按 `audio/*` 接受本地上传,常见的 MP3、WAV、M4A、AAC、FLAC、OGG 等格式通常更稳。最终兼容性仍会受到浏览器 MIME 识别、解码环境和文件本身完整性影响。
当前开源实现对本地上传音频实行 100MB 硬限制。超过上限时建议先按章节拆分、压缩,或先整理成多个任务;即使没有超限,浏览器上传能力、服务器资源、任务耗时和当前环境的转写能力也仍会影响稳定性。
处理时长主要受音频长度、说话人数、背景噪音、本地机器性能和 Whisper 模型是否就绪影响。长音频建议按章节拆分,当前环境若缺少模型则会先退回到“保留原始文件”的安全结果。
我们不承诺固定准确率百分比。单人清晰发音、低噪音的音源通常更稳;多人重叠发言、远场录音和强背景音乐会显著降低结果质量。
只要本地 faster-whisper / Whisper 模型可用,常见多语种音频都可以尝试转写;但混合语言、专业术语和口音场景的稳定性会有所不同。
上传文件默认保存在当前项目的 `storage/uploads`,并通过任务权限控制访问。对于自托管部署,仍建议你根据合规和清理要求进一步补充存储生命周期策略。