免费声音转文字/音频转文字工具 - 本地AI语音识别与字幕生成

正在检测硬件加速...

专为对隐私安全与免费转写有高要求的用户打造的纯本地声音转文字工具。支持 MP3、M4A、WAV 等声音与录音文件,100% 浏览器离线识别,一键导出 SRT、Word、TXT、Markdown。

📁

点击上传或将音频/视频文件拖拽至此处

支持 MP3, WAV, M4A, AAC, OGG, WebM, MP4, MOV 等格式

快速测试:

100% 浏览器本地离线音视频转文字

专为对隐私安全、格式兼容性及免费离线有极高要求的用户打造。无需注册登录,音频与视频文件绝不离开您的设备,直接利用电脑/手机本地算力完成高质量 AI 语音识别。

🔒
100% 本地隐私安全文件与文本均在浏览器本地内存处理,断网亦可顺畅运行,从根源杜绝数据泄露
WebGPU 显卡硬件加速优先调用设备独立/集成 GPU 算力,大幅提升转写速度;不支持时自动平滑回退至 WASM
🎬
音视频格式全兼容无需手动转码,MP4/MOV/WebM 视频与 MP3/M4A/WAV 音频直接拖入即可自动流式提取音轨
📑
全格式字幕与笔记导出一键导出剪映/PR标准 SRT 字幕、Notion/Obsidian Markdown 笔记、Word 文档及纯文本

如何使用

1

选择或拖入文件

上传您的音频 (MP3/M4A/WAV) 或视频 (MP4/MOV) 文件,系统自动完成音轨提取

2

选择模型与语言

默认推荐 Base 平衡模型;手机端建议选 Tiny;桌面高清可选择 Small

3

启动本地推理

点击开始转录,模型首次自动缓存到浏览器 IndexedDB,后续离线秒开

4

复制或导出文件

在结果面板实时预览分段文字,可一键复制或导出为 SRT、Word、Markdown

排错与避坑清单

手机端或低配设备内存溢出 (OOM)

移动端浏览器可用内存有限,强烈建议选用 Tiny 或 Base 模型;避免在手机端加载 Small 高清模型。

WebGPU 状态与硬件加速支持

Chrome/Edge 113+ 及现代 Safari 默认支持 WebGPU。如遇显卡驱动限制,工具会自动降级为 WASM 模式运行。

背景音乐或长时间静音产生重复幻觉

Whisper 在处理大段静音或纯音乐时可能输出重复文本,建议尽量输入人声清晰的录音文件。

特殊视频编码无法解析

若极少数非标编码视频无法在浏览器解码,可先用手机自带工具导出为 M4A/MP3 音频后再上传。

开源模型与技术溯源

本工具严格基于权威开源模型与官方推理框架构建,所有代码、模型权重与运行逻辑完全公开透明、可审计。

OpenAI Official

OpenAI Whisper 官方核心

采用 OpenAI 官方开源的 Whisper 语音识别模型架构 (MIT 许可证),具备超强多语言通用识别与时间戳对齐能力。

OpenAI Whisper 官方 GitHub 仓库 →
Hugging Face

Hugging Face Transformers.js

由 Hugging Face 官方维护的 WebGPU / WASM 浏览器端深度学习推理引擎 (Apache-2.0 许可证),保障本地流畅推理。

Transformers.js 官方文档与开源代码 →
ONNX Community

ONNX Community 官方权重源

Tiny、Base 和 Small 均直接采用 Hugging Face 官方 onnx-community 仓库标准多语言权重,杜绝任何第三方篡改。

100% Client-Side

100% 客户端隐私可验证声明

您可随时按 F12 打开浏览器开发者工具 (Network 面板) 进行抓包审计:除首次下载模型文件外,整个音视频转写过程中绝无任何音频、视频或文本数据向外部服务器传输。

常见问题与技术原理

本工具是如何实现 100% 离线隐私安全的?

本站基于 Hugging Face Transformers.js 和 ONNX Runtime Web 技术,直接将 OpenAI Whisper AI 模型下载到您的浏览器缓存中并在本地硬件(GPU / CPU)上运行推理。您的音视频文件不会上传到任何服务器,断网状态下依然可以完整使用,彻底杜绝数据泄露风险。

可以直接提取 MP4 / MOV 视频里的文案台词吗?

可以。本工具内置了基于浏览器 Web Audio API 的音轨解码管道,无需您手动用格式工厂等软件转码。无论是 MP4、MOV、WebM 视频,还是 M4A 手机录音、MP3 播客,都可以直接拖入提取文案与生成字幕。

第一次使用需要下载模型,后续还会耗费流量吗?

不会。模型在首次下载后会自动保存在浏览器的 CacheStorage / IndexedDB 本地数据库中。后续再次访问或转录时直接从本地磁盘秒级加载,无需重复消耗流量。

支持导出哪些格式?可以直接导入剪映吗?

支持导出标准 .srt 字幕文件(可直接导入剪映、PR、Final Cut Pro、CapCut)、.vtt 字幕、.docx Word 会议纪要文档、.md Markdown 笔记、.txt 纯文本/时间戳文本以及 .json 原始数据,同时支持原生打印为排版整洁的 PDF。

Tiny、Base、Small 三个模型有什么区别?

不同模型的参数量、下载体积与硬件要求对比如下:

Whisper 模型参数量下载体积推荐设备与场景
Tiny (多语言) ↗39M约 41 MB手机移动端、短录音、极速预览
Base (多语言/默认) ↗74M约 77 MB通用推荐,速度与准确率平衡,支持普通话
Small (多语言) ↗244M约 249 MB桌面端高性能电脑 + WebGPU 硬件加速