免费视频转文字工具 - 本地AI视频字幕提取与转文本

正在检测硬件加速...

100%免费视频转文字与字幕提取工具,基于浏览器端 OpenAI Whisper 与 WebGPU 纯本地运行。支持 MP4、MOV、WebM、MKV 视频,无需上传数GB大视频,秒级提取音轨,一键生成剪映/PR标准 SRT、VTT 字幕与 Word、Markdown 文本。

🎬

点击上传或将视频/音频文件拖拽至此处

支持 MP4, MOV, WebM, MKV, AVI, MP3, M4A 等全部主流格式

快速测试:
🔒100% 浏览器本地流式提取音轨 · 无需上传数 GB 大视频 · 零带宽损耗

为什么选择 100% 浏览器本地视频转文字?

解决传统视频转文字平台“上传慢、文件大受限、收费高、隐私泄露”四大痛点。直接利用您电脑本地算力,数 GB 视频无需上传即可秒级完成音轨剥离与高精度字幕生成。

🚀
告别慢速上传与大小限制视频无需传到云端,哪怕几 GB 的 4K 视频也能秒级完成本地音轨提取,极速省流
WebGPU 显卡本地加速直接调用本地显卡 GPU 进行深度学习推理,转写速度较纯 CPU 提升 5-10 倍
🎬
专业剪辑字幕直接导出一键导出标准 .srt / .vtt 格式字幕,可无缝拖入剪映、Premiere Pro、Final Cut Pro 剪辑
🔒
100% 商业与创作隐私保障未公开的视频素材、商务会议视频、内部课程绝不离开您的设备,断网亦可顺畅运行

视频转文字与字幕提取操作指南

1

选择或拖入视频

将 MP4、MOV、WebM 或 MKV 等格式的视频文件直接拖入上传区,系统会自动进行本地音轨流式提取。

2

选择识别语言与模型

推荐使用默认的 Whisper Base 模型,能够完美兼顾中英等多语言的高识别准确率与本地处理速度。

3

本地开始极速转写

点击“开始提取字幕”,模型直接在浏览器 Worker 线程运行,实时生成带精确起止时间戳的字幕轴。

4

一键导出 SRT 或 Word 文档

根据剪辑或文档需求,自由选择导出 .srt 字幕文件、Markdown 视频笔记、Word 逐字稿或一键复制。

视频转文字常见排查建议

超大高清 4K 视频会不会卡死网页?

不会。本工具通过 Web Audio API 只流式解码视频的音轨数据,视频画面不会占用网页显存,即使数 GB 视频也能稳定运行。

首次加载模型速度较慢?

首次使用需从 CDN 下载一次 Whisper 模型权重(约几十MB),下载后浏览器会自动 Cache 缓存,之后断网亦可秒开秒用。

导出的 SRT 字幕时间轴是否准确?

Whisper 模型自带 VAD 语音活性检测与时间戳对齐能力,生成的 SRT 字幕可直接导入剪映与 PR 进行精准对轴。

如何提升中英文混杂视频的准确率?

如果视频中有较多中英文夹杂或专业术语,建议在模型下拉框中选择高精度的 Small 模型。

开源模型与技术溯源

本工具严格基于权威开源模型与官方推理框架构建,所有代码、模型权重与运行逻辑完全公开透明、可审计。

OpenAI Official

OpenAI Whisper 官方核心

采用 OpenAI 官方开源的 Whisper 语音识别模型架构 (MIT 许可证),具备超强多语言通用识别与时间戳对齐能力。

OpenAI Whisper 官方 GitHub 仓库 →
Hugging Face

Hugging Face Transformers.js

由 Hugging Face 官方维护的 WebGPU / WASM 浏览器端深度学习推理引擎 (Apache-2.0 许可证),保障本地流畅推理。

Transformers.js 官方文档与开源代码 →
ONNX Community

ONNX Community 官方权重源

Tiny、Base 和 Small 均直接采用 Hugging Face 官方 onnx-community 仓库标准多语言权重,杜绝任何第三方篡改。

100% Client-Side

100% 客户端隐私可验证声明

您可随时按 F12 打开浏览器开发者工具 (Network 面板) 进行抓包审计:除首次下载模型文件外,整个音视频转写过程中绝无任何音频、视频或文本数据向外部服务器传输。

视频转文字常见问题 (FAQ)

什么是 Whisper?为什么它做视频转文字更准?

Whisper 是 OpenAI 开源的大规模多任务语音识别模型。经过 68 万小时网络音频弱监督训练,能够自动过滤视频中的背景音乐、环境杂音并保持高准确率。

MP4 / MOV 视频是如何在本地转出文字的?

浏览器调用 Web Audio API 的 AudioContext 接口,在前端直接剥离容器中的音轨并重采样为 16kHz 单声道 Float32 数组,再送入 Whisper 模型生成字幕。

离线缓存是如何工作的?

模型文件首次加载后存储在浏览器的 Cache API 和 IndexedDB 中。二次使用时直接从本地磁盘调用,无需重复消耗流量。

导出的 SRT 字幕如何直接导入剪辑软件?

导出的 .srt 文件采用标准的 UTF-8 编码与毫秒级时间戳,直接将 .srt 文件拖入剪映或 Premiere Pro 轨道即可自动生成带时间轴的字幕。

各版本 Whisper 模型在视频转文字中的对比

根据视频长度与设备性能选择合适模型:

模型型号参数量INT8 体积推荐场景
Whisper Tiny ↗39M41 MB手机端、超长视频快速粗剪预览
Whisper Base (推荐) ↗74M77 MB默认推荐,视频字幕制作平衡之选
Whisper Small ↗244M237 MB高要求专业访谈、学术视频