外语视频没字幕?本地生成中文字幕
WhisperSubTranslate 可以把外语视频转成 SRT 字幕,再翻译成中文;默认走本地识别和本地翻译,适合处理不想上传的视频。


有些外语视频最烦人:能勉强听懂一点,却找不到合适的字幕。网上搜到的 SRT 经常版本不对,时间轴慢半拍,看到一半还要手工调。
WhisperSubTranslate 解决的就是这个小痛点:把视频拖进去,先从音轨生成 SRT 字幕,再把字幕翻译成中文。它是一个开源桌面应用,Windows 下下载压缩包、解压、运行 WhisperSubTranslate.exe 就能开始用,不需要自己装 Python 环境。

它的识别部分用 whisper.cpp,模型会按需下载到本机。常用默认模型是 large-v3-turbo,体积大约 809MB,兼顾速度和准确率;如果机器配置一般,也可以选 tiny 、 base 、 small 这类更轻的模型。音频识别支持 100 多种语言,所以日语、英语、韩语视频都能先转成字幕。
翻译部分更适合普通用户。默认可以用腾讯 Hy-MT2 本地模型,不需要 API key,也没有按次计费。 1.8B 版本大约 1.13GB,官方说明里写到大致需要 2GB 显存或 4GB 内存;7B 版本更大,适合有独显的机器。也可以改用 MyMemory 、 DeepL 、 OpenAI 、 Gemini 这类在线翻译引擎,但那就需要按各自服务的规则配置 key 或接受调用限制。

怎么用
第一步,打开 GitHub Releases,下载最新版 Windows x64 压缩包。当前最新版是 v2.4.2,压缩包比较大,约 1.73GB,建议在网络稳定时下载。
第二步,解压后运行 WhisperSubTranslate.exe。把视频文件拖进窗口,选择音频语言和目标翻译语言。如果不确定源语言,可以先让 Whisper 自动识别。
第三步,选择识别模型。短视频可以先用默认模型;如果字幕时间轴明显漂移,再试 large-v2 Sync 或 Sync Lite。这两个是专门处理同步问题的模式,尤其适合日语、韩语、中文这类非英语视频,但模型体积和运行时间也会更高。
第四步,生成字幕并导出 SRT 。拿到 SRT 后,可以直接放到播放器里,也可以再用 Aegisub 、 Subtitle Edit 之类工具微调个别句子。
适合什么场景
它适合三类人:
- 经常看外语教程、访谈、课程视频,需要快速拿到中文字幕;
- 手里有会议录屏、课程录屏,不方便上传到云端转写;
- 想批量整理个人视频资料,又不想每次都找字幕网站。
本地运行是它的主要优势。视频、字幕、任务历史都保存在自己的电脑上,不用注册账号,也不需要把音频传到服务器。项目 README 里还写明,设置、 API key 、任务历史、错误日志和模型都放在本地用户目录或应用目录里。
使用前先知道几个限制
它不做 OCR,不能读取画面里已经烧录进去的字幕,也不能把屏幕上的文字抠出来翻译。它处理的是音轨:先把语音转成文字,再把文字翻译成目标语言。
转写质量取决于音频质量。背景音乐太吵、多人抢话、口音太重,都会影响结果。字幕生成后最好快速扫一遍专有名词、人名和技术词。
离线翻译虽然省心,但大模型文件不小。第一次使用会下载模型,磁盘空间和网络都要预留。长视频也别指望瞬间完成,尤其是 CPU 跑大模型时。
如果只是偶尔处理几分钟短视频,这个工具有点重;如果经常看外语视频、课程和发布会,它能省下很多找字幕、调时间轴、复制翻译的碎活。