一句话:YouTube 链接粘进去,转写、翻译、切轴、对齐、配音一条龙,出来就是带双语字幕甚至中文配音的成片。
GitHub:Huanshere/VideoLingo | ⭐ 18.6k | Fork 2k | Apache 2.0 协议
在线体验:videolingo.io | 作者自称”Netflix 级字幕组”

它是什么?解决什么问题?
看外语视频的痛点人人都懂:生肉听不懂,机翻字幕时间轴稀烂(要么闪现要么糊屏),想转成中文配音更是专业活——转写、断句、翻译、压轴、对轨、TTS、混音,一条链七八个工具。
VideoLingo 把整条链装进一个 Streamlit 应用:转写 → 翻译 → NLP 智能断句 → 术语对齐 → 字幕压制 → AI 配音,点一次跑完。出来三样东西:字幕文件、压好双语字幕的视频、AI 配音版视频。用作者的话说,就是”一键全自动 AI 字幕组”。
核心优势:为什么 18.6k Star
1. 断句是灵魂:NLP + 大模型双保险
字幕最难的不是翻译,是断在哪。一句 30 词的英文_dump_ 出来,观感稀烂。VideoLingo 用 NLP + LLM 做字幕切分(可配单行长度),再按词级时间戳对齐,Netflix 感就来自这里——字幕出现消失的节奏是对的。

2. 翻译质量有讲究:术语表 + 反思改写
- 自定义术语表 + AI 生成术语,保证人名、专有名词前后一致;
- 直译后可走反思(reflection)和自然改写,不说翻译腔;
- 模型随便换(OpenAI 兼容接口),便宜和高质量自己选。
3. 配音不只是 TTS:能克隆你的声音
配音后端一堆可选:GPT-SoVITS(含作者本人声音复刻演示)、CosyVoice2 声音克隆、Edge TTS 白嫖、OpenAI、Fish Audio……讲究的用克隆,省事的用 Edge,丰俭由人。
4. 工程化到位:断点续跑 + 任务可控
- 详细日志 + 进度断点续跑,失败只重跑失败段(先查
output/gpt_log/error.json,别删 output 目录); - 可暂停/恢复/停止,有 HTTP API 给脚本和 Agent 调(替代了老 Excel 批量模式);
- Windows 一键包(双击 bat 装环境)、Colab 版、Docker 版全有,Mac 分芯片优化(Apple Silicon 走 MLX)。
5. 输入输出都省心:yt-dlp 直拉 + 多语 UI
YouTube 链接直接下;输入支持英俄法德意西日中 8 语;界面多语言。 limitation 作者也写明白了:背景噪音影响识别、混杂多语对不准、配音不分角色声线——诚实。
怎么使用?三步
- 装:Windows 下 Release 包双击
OneKeyStart.bat(自动装 uv/Python/FFmpeg);其他系统uv run start.py;懒人直接 videolingo.io 在线玩; - 配:侧边栏填 API 地址 + Key + 模型(LLM/ASR/TTS 各选各的);
- 跑:粘 YouTube 链接(或本地视频),点开始,该干嘛干嘛,回来收成片。
适合谁、边界在哪
| 适合 | 说明 |
|---|---|
| 知识区搬运/二创 | 外语长视频转中文,效率差一个数量级 |
| 留学生/研究者 | 讲座、课程批量转双语存档 |
| 出海/本地化小团队 | Apache 协议,可商用改造 |
| 边界 | 说明 |
|---|---|
| 版权 | 下别人的视频先看授权,工具不管这个 |
| 质量 | 噪音大、口音重、多人混聊的片子,识别和对齐会打折,先拿短片试 |
结语
字幕组是门手艺活,VideoLingo 把它变成了流水线。18.6k Star 背后是个朴素道理:把”七八个工具来回导”的链路收进一个界面,就是生产力。
仓库:github.com/Huanshere/VideoLingo(Apache 2.0)。先去在线版丢一条 3 分钟的片子试试,效果自己会说话。

