VideoCaptioner(卡卡字幕助手)使用教程:AI 一键生成高质量视频字幕

给视频配字幕一直是个麻烦事——手动打轴累、自动识别的断句又经常不通顺。VideoCaptioner(卡卡字幕助手)是一个开源免费的字幕制作工具,把语音识别、字幕断句、AI 优化和翻译整合成一条流水线,拖拽视频进去就能自动出成品字幕。

软件简介

VideoCaptioner 由开发者 WEIFENG2333 在 GitHub 上开源(仓库名 WEIFENG2333/VideoCaptioner),Windows 版打包后不到 60MB,已经集成了所有必要环境,下载解压就能用。

核心流程:语音识别 -> 字幕断句 -> AI 优化/翻译 -> 字幕视频合成

VideoCaptioner ���网首页

安装方式

Windows 用户(推荐)

从项目 Release 页面下载最新版安装包,或者用蓝奏盘链接下载。解压后直接运行 VideoCaptioner.exe 即可。首次运行会自动检测环境,不需要额外配置 Python 或 ffmpeg。

macOS / Linux 用户

用源码运行需要 Python 3.11 环境:

# 1. 克隆项目
git clone https://github.com/WEIFENG2333/VideoCaptioner.git
cd VideoCaptioner

# 2. 安装系统依赖(macOS)
brew install ffmpeg aria2 python@3.11
# 或 Ubuntu/Debian
# sudo apt install ffmpeg aria2 python3.11 python3.11-venv

# 3. 安装 Python 依赖
python3.11 -m venv venv
source venv/bin/activate
pip install -r requirements.txt

# 4. 运行
python main.py

使用步骤

VideoCaptioner 的界面很简单,核心操作就是拖拽视频到窗口,然后等着出结果。

第一步:拖入视频文件

支持常见视频格式(MP4、MKV、MOV 等),也支持直接拖入 B 站或 YouTube 的视频链接,软件会自动下载再处理。

第二步:配置 LLM API(可选但推荐)

软件内置了基础大语言模型(gpt-4o-mini),不配置也能用。但如果想获得更好的字幕优化和翻译效果,建议在「设置 - LLM 配置」里���写自己的 API Key。

支持的 LLM 服务商:

服务商 特点 推荐模型
OpenAI 质量最好 gpt-4o-mini(经济)/ gpt-4o(高质量)
DeepSeek 性价比高 deepseek-chat
SiliconCloud 国内可用 Qwen/Qwen2.5-72B-Instruct
Ollama 本地运行,完全免费 llama3.1:8b

第三步:配置语音识别

在「语音识别」页面选择识别引擎。软件提供几种接口:

  • B 接口 / J 接口:在线免费接口,速度快,支持中英文
  • 本地 Whisper:需要下载模型(软件内下载),支持 96 种语言,中文建议用 Medium 以上模型

本地 Whisper 模型占用空间参考:

模型 磁盘空间 说明
Tiny 75 MB 仅用于测试
Small 466 MB 英文效果不错
Medium 1.5 GB 中文推荐使用
Large 2.9 GB 效果最好

第四步:开始处理

拖入视频后,点击「开始任务」,软件会自动走完语音识别 -> 字幕断句 -> AI 优化/翻译 -> 字幕视频合成全流程。

VideoCaptioner 快速开始指南

核心功能详解

字幕智能断句

普通语音识别出的字幕经常是逐字输出、断句混乱。VideoCaptioner 借助 LLM 把逐字字幕重组为符合自然语言习惯的段落,让字幕阅读更流畅。

字幕纠错

自动修正专业术语、代码片段、数学公式的格式,统一人名和专有名词。如果视频中有特定领域术语,可以在「文稿匹配」里填写术语对照表,比如:

  • 机器学习 -> Machine Learning
  • Elon Musk -> 马斯克

高质量翻译

翻译采用吴恩达提出的「翻译-反思-翻译」方法,先翻译一轮,再让大模型反思翻译结果,然后优化为更地道的表达。同时用序列模糊匹配算法保证时间轴完全一致,不会出现翻译后字幕对不上画面。

字幕样式调整

内置多种字幕样式模板:科普风、新闻风、番剧风等。支持设置主副字幕的字体、大小、颜色、边框样式、行距、位置。输出格式支持 SRT、ASS、VTT、TXT。

配置项说明

文稿匹配

在「字幕优化与翻译」页面,可以填入以下内容辅助校正字幕:

  • 术语表:专业术语、人名、特定词语的修正对照表
  • 原字幕文稿:视频的原有文稿或演讲稿,帮助断句更准确
  • 修正要求:对字幕内容的具体要求,比如统一人称代词、规范专业术语

Cookie 配置

如果需要下载 B 站或 YouTube 需要登录��能看的视频,可以在设置里配置 Cookie。把浏览器导出的 cookies.txt 放到软件目录下即可。

实际效果参考

开发者测试过一个 14 分钟 1080P 的 TED 英文视频:

  • 调用本地 Whisper 进行语音识别
  • 使用 gpt-4o-mini 优化和翻译为中文
  • 总耗时约 4 分钟
  • LLM 消耗费用不足 0.01 元

小结

VideoCaptioner 适合以下场景:

  • 做视频字幕不想手动打轴
  • 需要把外语视频翻译成中文并配上字幕
  • 批量处理多个视频的字幕
  • 想要自由调整字幕样式和格式

开源免费、Windows 开箱即用、支持本地 Whisper 离线运行、LLM 翻译质量好,是目前视频字幕制作工具里性价比很高的选择。

项目地址:https://github.com/WEIFENG2333/VideoCaptioner 官网:https://www.videocaptioner.cn