← 返回全部文章

8 个开源工具,搭一套内容生产线

从剪辑、转写、绘图到素材管理,把 8 个 GitHub 项目拆成可落地的内容生产工作流。

做内容的人,迟早会遇到同一个问题:工具越装越多,流程还是散的。视频剪辑用一套,语音转文字用一套,图片放在硬盘里,字幕另开软件,下载素材又靠浏览器临时保存。

这 8 个 GitHub 项目可以拼成一条比较完整的内容生产线:抓素材、转格式、生成画面、转写字幕、精修字幕、剪成视频,再把照片和视频归档。下面按实际流程拆,不只列名字,也给出适合场景、上手方式和放进工作流的位置。

来源链接: https://x.com/smartpigai/status/2063488019446038650?s=52

先看整体流程

一个可复用的内容系统,大致可以这样搭:

  1. yt-dlp 把公开视频、直播回放、课程资料下载到本地。
  2. FFmpeg 统一转码、切片、抽音频、压缩。
  3. Whisper 把音频转成字幕草稿或会议记录。
  4. Subtitle Edit 校正时间轴、翻译、合并字幕。
  5. ComfyUI 生成封面、分镜图、风格化素材。
  6. Remotion 把模板、字幕、图片、数据渲染成视频。
  7. Immich 保存手机照片、拍摄素材和成片。
  8. PhotoPrism 给长期素材库做搜索、标签和浏览。

这条线不要求一次搭完。先选最痛的一个环节,比如字幕或素材归档,跑通后再接下一段。

1. Remotion:用代码做可复用的视频模板

项目地址: https://github.com/remotion-dev/remotion

Remotion 的定位很明确:用 React 写视频。它适合做模板化、批量化的视频,比如每周数据榜单、产品更新短片、课程切片片头、播客自动封面动画。

它的好处是把视频拆成组件。标题、字幕条、进度条、图表、头像、背景动画都可以写成 React 组件,再用参数喂进去。一次做好模板,后面换数据就能批量出片。

上手方式很简单:

npx create-video@latest

进入项目后,你可以把一条视频理解成一个 React 页面。页面里读取 JSON 、图片、字幕文件,然后渲染到固定帧率的视频里。

适合这样用:

  • 做固定栏目:每期只换标题、图片、字幕和数据。
  • 做批量短视频:同一个模板输出几十条不同内容。
  • 做带动效的数据视频:图表、时间轴、进度条都用代码控制。

不太适合临时剪一条 Vlog 。那种手感型剪辑,用传统剪辑软件更快。 Remotion 的优势在“可重复”。

2. Whisper:把语音变成字幕和会议记录

项目地址: https://github.com/openai/whisper

Whisper 是语音识别模型,适合处理采访、播客、会议录音、视频口播。它能做多语言识别,也能做语音翻译。对内容工作流来说,它通常是字幕生产的第一站。

安装前先准备 FFmpeg 。 Ubuntu / Debian 可以这样装:

sudo apt update
sudo apt install ffmpeg
pip install -U openai-whisper

转写一个音频文件:

whisper audio.mp3 --model turbo --language Chinese

生成英文翻译字幕:

whisper japanese.wav --model medium --language Japanese --task translate

实际使用时,建议先用 turbosmall 模型跑草稿。字幕需要发布时,再用更大的模型重跑关键片段。长视频可以先用 FFmpeg 切成 10 到 20 分钟一段,失败时也好重试。

Whisper 输出的字幕不要直接发布。它负责“听懂大概”,后面还要交给 Subtitle Edit 修时间轴、标点、人名和术语。

3. ComfyUI:把绘图流程做成节点工作流

项目地址: https://github.com/comfyanonymous/ComfyUI

ComfyUI 是节点式的 AI 图像、视频、音频生成工具。它适合需要控制细节的人:模型、提示词、 ControlNet 、 LoRA 、放大、换脸、局部重绘,都能拆成节点串起来。

如果只是偶尔生成一张图,普通网页工具更省事。 ComfyUI 更适合把封面、角色图、分镜、统一风格素材做成可复用流程。

现在推荐用 comfy-cli 安装:

pip install comfy-cli
comfy install

启动后,把模型文件放到对应目录,再在浏览器里搭工作流。一个常见内容场景是:

  1. 先生成 16:9 封面底图。
  2. 用局部重绘调整人物、背景或物体。
  3. 用放大节点输出高清图。
  4. 保存 workflow,下次只改提示词和参考图。

做公众号、视频封面、课程配图时,最好把“封面图”“正文图”“竖版短视频背景”分成不同 workflow 。别把所有需求塞进一个超大节点图,后面会很难维护。

4. FFmpeg:媒体处理的底层瑞士军刀

项目地址: https://github.com/FFmpeg/FFmpeg

FFmpeg 是音视频处理的底层工具。剪辑软件、播放器、转码工具、下载器背后经常都能看到它。对个人工作流来说,它最常用的功能是转格式、抽音频、压缩、切片、合并、截图。

几个高频命令够用很久:


# 从视频里抽音频,给 Whisper 转写用
ffmpeg -i input.mp4 -vn -acodec mp3 audio.mp3

# 压缩视频,方便上传和归档
ffmpeg -i input.mov -vcodec libx264 -crf 23 -preset medium output.mp4

# 截取 00:01:30 开始的 20 秒片段
ffmpeg -ss 00:01:30 -i input.mp4 -t 20 -c copy clip.mp4

# 每隔 10 秒抽一张图,做关键帧预览
ffmpeg -i input.mp4 -vf fps=1/10 frames_%03d.jpg

FFmpeg 的参数很多,不用一开始全学。先把常用命令存成脚本,比如 extract-audio.shcompress-video.shmake-frames.sh。内容生产最怕每次都从搜索引擎重新找命令。

5. Immich:自建版 Google Photos,适合手机素材备份

项目地址: https://github.com/immich-app/immich

Immich 是自托管照片和视频管理系统,定位接近 Google Photos 。它有手机 App,可以自动备份照片和视频,也支持时间线、相册、人脸识别、地图等功能。

如果你经常用手机拍素材,Immich 很适合做第一层归档。手机拍完,自动同步到私有服务器。后面剪视频、写文章、找旧素材,就不用在聊天记录和相册里翻。

官方推荐走 Docker Compose 。实际部署前先确认三件事:

  • 有稳定磁盘,不要把唯一照片库放在临时盘。
  • 有备份策略,至少保留一份异地备份。
  • 服务器内存别太小,机器学习、人脸识别会吃资源。

适合放进工作流的位置:手机拍摄素材入口。照片和视频先进入 Immich,精选后再复制到项目文件夹。备份还要单独做,Immich 主要负责管理和浏览。

6. PhotoPrism:长期素材库的搜索和标签系统

项目地址: https://github.com/photoprism/photoprism

PhotoPrism 也是自托管照片管理工具,但它更像一个长期素材库浏览器。它强调搜索、标签、 RAW 支持、地点、相册和 PWA 体验。

它适合放已经整理过的素材:产品截图、活动照片、旅行图、封面参考、旧项目视觉素材。你可以把素材按年份、项目、客户或主题放在目录里,再让 PhotoPrism 建索引。

一个实用分工是:

  • Immich 管手机自动备份,保证素材先进库。
  • PhotoPrism 管精选素材和历史资料,方便检索和复用。

如果只想要一个工具,普通用户先选 Immich 。素材多、目录历史复杂、需要搜索和标签时,再加 PhotoPrism 。

7. Subtitle Edit:字幕精修工具

项目地址: https://github.com/SubtitleEdit/subtitleedit

Subtitle Edit 负责字幕的人工精修。 Whisper 生成的是草稿,常见问题包括断句不准、时间轴漂移、专有名词识别错、标点不自然。 Subtitle Edit 适合把这些问题集中处理。

它支持 Windows 、 macOS 、 Linux,也有 Flatpak 构建。 Linux 可以这样装依赖:

sudo apt update
sudo apt install -y mpv libmpv-dev ffmpeg

Flatpak 方式:

flatpak install SubtitleEdit-linux-x64.flatpak
flatpak run dk.nikse.subtitleedit

推荐流程:

  1. Whisper 先导出 .srt
  2. Subtitle Edit 打开视频和字幕。
  3. 先整体校时间轴,再逐段改错字。
  4. 导出 .srt.ass
  5. 用 FFmpeg 压进视频,或交给 Remotion 做字幕动画。

如果做双语字幕,可以先保留一版原语言字幕,再复制一版做翻译。不要在同一个文件里来回覆盖,后期很容易丢版本。

8. yt-dlp:素材下载和采集入口

项目地址: https://github.com/yt-dlp/yt-dlp

yt-dlp 是命令行下载器,支持大量视频网站。它适合下载公开视频、课程、播客、直播回放,也能抓取字幕、封面、元数据。

安装方式:

python -m pip install -U "yt-dlp[default]"

常用命令:


# 下载单个视频
yt-dlp "https://www.youtube.com/watch?v=VIDEO_ID"

# 同时下载字幕和封面
yt-dlp --write-subs --write-thumbnail "https://www.youtube.com/watch?v=VIDEO_ID"

# 只下载音频,后面交给 Whisper
yt-dlp -x --audio-format mp3 "https://www.youtube.com/watch?v=VIDEO_ID"

# 按频道或播放列表归档
yt-dlp -o "%(uploader)s/%(playlist)s/%(playlist_index)s - %(title)s.%(ext)s" "PLAYLIST_URL"

把 yt-dlp 放在最前面,可以减少很多手工下载。建议固定输出目录,比如 inbox/video/inbox/audio/inbox/subtitles/,后面脚本就能自动接上 FFmpeg 和 Whisper 。

一套可执行的最小方案

如果今天就想搭一套,不要同时部署 8 个。按这个顺序来:

第一步,先搭命令行处理层:

python -m pip install -U "yt-dlp[default]" openai-whisper
sudo apt install ffmpeg

先跑通“下载视频 → 抽音频 → 转字幕”:

yt-dlp -x --audio-format mp3 -o "inbox/%(title)s.%(ext)s" "VIDEO_URL"
whisper inbox/*.mp3 --model turbo --language Chinese --output_format srt

第二步,加字幕精修。把 .srt 放进 Subtitle Edit,校正时间轴和术语。

第三步,加素材库。手机素材多,先上 Immich;历史素材多,再上 PhotoPrism 。

第四步,加生产模板。需要批量出视频时上 Remotion;需要稳定生成封面和配图时上 ComfyUI 。

最后形成一个目录约定:

content-lab/
  inbox/          # yt-dlp 下载和手机导入
  audio/          # FFmpeg 抽出的音频
  subtitles/      # Whisper / Subtitle Edit 字幕
  assets/         # ComfyUI 生成图、封面、截图
  projects/       # 每条视频或文章的项目文件
  archive/        # Immich / PhotoPrism 管理的长期素材

工具本身免费,真正省时间的是流程固定。每次做内容都走同一条路径:素材进 inbox,音频进 audio,字幕进 subtitles,成品进 projects,长期资料进 archive 。这样过几周以后,你会发现自己少做了很多重复劳动。

来源:https://x.com/smartpigai/status/2063488019446038650?s=52