社媒与红人 · Short-Form Video Clip Pipeline

长视频转短视频 Skill

把一条长视频录像自动切成多条 9:16 竖屏短视频,并烧录随语音高亮的 TikTok 风格字幕。

需要把 YouTube 上的长视频内容分发到 TikTok 等平台时使用。系统会下载源视频并转录文字,接着由 AI 筛选具备传播度的片段,切分为时长 30 至 60 秒的短视频,最后裁剪画面尺寸并生成带高亮字幕的成片。产出的视频可直接上传至各社交媒体平台。

WHAT IT SOLVES

把一条长视频录像自动切成多条 9:16 竖屏短视频,并烧录随语音高亮的 TikTok 风格字幕

把一条长视频录像自动切成多条 9:16 竖屏短视频,并烧录随语音高亮的 TikTok 风格字幕。跑完你拿到的是1080×1920 分辨率的 H.264 编码 MP4 视频文件,符合主流短视频平台的上传规格,中间一共 7 步。

最适合的真实场景

  • 01

    社媒运营把一小时的 webinar 录像剪成多条带字幕的短视频发 TikTok

  • 02

    播客制作人从单集音频录像里批量提取高光片段做跨平台分发

  • 03

    内容营销经理把 YouTube 上的行业访谈转成竖屏短视频发 Reels

  • 04

    增长运营从两小时的录播课里提取核心讲解片段做引流切片

  • 05

    视频编导用本地脚本批量处理多期 YouTube 节目生成初剪素材库

你要先准备的资料

  • 提供一个可访问的 YouTube 视频链接,确保网络环境能正常连通并下载该视频
  • 在运行环境中预先安装好 yt-dlp 和 ffmpeg 命令行工具,以支持视频的下载与裁剪
  • 设置有效的 ANTHROPIC_API_KEY 环境变量,用于驱动大模型读取文本和筛选高光片段
  • 如果需要使用基于人脸追踪的智能画面裁剪,需安装 mediapipe 和 opencv-python 依赖
  • 安装 Python 环境以及 requirements.txt 文件中列出的所有必需第三方库

跑完你会拿到什么

  • 1080×1920 分辨率的 H.264 编码 MP4 视频文件,符合主流短视频平台的上传规格
  • 带有逐词高亮动画效果的 ASS 格式字幕文件,呈现 TikTok 风格的视觉样式
  • 包含各片段时间节点起止时间与吸引力评分的文本日志文件,用于效果复盘
  • 经过画面布局识别与人脸追踪处理后裁切出的 9:16 竖屏无声源视频
  • 直接保存在指定本地目录下,可直接选取并在各社媒平台发布的待发布成片

METHOD

视频与字幕下载 → 逐字文稿生成 → AI 片段筛选 等 7 个环节

一共 7 步。其中 6 项能力决定了换个 AI 会不会更麻烦。

  1. 视频与字幕下载使用 yt-dlp 获取 YouTube 视频源文件,并抓取平台自动生成的 VTT 格式字幕,作为后续语音识别的备选方案。
  2. 逐字文稿生成如果原视频没有 VTT 字幕,程序运行 Whisper 生成带有精确时间戳的逐字文本,为后续切片提供时间定位。
  3. AI 片段筛选Claude 读取文稿寻找 30 到 60 秒的精华片段,要求吸引力评分达到 7 分或以上,并为每个片段标注画面布局类型。
  4. 切片完整性核验进行第二次 AI 核验,检查选中的片段是否在结尾表达了完整的语义,避免出现话没说完就被截断的情况。
  5. 视频画面裁切使用 ffmpeg 按照划定的时间节点从原始长视频中精确截取对应片段,作为后续画面转换的源素材。
  6. 智能竖屏转换根据布局标注处理画面,通过 MediaPipe 的人脸识别功能追踪说话人,把 16:9 的横屏画面重构成 9:16 的竖屏画面。
  7. 动态字幕烧录生成 ASS 格式的 TikTok 风格字幕,随着语音播报逐个单词高亮,并把字幕直接压制到视频画面上。

这个 Skill 用到的能力: 打开网页取正文读本地资料运行脚本页面预览操作前确认批处理 。不同 AI 对这些能力的支持程度不一样,所以同一个 Skill 换个 AI,有几步做法会变。

WORKED EXAMPLE

SaaS 公司 webinar 切片分发

SaaS 公司 webinar 切片分发

市场团队刚播完一场 50 分钟的产品更新在线研讨会。团队需要在一周内,把录像转成至少 3 条 9:16 的短视频,发到 TikTok 和 Instagram Reels 上做曝光。团队不想花时间手动听写、上字幕或调整画面比例,直接把 YouTube 链接丢给程序,让程序全自动处理,最终拿到直接能发的成片。

  1. 在终端运行 shortform_pipeline.py 脚本,粘贴研讨会 YouTube 链接,设置最大切片数为 3
  2. 程序下载视频并提取字幕,交由 Claude 筛选出评分达标的 3 个高光片段
  3. AI 检查片段结尾是否完整,确认无误后按时间轴把片段从原视频中切出
  4. 程序识别画面为主讲人特写,使用人脸识别将画面重构成 9:16 竖屏
  5. 生成逐词高亮字幕并烧录,输出 3 个带有 AAC 音频的 MP4 文件

预期结果:团队在本地文件夹拿到了 3 个 1080×1920 分辨率的 MP4 文件。成片带有随语音逐词高亮的字幕,可以直接上传到移动端发布。日志记录了每个片段的起止时间和评分依据。遇到原视频画面主讲人走动幅度过大的情况,竖屏画面边缘有轻微裁切,需人工抽查确认画面是否完整。

PITFALLS · VERIFICATION

片段时长超出预期:程序偶尔会切出 90 秒以上的长片段

最常踩的坑

  • 片段时长超出预期:程序偶尔会切出 90 秒以上的长片段,需人工复查或强制缩到 75 秒以内。
  • 静音或长停顿导致错位:如果原视频存在长时间停顿,生成的字幕时间戳可能会产生偏移。
  • 多人画面裁切遗漏:原视频如果是多人平铺画面,聚焦当前发言人时可能会把其他人裁出画面外。
  • FFmpeg 命令冲突报错:处理画面时如果错误混用视频流复制指令,会导致滤镜处理直接报错中断。
  • 原视频无自带字幕兜底:如果音频极度嘈杂,Whisper 生成的逐字文稿会出现同音错词并被烧录进画面。

怎么确认这次跑对了

  • 已经形成可检查的1080×1920 分辨率的 H.264 编码 MP4 视频文件,符合主流短视频平台的上传规格,关键判断能回到输入资料或过程证据。
  • 已经形成可检查的带有逐词高亮动画效果的 ASS 格式字幕文件,呈现 TikTok 风格的视觉样式,关键判断能回到输入资料或过程证据。
  • 已经形成可检查的包含各片段时间节点起止时间与吸引力评分的文本日志文件,用于效果复盘,关键判断能回到输入资料或过程证据。
  • 已逐项检查「片段时长超出预期:程序偶尔会切出 90 秒以上的长片段,需人工复查或强制缩到 75 秒以内」等高频问题,并记录需要人工确认的下一步。
长视频转短视频 Skill适合哪些岗位使用?

海外社媒运营、内容营销经理、短视频编导、出海增长运营。典型场景包括社媒运营把一小时的 webinar 录像剪成多条带字幕的短视频发 TikTok;播客制作人从单集音频录像里批量提取高光片段做跨平台分发;内容营销经理把 YouTube 上的行业访谈转成竖屏短视频发 Reels。

开始前需要准备什么资料?

至少需要提供一个可访问的 YouTube 视频链接,确保网络环境能正常连通并下载该视频、在运行环境中预先安装好 yt-dlp 和 ffmpeg 命令行工具,以支持视频的下载与裁剪、设置有效的 ANTHROPIC_API_KEY 环境变量,用于驱动大模型读取文本和筛选高光片段。资料越具体,结果越能直接用于决策。

最后能得到什么可检查的结果?

1080×1920 分辨率的 H.264 编码 MP4 视频文件,符合主流短视频平台的上传规格、带有逐词高亮动画效果的 ASS 格式字幕文件,呈现 TikTok 风格的视觉样式、包含各片段时间节点起止时间与吸引力评分的文本日志文件,用于效果复盘。每项都可以逐条核对来源和数字。

哪些情况下结果会不可靠?

片段时长超出预期:程序偶尔会切出 90 秒以上的长片段,需人工复查或强制缩到 75 秒以内;静音或长停顿导致错位:如果原视频存在长时间停顿,生成的字幕时间戳可能会产生偏移。出现这些情况时需要人工复核。

支持哪些 AI Agent?

已适配 WorkBuddy、OpenClaw、Hermes Agent、Codex、Claude Code、TRAE、ZCode 共 7 种,每种都有独立的安装说明和能力对照。

ORIGINAL SOURCE

7 个原始文件,45 个文档章节,固定在 a9f11007

上游原文完整保留在加搜服务器上,可逐节查看,也可以直接下载。 当前镜像共 7 个文件、83.7 KB。

原始 Skill 文档 上游原文完整保留,中文概述已转换为营销任务、输入资料和交付结果。

Short-Form Video Clip Pipeline — Skill

Preamble (runs on skill start)

# Version check (silent if up to date)
python3 telemetry/version_check.py 2>/dev/null || true

# Telemetry opt-in (first run only, then remembers your choice)
python3 telemetry/telemetry_init.py 2>/dev/null || true

Privacy: This skill logs usage locally to ~/.ai-marketing-skills/analytics/. Remote telemetry is opt-in only. No code, file paths, or repo content is ever collected. See telemetry/README.md.


Extract viral short-form clips (TikTok, Reels, Shorts) from long-form YouTube videos. Handles download, transcription, AI segmentation, cutting, vertical cropping, and caption burn-in.

Prerequisites

  • yt-dlp and ffmpeg installed
  • ANTHROPIC_API_KEY environment variable set
  • Python dependencies from requirements.txt installed
  • Optional: mediapipe and opencv-python for face-detected smart crop

Quick Start

Single video → clips
python3 scripts/shortform_pipeline.py \
  --url "https://www.youtube.com/watch?v=VIDEO_ID" \
  --max-clips 3 \
  --output-dir ./output
Standalone clipper (no Claude, heuristic scoring)
python3 scripts/video_clipper.py --url "https://www.youtube.com/watch?v=VIDEO_ID"

Pipeline Overview

  1. Download — yt-dlp fetches video + auto-generated VTT captions
  2. Transcribe — Whisper generates word-level timestamps (falls back to YouTube captions)
  3. Segment — Claude identifies 2–5 best 30–60s moments with hook scoring ≥7/10
  4. Cut Verification — Second Claude pass verifies each clip ends on a complete thought
  5. Cut — FFmpeg extracts each clip from the source video
  6. Vertical Crop — Layout-aware 16:9 → 9:16 conversion with face detection
  7. Caption Burn — TikTok-style word-highlighted captions (ASS format) burned in

Key Files

File Purpose
scripts/shortform_pipeline.py Full pipeline: download → segment → cut → crop → caption
scripts/video_clipper.py Standalone clipper with heuristic scoring (no Claude needed)
scripts/clip_sender.py Helper for clip delivery and review workflow

Layout-Aware Cropping

The pipeline handles four video layouts differently:

  • talking_head — Face-detected center crop using MediaPipe; audio panning fallback
  • screen_share_overlay — Stacks screen content on top, webcam bubble on bottom
  • side_by_side — Stacks screen on top, presenter face on bottom
  • gallery_view — Crops to active speaker quadrant

Claude outputs a layout_hint for each segment during segmentation.

Customization

Voice patterns

Edit VOICE_PATTERNS in video_clipper.py to match your creator's speech patterns. These boost clip scoring for authentic-sounding segments.

Segmentation prompt

The Claude prompt in shortform_pipeline.py can be customized:

  • Adjust hook_strength minimum (default: 7/10)
  • Change target duration range (default: 30–60s)
  • Modify layout hint options
Crop tuning

In video_clipper.py:

  • scale_factor — Zoom level for single face (default: 1.08)
  • desired_face_y — Target face position in frame (default: upper 35%)

Output

Each clip is output as:

  • 1080×1920 resolution (9:16 vertical)
  • H.264 + AAC encoding
  • Word-highlighted captions burned in
  • Ready for direct upload to TikTok, Reels, or Shorts

Troubleshooting

  • FFmpeg filter_complex error: Don't use -c:v copy with -filter_complex. Only -c:a copy is safe.
  • Wrong output resolution: Always crop before scaling. Verify with ffprobe -show_entries stream=width,height.
  • Caption sync issues: Run Whisper on the cut clip, not the source episode.
  • TikTok upload fails: Ensure H.264 + AAC encoding. Add -c:v libx264 -c:a aac if needed.
  • Clip too long: Claude sometimes overshoots. The pipeline auto-trims clips >90s to 75s.

来源与版本声明

本页面由加搜科技整理业务说明并托管安装文件。原始 Skill 来源渠道:GitHub; 原始项目名称:Short-Form Video Clip Pipeline; 固定版本:a9f11007aca3; 许可证:MIT。技能包内保留完整出处和许可证说明。

各 Agent 能力说明参考对应官方文档。页面不提供外部跳转。

INSTALL

长视频转短视频 Skill v1.0.0,ZIP 带 SHA256 校验

默认做法是把提示词复制给 AI Agent,让它自己下载并安装。提示词里已经写清要用完整 ZIP、装完报告目录、并先跑一个小任务验证。

METHOD 01 · 交给 AI 自己装

复制提示词

适合大多数情况。Agent 会下载 ZIP、解压、放到正确目录,并在缺少权限时告诉你需要手工做哪一步。

请帮我把「长视频转短视频 Skill」安装到我正在使用的 AI Agent。
1. 下载完整 Skill ZIP:https://www.vibemarketing.work/packages/skill-short-form-pipeline/1.0.0/skill-short-form-pipeline.zip
   注意:网页 HTML 不能当作 Skill 文件安装,必须使用 ZIP 里的完整文件。
2. 解压后保留 SKILL.md 及全部配套文件,按你所用 Agent 的 Skill 目录规则安装。
3. 安装完成后告诉我实际安装目录。
4. 用一个只读小任务验证 Skill 已被识别。
5. 如果你没有联网、下载或写目录权限,请直接告诉我哪几步需要我手工完成。
参考:原始 SKILL.md https://www.vibemarketing.work/raw/skill-short-form-pipeline/SKILL.md;安装指南 https://www.vibemarketing.work/agent-install/skill-short-form-pipeline.md

FURTHER READING

长视频转短视频 Skill 相关的实操文章

别人做同类任务时踩过的坑和总结,动手前后都值得翻一下。

SaaS Landing 配置清单:落地页搭建的轻量版、标准版和团队版

聚焦一个问题:提示词越写越长。文中用正反两组输入说明落地页搭建为什么会跑偏,以及怎样把结果拉回可用范围。

  • Skill介绍
  • 社媒营销

工作流编排提示词:把散乱数据做成管理层看板,复制后先改这3处

一页看懂工作流编排。包含适用场景、最小输入和把散乱数据做成管理层看板的示例。

  • 工作流
  • 电商运营
  • 品牌知识库
  • 内容创作

一次讲透去AI味:输入什么、输出什么、怎样提高引用率

为独立开发者准备的去AI味速查卡,适合第一次接触时直接照着走。重点放在提高引用率,不要求预先搭建复杂系统。

  • 故障排查
  • 飞书
  • 内容创作
  • 去AI味

独立开发者实测关键词研究:一轮完成,目标是让协作更顺畅

这是一份偏实战的关键词研究配置说明。先用小样本完成“生成能直接交付的客户方案”,再逐步扩到批量任务;同时设置人工抽检、来源记录和失败兜底,降低提示词越写越长带来的波动。文末附一组可复制参数,便于继续让协作更顺畅。

  • Skill教程
  • 多模态搜索
  • 批量生产
  • 关键词研究

网页原型极简用法|批量发现用户真正会搜的问题

给出网页原型的最短操作路径,用一个真实感示例演示如何批量发现用户真正会搜的问题,并标出能减少返工的关键设置。

  • Skill教程
  • 零点击搜索
  • 内容编辑
  • 批量生产

AEO 热起来后,竞品分析有哪些新用法

给出竞品分析的最短操作路径,用一个真实感示例演示如何让品牌内容更容易被AI引用,并标出能形成可复用模板的关键设置。

  • 实战案例
  • 邮件
  • 内容创作
  • 可复制

以上文章正在编辑中,上线后可直接点击阅读。即将上线,敬请期待。

按这个 Skill 的产出能不能直接被下一个 Skill 用上来推荐,不是固定名单。多数情况下按顺序跑完一组,比单独用一个效果更好。

SEO 与 GEO#01

AI 搜索流量分析 Skill

在 GA4 与 Search Console 中识别来自 ChatGPT、Perplexity 和 AI 搜索体验的访问与转化。

来源项目 · kostja94/marketing-skills ★ 742 · Fork 108
数据与自动化#04

转化率优化 Skill

把流量数据转化为带统计显著性的 A/B 测试方案,产出包含测试变量和样本量的实验执行计划。

来源项目热度 同步中

VibeMKT COMMUNITY

加入 VibeMKT 社群

微信扫码,交流营销 Skill 的选择、安装、试用与业务化改造。

加入 VibeMKT 社群的微信二维码

二维码会持续显示,关闭弹窗后返回当前页面。