社媒与红人 · Short-Form Video Clip Pipeline

长视频转短视频 Skill

把一条长视频录像自动切成多条 9:16 竖屏短视频,并烧录随语音高亮的 TikTok 风格字幕。

需要把 YouTube 上的长视频内容分发到 TikTok 等平台时使用。系统会下载源视频并转录文字,接着由 AI 筛选具备传播度的片段,切分为时长 30 至 60 秒的短视频,最后裁剪画面尺寸并生成带高亮字幕的成片。产出的视频可直接上传至各社交媒体平台。

WHAT IT SOLVES

把一条长视频录像自动切成多条 9:16 竖屏短视频,并烧录随语音高亮的 TikTok 风格字幕

把一条长视频录像自动切成多条 9:16 竖屏短视频,并烧录随语音高亮的 TikTok 风格字幕。跑完你拿到的是1080×1920 分辨率的 H.264 编码 MP4 视频文件,符合主流短视频平台的上传规格,中间一共 7 步。

最适合的真实场景

  • 01

    社媒运营把一小时的 webinar 录像剪成多条带字幕的短视频发 TikTok

  • 02

    播客制作人从单集音频录像里批量提取高光片段做跨平台分发

  • 03

    内容营销经理把 YouTube 上的行业访谈转成竖屏短视频发 Reels

  • 04

    增长运营从两小时的录播课里提取核心讲解片段做引流切片

  • 05

    视频编导用本地脚本批量处理多期 YouTube 节目生成初剪素材库

你要先准备的资料

  • 提供一个可访问的 YouTube 视频链接,确保网络环境能正常连通并下载该视频
  • 在运行环境中预先安装好 yt-dlp 和 ffmpeg 命令行工具,以支持视频的下载与裁剪
  • 设置有效的 ANTHROPIC_API_KEY 环境变量,用于驱动大模型读取文本和筛选高光片段
  • 如果需要使用基于人脸追踪的智能画面裁剪,需安装 mediapipe 和 opencv-python 依赖
  • 安装 Python 环境以及 requirements.txt 文件中列出的所有必需第三方库

跑完你会拿到什么

  • 1080×1920 分辨率的 H.264 编码 MP4 视频文件,符合主流短视频平台的上传规格
  • 带有逐词高亮动画效果的 ASS 格式字幕文件,呈现 TikTok 风格的视觉样式
  • 包含各片段时间节点起止时间与吸引力评分的文本日志文件,用于效果复盘
  • 经过画面布局识别与人脸追踪处理后裁切出的 9:16 竖屏无声源视频
  • 直接保存在指定本地目录下,可直接选取并在各社媒平台发布的待发布成片

METHOD

视频与字幕下载 → 逐字文稿生成 → AI 片段筛选 等 7 个环节

一共 7 步。其中 6 项能力决定了换个 AI 会不会更麻烦。

  1. 视频与字幕下载使用 yt-dlp 获取 YouTube 视频源文件,并抓取平台自动生成的 VTT 格式字幕,作为后续语音识别的备选方案。
  2. 逐字文稿生成如果原视频没有 VTT 字幕,程序运行 Whisper 生成带有精确时间戳的逐字文本,为后续切片提供时间定位。
  3. AI 片段筛选Claude 读取文稿寻找 30 到 60 秒的精华片段,要求吸引力评分达到 7 分或以上,并为每个片段标注画面布局类型。
  4. 切片完整性核验进行第二次 AI 核验,检查选中的片段是否在结尾表达了完整的语义,避免出现话没说完就被截断的情况。
  5. 视频画面裁切使用 ffmpeg 按照划定的时间节点从原始长视频中精确截取对应片段,作为后续画面转换的源素材。
  6. 智能竖屏转换根据布局标注处理画面,通过 MediaPipe 的人脸识别功能追踪说话人,把 16:9 的横屏画面重构成 9:16 的竖屏画面。
  7. 动态字幕烧录生成 ASS 格式的 TikTok 风格字幕,随着语音播报逐个单词高亮,并把字幕直接压制到视频画面上。

这个 Skill 用到的能力: 打开网页取正文读本地资料运行脚本页面预览操作前确认批处理 。不同 AI 对这些能力的支持程度不一样,所以同一个 Skill 换个 AI,有几步做法会变。

WORKED EXAMPLE

SaaS 公司 webinar 切片分发

SaaS 公司 webinar 切片分发

市场团队刚播完一场 50 分钟的产品更新在线研讨会。团队需要在一周内,把录像转成至少 3 条 9:16 的短视频,发到 TikTok 和 Instagram Reels 上做曝光。团队不想花时间手动听写、上字幕或调整画面比例,直接把 YouTube 链接丢给程序,让程序全自动处理,最终拿到直接能发的成片。

  1. 在终端运行 shortform_pipeline.py 脚本,粘贴研讨会 YouTube 链接,设置最大切片数为 3
  2. 程序下载视频并提取字幕,交由 Claude 筛选出评分达标的 3 个高光片段
  3. AI 检查片段结尾是否完整,确认无误后按时间轴把片段从原视频中切出
  4. 程序识别画面为主讲人特写,使用人脸识别将画面重构成 9:16 竖屏
  5. 生成逐词高亮字幕并烧录,输出 3 个带有 AAC 音频的 MP4 文件

预期结果:团队在本地文件夹拿到了 3 个 1080×1920 分辨率的 MP4 文件。成片带有随语音逐词高亮的字幕,可以直接上传到移动端发布。日志记录了每个片段的起止时间和评分依据。遇到原视频画面主讲人走动幅度过大的情况,竖屏画面边缘有轻微裁切,需人工抽查确认画面是否完整。

PITFALLS · VERIFICATION

片段时长超出预期:程序偶尔会切出 90 秒以上的长片段

最常踩的坑

  • 片段时长超出预期:程序偶尔会切出 90 秒以上的长片段,需人工复查或强制缩到 75 秒以内。
  • 静音或长停顿导致错位:如果原视频存在长时间停顿,生成的字幕时间戳可能会产生偏移。
  • 多人画面裁切遗漏:原视频如果是多人平铺画面,聚焦当前发言人时可能会把其他人裁出画面外。
  • FFmpeg 命令冲突报错:处理画面时如果错误混用视频流复制指令,会导致滤镜处理直接报错中断。
  • 原视频无自带字幕兜底:如果音频极度嘈杂,Whisper 生成的逐字文稿会出现同音错词并被烧录进画面。

怎么确认这次跑对了

  • 已经形成可检查的1080×1920 分辨率的 H.264 编码 MP4 视频文件,符合主流短视频平台的上传规格,关键判断能回到输入资料或过程证据。
  • 已经形成可检查的带有逐词高亮动画效果的 ASS 格式字幕文件,呈现 TikTok 风格的视觉样式,关键判断能回到输入资料或过程证据。
  • 已经形成可检查的包含各片段时间节点起止时间与吸引力评分的文本日志文件,用于效果复盘,关键判断能回到输入资料或过程证据。
  • 已逐项检查「片段时长超出预期:程序偶尔会切出 90 秒以上的长片段,需人工复查或强制缩到 75 秒以内」等高频问题,并记录需要人工确认的下一步。
长视频转短视频 Skill适合哪些岗位使用?

海外社媒运营、内容营销经理、短视频编导、出海增长运营。典型场景包括社媒运营把一小时的 webinar 录像剪成多条带字幕的短视频发 TikTok;播客制作人从单集音频录像里批量提取高光片段做跨平台分发;内容营销经理把 YouTube 上的行业访谈转成竖屏短视频发 Reels。

开始前需要准备什么资料?

至少需要提供一个可访问的 YouTube 视频链接,确保网络环境能正常连通并下载该视频、在运行环境中预先安装好 yt-dlp 和 ffmpeg 命令行工具,以支持视频的下载与裁剪、设置有效的 ANTHROPIC_API_KEY 环境变量,用于驱动大模型读取文本和筛选高光片段。资料越具体,结果越能直接用于决策。

最后能得到什么可检查的结果?

1080×1920 分辨率的 H.264 编码 MP4 视频文件,符合主流短视频平台的上传规格、带有逐词高亮动画效果的 ASS 格式字幕文件,呈现 TikTok 风格的视觉样式、包含各片段时间节点起止时间与吸引力评分的文本日志文件,用于效果复盘。每项都可以逐条核对来源和数字。

哪些情况下结果会不可靠?

片段时长超出预期:程序偶尔会切出 90 秒以上的长片段,需人工复查或强制缩到 75 秒以内;静音或长停顿导致错位:如果原视频存在长时间停顿,生成的字幕时间戳可能会产生偏移。出现这些情况时需要人工复核。

支持哪些 AI Agent?

已适配 WorkBuddy、OpenClaw、Hermes Agent、Codex、Claude Code、TRAE、ZCode 共 7 种,每种都有独立的安装说明和能力对照。

ORIGINAL SOURCE

7 个原始文件,45 个文档章节,固定在 a9f11007

上游原文完整保留在加搜服务器上,可逐节查看,也可以直接下载。 当前镜像共 7 个文件、83.7 KB。

原始 Skill 文档 上游原文完整保留,中文概述已转换为营销任务、输入资料和交付结果。

Short-Form Video Clip Pipeline — Skill

Preamble (runs on skill start)

# Version check (silent if up to date)
python3 telemetry/version_check.py 2>/dev/null || true

# Telemetry opt-in (first run only, then remembers your choice)
python3 telemetry/telemetry_init.py 2>/dev/null || true

Privacy: This skill logs usage locally to ~/.ai-marketing-skills/analytics/. Remote telemetry is opt-in only. No code, file paths, or repo content is ever collected. See telemetry/README.md.


Extract viral short-form clips (TikTok, Reels, Shorts) from long-form YouTube videos. Handles download, transcription, AI segmentation, cutting, vertical cropping, and caption burn-in.

Prerequisites

  • yt-dlp and ffmpeg installed
  • ANTHROPIC_API_KEY environment variable set
  • Python dependencies from requirements.txt installed
  • Optional: mediapipe and opencv-python for face-detected smart crop

Quick Start

Single video → clips
python3 scripts/shortform_pipeline.py \
  --url "https://www.youtube.com/watch?v=VIDEO_ID" \
  --max-clips 3 \
  --output-dir ./output
Standalone clipper (no Claude, heuristic scoring)
python3 scripts/video_clipper.py --url "https://www.youtube.com/watch?v=VIDEO_ID"

Pipeline Overview

  1. Download — yt-dlp fetches video + auto-generated VTT captions
  2. Transcribe — Whisper generates word-level timestamps (falls back to YouTube captions)
  3. Segment — Claude identifies 2–5 best 30–60s moments with hook scoring ≥7/10
  4. Cut Verification — Second Claude pass verifies each clip ends on a complete thought
  5. Cut — FFmpeg extracts each clip from the source video
  6. Vertical Crop — Layout-aware 16:9 → 9:16 conversion with face detection
  7. Caption Burn — TikTok-style word-highlighted captions (ASS format) burned in

Key Files

File Purpose
scripts/shortform_pipeline.py Full pipeline: download → segment → cut → crop → caption
scripts/video_clipper.py Standalone clipper with heuristic scoring (no Claude needed)
scripts/clip_sender.py Helper for clip delivery and review workflow

Layout-Aware Cropping

The pipeline handles four video layouts differently:

  • talking_head — Face-detected center crop using MediaPipe; audio panning fallback
  • screen_share_overlay — Stacks screen content on top, webcam bubble on bottom
  • side_by_side — Stacks screen on top, presenter face on bottom
  • gallery_view — Crops to active speaker quadrant

Claude outputs a layout_hint for each segment during segmentation.

Customization

Voice patterns

Edit VOICE_PATTERNS in video_clipper.py to match your creator's speech patterns. These boost clip scoring for authentic-sounding segments.

Segmentation prompt

The Claude prompt in shortform_pipeline.py can be customized:

  • Adjust hook_strength minimum (default: 7/10)
  • Change target duration range (default: 30–60s)
  • Modify layout hint options
Crop tuning

In video_clipper.py:

  • scale_factor — Zoom level for single face (default: 1.08)
  • desired_face_y — Target face position in frame (default: upper 35%)

Output

Each clip is output as:

  • 1080×1920 resolution (9:16 vertical)
  • H.264 + AAC encoding
  • Word-highlighted captions burned in
  • Ready for direct upload to TikTok, Reels, or Shorts

Troubleshooting

  • FFmpeg filter_complex error: Don't use -c:v copy with -filter_complex. Only -c:a copy is safe.
  • Wrong output resolution: Always crop before scaling. Verify with ffprobe -show_entries stream=width,height.
  • Caption sync issues: Run Whisper on the cut clip, not the source episode.
  • TikTok upload fails: Ensure H.264 + AAC encoding. Add -c:v libx264 -c:a aac if needed.
  • Clip too long: Claude sometimes overshoots. The pipeline auto-trims clips >90s to 75s.

来源与版本声明

本页面由加搜科技整理业务说明并托管安装文件。原始 Skill 来源渠道:GitHub; 原始项目名称:Short-Form Video Clip Pipeline; 固定版本:a9f11007aca3; 许可证:MIT。技能包内保留完整出处和许可证说明。

各 Agent 能力说明参考对应官方文档。页面不提供外部跳转。

INSTALL

长视频转短视频 Skill v1.0.0,ZIP 带 SHA256 校验

默认做法是把提示词复制给 AI Agent,让它自己下载并安装。提示词里已经写清要用完整 ZIP、装完报告目录、并先跑一个小任务验证。

METHOD 01 · 交给 AI 自己装

复制提示词

适合大多数情况。Agent 会下载 ZIP、解压、放到正确目录,并在缺少权限时告诉你需要手工做哪一步。

请帮我把「长视频转短视频 Skill」安装到我正在使用的 AI Agent。
1. 下载完整 Skill ZIP:https://www.vibemarketing.work/packages/skill-short-form-pipeline/1.0.0/skill-short-form-pipeline.zip
   注意:网页 HTML 不能当作 Skill 文件安装,必须使用 ZIP 里的完整文件。
2. 解压后保留 SKILL.md 及全部配套文件,按你所用 Agent 的 Skill 目录规则安装。
3. 安装完成后告诉我实际安装目录。
4. 用一个只读小任务验证 Skill 已被识别。
5. 如果你没有联网、下载或写目录权限,请直接告诉我哪几步需要我手工完成。
参考:原始 SKILL.md https://www.vibemarketing.work/raw/skill-short-form-pipeline/SKILL.md;安装指南 https://www.vibemarketing.work/agent-install/skill-short-form-pipeline.md

FURTHER READING

长视频转短视频 Skill 相关的实操文章

别人做同类任务时踩过的坑和总结,动手前后都值得翻一下。

一条长视频拆成短条,每条都要能单独发

一场五十分钟的产品讲解,按时间轴每五分钟切一段,切出来的东西在 TikTok 和 Reels 上站不住。因为那五分钟的开头常常是「刚才我们说了」,结尾是「下面这部分」。短视频平台上,每一条都得自己有钩

  • 短视频脚本
  • 海外社媒
  • 内容分发

TikTok别把国内口播直译过去,静音刷的人看不懂

国内拍口播,习惯从「大家好我是」起,再铺二三十秒背景,最后才出示产品。这条节奏搬到 TikTok,前三秒人已经划走。那边很多人开着静音刷,画面和字幕自己不说话,口播写得再完整也等于没发出去。 更常见的

  • 短视频脚本
  • 海外社媒
  • TikTok营销

YouTube切片别见金句就剪,每条还得有自己的标题和封面

YouTube 切片最容易做成高光合集:听见一句金句就剪,标题还用原视频那句,封面还是原视频缩略图缩小。观众在切片频道刷到时,不知道这八分钟为什么要点开。切片要当一条新视频发,就得自己有选题理由,自己

  • 海外社媒
  • 内容分发
  • YouTube

分享到 LinkedIn 的标题,别拿页面 Title 直接去灌

文章页点了分享,LinkedIn 和 X 上弹出来的卡片,用的经常是页面后台 Title。后台 Title 是写给搜索和浏览器标签的,里面会塞栏目名、品牌名、竖线分隔,拿到信息流里又长又像后台。分享卡

  • 海外社媒
  • 内容分发
  • 落地页

员工倡导别塞通稿,给提纲他们才肯用自己的号发

员工倡导做不成,多半不是大家「不够热爱公司」。市场部丢过去一篇八百字通稿,要求本周原文转发,还要带产品截图和口号。人看一眼就关了,因为那不是自己能讲的话,发到个人号上像在给公司打广告。员工愿意发出去的

  • 海外社媒
  • 个人品牌
  • B2B内容

Discord冷启动别一次开二十个频道,新人进门就迷路

Discord 或 Slack 一建好,就按大社区的样子开出二十个频道:自我介绍、随便聊聊、招聘、产品 A、产品 B、各地分会、机器人日志。熟人还没进来,界面已经像一座空城。新人点开邀请,不知道该说话

  • 海外社媒
  • 用户运营
  • 出海增长

按这个 Skill 的产出能不能直接被下一个 Skill 用上来推荐,不是固定名单。多数情况下按顺序跑完一组,比单独用一个效果更好。

出海增长#01

联盟营销 Skill

把联盟伙伴招募思路整理成包含佣金模型、归因窗口、防作弊规则和推广物料的渠道方案。

来源项目 · kostja94/marketing-skills ★ 968 · Fork 134
SEO 与 GEO#02

AI 搜索流量分析 Skill

在 GA4 与 Search Console 中识别来自 ChatGPT、Perplexity 和 AI 搜索体验的访问与转化。

来源项目 · kostja94/marketing-skills ★ 968 · Fork 134
数据与自动化#04

营销归因分析 Skill

营销归因分析把各广告平台和 CRM 里相互冲突的转化数据,整理成一份带置信区间的渠道收入归因表。

来源项目 · coreyhaines31/marketingskills ★ 49,944 · Fork 7,586
数据与自动化#05

营销动作效果验证 Skill

把营销改动前后的平台数据拉取出来,对比核心指标,生成一份决定保留或放弃该改动的验证报告。

来源项目 · ericosiu/ai-marketing-skills ★ 3,524 · Fork 683
数据与自动化#06

转化率优化 Skill

把流量数据转化为带统计显著性的 A/B 测试方案,产出包含测试变量和样本量的实验执行计划。

来源项目 · kostja94/marketing-skills ★ 968 · Fork 134

VibeMKT COMMUNITY

加入 VibeMKT 社群

微信扫码,交流营销 Skill 的选择、安装、试用与业务化改造。

加入 VibeMKT 社群的微信二维码

二维码会持续显示,关闭弹窗后返回当前页面。