社媒与红人 · video-clip-pipeline

长视频切片 Skill

把一集 60 分钟的 YouTube 视频自动下载、转录,并剪辑出 3 到 5 条带有独立上下文的短视频。

需要把过去的播客或访谈视频重新分发到短视频平台时使用。程序会自动抓取 YouTube 链接并生成逐字稿,挑出开头吸引人的片段,用 FFmpeg 无损截取 16:9 画面的短视频。产出的视频文件可以直接上传到社交媒体频道或发给剪辑人员加字幕。

WHAT IT SOLVES

把一集 60 分钟的 YouTube 视频自动下载、转录,并剪辑出 3 到 5 条带有独立上下文的短视频

把一集 60 分钟的 YouTube 视频自动下载、转录,并剪辑出 3 到 5 条带有独立上下文的短视频。跑完你拿到的是16:9 横屏格式的 MP4 视频切片文件,按照片段名称命名并保存在指定输出目录,中间一共 7 步。

最适合的真实场景

  • 01

    海外社媒运营将一小时的英文播客录像处理成三条独立短视频发往账号。

  • 02

    内容营销团队将频道里过往的直播录像批量处理,产出长尾短视频素材。

  • 03

    视频剪辑人员从包含大量口语和杂音的本地转录文本里,提取出叙事完整的片段。

  • 04

    营销团队按十人专家组评分设定 90 分阈值,筛选出具有爆款潜质的高光片段。

  • 05

    多语种运营团队将单个视频链接传给脚本,在 15 分钟内拿到带时间轴的标记文件。

你要先准备的资料

  • 目标 YouTube 视频的完整 URL 链接,或频道积压 backlog 的本地目录路径。
  • 配置在系统变量里的 Anthropic 官方 API Key,用于 Claude 读取文本并执行片段分割。
  • 本地安装并运行 Python 3.9 及以上版本,包含 openai-whisper 和 anthropic 的依赖包。
  • 系统内集成 yt-dlp 和 ffmpeg 的可执行环境,提供视频下载和视频流重组能力。
  • 设定生成的切片数量上限,例如指定参数为 3 条,或者设定最低质量分阈值为 90 分。

跑完你会拿到什么

  • 16:9 横屏格式的 MP4 视频切片文件,按照片段名称命名并保存在指定输出目录。
  • 包含逐字时间轴的本地转录 JSON 文件,记录了视频里每一句话的起止时间戳。
  • 包含片段打分与截取起止时间点的 JSON 标记文件,留存 AI 筛选与判断的结构化依据。
  • 未经人工干预由脚本自动剪辑裁出的原素材文件,可直接用于后续的二次包装或上传。

METHOD

下载原视频与字幕 → 生成本地转录文本 → 评估片段吸引力 等 7 个环节

一共 7 步。其中 5 项能力决定了换个 AI 会不会更麻烦。

  1. 下载原视频与字幕通过 yt-dlp 下载 YouTube 视频和自动生成的 VTT 字幕,输出 MP4 格式的原素材存入本地文件夹。
  2. 生成本地转录文本使用 Whisper 模型对视频进行本地转录,输出包含逐字时间戳的 JSON 文件,作为后续分段的数据源。
  3. 评估片段吸引力Claude 读取转录文本,按 1 到 10 分评估开头吸引力,默认保留 6 分及以上的片段作为候选。
  4. 校验叙事完整性AI 识别并过滤孤立语句,仅保留具备完整叙事发展脉络的段落,确保截取出的片段脱离原视频也有独立上下文。
  5. 检查切割边界Claude 校验候选片段的首尾时间戳,确保切分点落在完整的句子边界上,避免出现语音被突然截断的情况。
  6. 专家库质量打分scored_pipeline 脚本引入十人专家组机制对候选片段打分,系统只放行总分达到设定阈值(如 90 分)的片段。
  7. 输出 MP4 切片文件脚本调用 FFmpeg 按照标记文件里的时间点,把原视频重新编码裁剪成 16:9 横屏格式的 MP4 文件存入本地。

这个 Skill 用到的能力: 打开网页取正文读本地资料MCP 与连接器运行脚本多角色并行 。不同 AI 对这些能力的支持程度不一样,所以同一个 Skill 换个 AI,有几步做法会变。

WORKED EXAMPLE

出海品牌营销团队处理直播高光片段

出海品牌营销团队处理直播高光片段

出海品牌的营销团队刚结束一场长达 60 分钟的 YouTube 英文直播。社媒运营需要从中挑出三条口播连贯、语境独立的高光片段,发布在官方社媒账号上。人工整理耗时较长,且难以精准定位无断裂的完整句子。团队将这场直播的 URL 交给自动切片脚本,要求截取三条评分高于 90 分的短视频。

  1. 将直播回放 URL 填入脚本,并设定截取片段上限为 3 条。
  2. 脚本调用 yt-dlp 获取视频原文件,交由 Whisper 生成带时间戳的文本。
  3. Claude 评估文本找出叙事完整的候选片段,十人专家组给出评分。
  4. 系统挑出评分高于 90 分的三个片段,生成时间戳标记的 JSON 文件。
  5. 脚本调用 FFmpeg 按照时间戳重新编码,输出三段 MP4 视频文件。

预期结果:团队拿到了三段 MP4 格式的短视频切片和包含时间轴的 JSON 文件,切片开头和结尾均在完整句子处停止。切片内容连贯且语境独立。因脚本默认使用中等精度的 Whisper 模型,若直播里出现大量专业术语或重口音,团队仍需人工校对转录文本与字幕,再决定是否发布。

PITFALLS · VERIFICATION

视频包含大量专业术语时

最常踩的坑

  • 视频包含大量专业术语时,默认的 Whisper 模型可能输出错漏转录文本。
  • 将片段上限设为 3 条,但整段视频缺乏足够的高分内容会导致实际产出数量不足。
  • 默认截取的 16:9 横屏视频无法直接用于竖屏短视频平台,需二次处理画面。
  • YT 平台更新反爬机制会导致 yt-dlp 报错中断,原视频无法下载到本地。
  • FFmpeg 默认按关键帧切分,实际起止时间可能会和标记文件有两秒内的误差。

怎么确认这次跑对了

  • 已经形成可检查的16:9 横屏格式的 MP4 视频切片文件,按照片段名称命名并保存在指定输出目录,关键判断能回到输入资料或过程证据。
  • 已经形成可检查的包含逐字时间轴的本地转录 JSON 文件,记录了视频里每一句话的起止时间戳,关键判断能回到输入资料或过程证据。
  • 已经形成可检查的包含片段打分与截取起止时间点的 JSON 标记文件,留存 AI 筛选与判断的结构化依据,关键判断能回到输入资料或过程证据。
  • 已逐项检查「视频包含大量专业术语时,默认的 Whisper 模型可能输出错漏转录文本」等高频问题,并记录需要人工确认的下一步。
长视频切片 Skill适合哪些岗位使用?

海外社媒运营、内容营销团队、视频剪辑人员。典型场景包括海外社媒运营将一小时的英文播客录像处理成三条独立短视频发往账号;内容营销团队将频道里过往的直播录像批量处理,产出长尾短视频素材;视频剪辑人员从包含大量口语和杂音的本地转录文本里,提取出叙事完整的片段。

开始前需要准备什么资料?

至少需要目标 YouTube 视频的完整 URL 链接,或频道积压 backlog 的本地目录路径、配置在系统变量里的 Anthropic 官方 API Key,用于 Claude 读取文本并执行片段分割、本地安装并运行 Python 3.9 及以上版本,包含 openai-whisper 和 anthropic 的依赖包。资料越具体,结果越能直接用于决策。

最后能得到什么可检查的结果?

16:9 横屏格式的 MP4 视频切片文件,按照片段名称命名并保存在指定输出目录、包含逐字时间轴的本地转录 JSON 文件,记录了视频里每一句话的起止时间戳、包含片段打分与截取起止时间点的 JSON 标记文件,留存 AI 筛选与判断的结构化依据。每项都可以逐条核对来源和数字。

哪些情况下结果会不可靠?

视频包含大量专业术语时,默认的 Whisper 模型可能输出错漏转录文本;将片段上限设为 3 条,但整段视频缺乏足够的高分内容会导致实际产出数量不足。出现这些情况时需要人工复核。

支持哪些 AI Agent?

已适配 WorkBuddy、OpenClaw、Hermes Agent、Codex、Claude Code、TRAE、ZCode 共 7 种,每种都有独立的安装说明和能力对照。

ORIGINAL SOURCE

9 个原始文件,75 个文档章节,固定在 a9f11007

上游原文完整保留在加搜服务器上,可逐节查看,也可以直接下载。 当前镜像共 9 个文件、62.6 KB。

原始 Skill 文档 上游原文完整保留,中文概述已转换为营销任务、输入资料和交付结果。

Long-Form Video Clip Pipeline

Preamble (runs on skill start)

# Version check (silent if up to date)
python3 telemetry/version_check.py 2>/dev/null || true

# Telemetry opt-in (first run only, then remembers your choice)
python3 telemetry/telemetry_init.py 2>/dev/null || true

Privacy: This skill logs usage locally to ~/.ai-marketing-skills/analytics/. Remote telemetry is opt-in only. No code, file paths, or repo content is ever collected. See telemetry/README.md.


AI-powered pipeline that converts long-form YouTube episodes into standalone highlight clips. Download → Transcribe → AI Segment → Cut → Upload. A 60-minute episode becomes 3–5 clips in ~15 minutes.

When to Use

Use this skill when:

  • Converting long-form YouTube content (podcasts, interviews, talks) into highlight clips
  • Processing a YouTube back catalog into a clips channel
  • Finding the best standalone segments from video transcripts
  • Cutting video clips with verified sentence boundaries
  • Running a high-volume clip publishing operation ($0.50–1.00 per episode)

Prerequisites

System Tools
brew install yt-dlp ffmpeg        # macOS
# Or: apt install ffmpeg && pip install yt-dlp  # Linux
pip install openai-whisper
Environment Variables
  • ANTHROPIC_API_KEY — Claude API key (required for segmentation)
  • YouTube Data API credentials (optional, for automated upload)

Tools

End-to-End Pipeline
Script Purpose Key Command
longform_pipeline.py Full pipeline: download → transcribe → segment → verify → cut python3 longform_pipeline.py --url URL --max-clips 3
scored_pipeline.py Pipeline with 10-expert LLM quality scoring (only cuts 90+ clips) python3 scored_pipeline.py --url URL --min-score 90
Individual Steps
Script Purpose Key Command
clip_segmenter.py Find clip-worthy segments from Whisper transcripts python3 clip_segmenter.py --transcript file.json --output segments.json
clip_cutter.py Cut clips from segment metadata using FFmpeg python3 clip_cutter.py --source video.mp4 --segments segments.json --output-dir clips/

Pipeline Flow

YouTube URL
    │
    ▼
[yt-dlp] Download video + auto-subs (VTT)
    │
    ▼
[Whisper] Local transcription with word-level timestamps
    │
    ▼
[Claude] AI segmentation — finds 3-5 best standalone segments
    │  • Scores hook strength (1-10, minimum 6)
    │  • Ensures complete narrative arcs
    │  • Verifies clean cut boundaries
    │
    ▼
[FFmpeg] Cut clips (landscape 16:9)
    │
    ▼
[Optional] Upload to YouTube / Google Drive

Usage Examples

Full Pipeline (most common)
# Process a single video
python3 longform_pipeline.py --url "https://www.youtube.com/watch?v=VIDEO_ID" --max-clips 3

# Process from channel knowledge base
python3 longform_pipeline.py --channel my-podcast --max-clips 5

# Custom output directory
python3 longform_pipeline.py --url URL --output-dir ./my-clips/ --max-clips 4
Step-by-Step (when you need control)
# 1. Download
yt-dlp -f "bestvideo[ext=mp4]+bestaudio[ext=m4a]/best" -o "downloads/%(title)s.%(ext)s" "URL"

# 2. Transcribe
whisper "downloads/episode.mp4" --model medium --output_format json --output_dir transcripts/

# 3. Segment (finds best clips)
python3 clip_segmenter.py \
  --transcript transcripts/episode.json \
  --output segments/episode_segments.json \
  --episode-title "Episode Title"

# 4. Cut
python3 clip_cutter.py \
  --source downloads/episode.mp4 \
  --segments segments/episode_segments.json \
  --output-dir clips/
Quality-Scored Pipeline
# Only cut clips scoring 90+ from 10-expert panel
python3 scored_pipeline.py --url URL --min-score 90

# Dry run — score candidates without cutting
python3 scored_pipeline.py --url URL --dry-run
Batch Processing
# Transcribe in parallel (4 at a time)
ls downloads/*.mp4 | xargs -P 4 -I {} whisper {} --model medium --output_format json --output_dir transcripts/

# Process multiple URLs
for url in $(cat urls.txt); do
  python3 longform_pipeline.py --url "$url" --max-clips 3
done

Configuration

Whisper Model Selection
Model Speed (30min video) Accuracy Use When
base ~3-4 min ~95% Quick testing
medium ~7-10 min ~98% Production (recommended)
large ~15-20 min ~99% Noisy audio
Claude Segmentation Tuning

The segmentation prompt accepts these adjustments:

  • Hook strength threshold — Default 6. Raise to 7+ for higher quality (fewer clips)
  • Max segments — Default 5. Lower to 3 for stricter selection
  • Segment length — Default 5-15 minutes. Adjust in prompt for your format
FFmpeg Cutting
  • Default uses -c copy (stream copy) — instant, zero quality loss, but cuts at keyframe boundaries (±1-2 sec)
  • The longform_pipeline.py uses re-encoding for frame-accurate cuts at the cost of more CPU time
  • Add --buffer-start 2 --buffer-end 2 to clip_cutter.py for padding

Data Flow

YouTube URL → yt-dlp (download) → Whisper (transcribe) → Claude (segment) → FFmpeg (cut) → Clips
                                                              │
                                                              ▼
                                                    Claude (verify cut boundaries)

Cost

  • Per episode: $0.50–1.00 (Claude API only — everything else is free/local)
  • At scale (10 clips/day): ~$45–90/month
  • At scale (50 clips/day): ~$225–450/month

Dependencies

  • Python 3.9+
  • anthropic — Claude API client
  • openai-whisper — Local transcription
  • yt-dlp — Video download (system binary)
  • ffmpeg / ffprobe — Video processing (system binary)
  • requests — HTTP client (for optional upload features)

来源与版本声明

本页面由加搜科技整理业务说明并托管安装文件。原始 Skill 来源渠道:GitHub; 原始项目名称:video-clip-pipeline; 固定版本:a9f11007aca3; 许可证:MIT。技能包内保留完整出处和许可证说明。

各 Agent 能力说明参考对应官方文档。页面不提供外部跳转。

INSTALL

长视频切片 Skill v1.0.0,ZIP 带 SHA256 校验

默认做法是把提示词复制给 AI Agent,让它自己下载并安装。提示词里已经写清要用完整 ZIP、装完报告目录、并先跑一个小任务验证。

METHOD 01 · 交给 AI 自己装

复制提示词

适合大多数情况。Agent 会下载 ZIP、解压、放到正确目录,并在缺少权限时告诉你需要手工做哪一步。

请帮我把「长视频切片 Skill」安装到我正在使用的 AI Agent。
1. 下载完整 Skill ZIP:https://www.vibemarketing.work/packages/skill-video-clip-pipeline/1.0.0/skill-video-clip-pipeline.zip
   注意:网页 HTML 不能当作 Skill 文件安装,必须使用 ZIP 里的完整文件。
2. 解压后保留 SKILL.md 及全部配套文件,按你所用 Agent 的 Skill 目录规则安装。
3. 安装完成后告诉我实际安装目录。
4. 用一个只读小任务验证 Skill 已被识别。
5. 如果你没有联网、下载或写目录权限,请直接告诉我哪几步需要我手工完成。
参考:原始 SKILL.md https://www.vibemarketing.work/raw/skill-video-clip-pipeline/SKILL.md;安装指南 https://www.vibemarketing.work/agent-install/skill-video-clip-pipeline.md

FURTHER READING

长视频切片 Skill 相关的实操文章

别人做同类任务时踩过的坑和总结,动手前后都值得翻一下。

YouTube切片别见金句就剪,每条还得有自己的标题和封面

YouTube 切片最容易做成高光合集:听见一句金句就剪,标题还用原视频那句,封面还是原视频缩略图缩小。观众在切片频道刷到时,不知道这八分钟为什么要点开。切片要当一条新视频发,就得自己有选题理由,自己

  • 海外社媒
  • 内容分发
  • YouTube

一条长视频拆成短条,每条都要能单独发

一场五十分钟的产品讲解,按时间轴每五分钟切一段,切出来的东西在 TikTok 和 Reels 上站不住。因为那五分钟的开头常常是「刚才我们说了」,结尾是「下面这部分」。短视频平台上,每一条都得自己有钩

  • 短视频脚本
  • 海外社媒
  • 内容分发

分享到 LinkedIn 的标题,别拿页面 Title 直接去灌

文章页点了分享,LinkedIn 和 X 上弹出来的卡片,用的经常是页面后台 Title。后台 Title 是写给搜索和浏览器标签的,里面会塞栏目名、品牌名、竖线分隔,拿到信息流里又长又像后台。分享卡

  • 海外社媒
  • 内容分发
  • 落地页

TikTok别把国内口播直译过去,静音刷的人看不懂

国内拍口播,习惯从「大家好我是」起,再铺二三十秒背景,最后才出示产品。这条节奏搬到 TikTok,前三秒人已经划走。那边很多人开着静音刷,画面和字幕自己不说话,口播写得再完整也等于没发出去。 更常见的

  • 短视频脚本
  • 海外社媒
  • TikTok营销

员工倡导别塞通稿,给提纲他们才肯用自己的号发

员工倡导做不成,多半不是大家「不够热爱公司」。市场部丢过去一篇八百字通稿,要求本周原文转发,还要带产品截图和口号。人看一眼就关了,因为那不是自己能讲的话,发到个人号上像在给公司打广告。员工愿意发出去的

  • 海外社媒
  • 个人品牌
  • B2B内容

Discord冷启动别一次开二十个频道,新人进门就迷路

Discord 或 Slack 一建好,就按大社区的样子开出二十个频道:自我介绍、随便聊聊、招聘、产品 A、产品 B、各地分会、机器人日志。熟人还没进来,界面已经像一座空城。新人点开邀请,不知道该说话

  • 海外社媒
  • 用户运营
  • 出海增长

按这个 Skill 的产出能不能直接被下一个 Skill 用上来推荐,不是固定名单。多数情况下按顺序跑完一组,比单独用一个效果更好。

内容与创意#02

专家评审 Skill

自动组建 7 到 10 人的虚拟专家团队,对文案、落地页或营销方案进行打分并提出修改建议,直到评分达到 90 分。

来源项目 · ericosiu/ai-marketing-skills ★ 3,524 · Fork 683
SEO 与 GEO#03

导航站收录 Skill

把产品基础信息转为分层的导航站收录档案,按梯队分发到 Product Hunt 与 AI 工具集,获取外链与曝光。

来源项目 · coreyhaines31/marketingskills ★ 49,944 · Fork 7,586
海外广告投放#04

LinkedIn Ads 投放 Skill

为 B2B 获客设计 LinkedIn 广告目标、受众、素材、表单和预算结构。

来源项目 · kostja94/marketing-skills ★ 968 · Fork 134
  • 01

    海外社区论坛推广 Skill

    这个 Skill 产出的copy、creative_matrix,正好是它需要的输入,可以直接接着跑

  • 02

    专家评审 Skill

    这个 Skill 产出的copy、creative_matrix,正好是它需要的输入,可以直接接着跑

  • 03

    导航站收录 Skill

    这个 Skill 产出的copy、creative_matrix,正好是它需要的输入,可以直接接着跑

  • 04

    LinkedIn Ads 投放 Skill

    这个 Skill 产出的copy、creative_matrix,正好是它需要的输入,可以直接接着跑

  • 05

    TikTok Ads 投放 Skill

    这个 Skill 产出的copy、creative_matrix,正好是它需要的输入,可以直接接着跑

  • 06

    TikTok 营销 Skill

    这个 Skill 产出的copy、creative_matrix,正好是它需要的输入,可以直接接着跑

VibeMKT COMMUNITY

加入 VibeMKT 社群

微信扫码,交流营销 Skill 的选择、安装、试用与业务化改造。

加入 VibeMKT 社群的微信二维码

二维码会持续显示,关闭弹窗后返回当前页面。