让 coding agent 当导演拍数字人视频?2.6K Star 开源技能:一张授权照片出片,9 种风格一句话开做

让 coding agent 当导演拍数字人视频?2.6K Star 开源技能:一张授权照片出片,9 种风格一句话开做

AI 数字人视频的活儿,能不能全丢给 coding agent 干?lanshu-create-ai-presenter-video(作者岚叔)把这个想法做成了一个标准的 Agent Skill:你在 Claude Code、Codex、Gemini CLI、Cursor、OpenCode 里说一句”用这份稿子和这张照片做个 30 秒数字人视频”,agent 就照着 SKILL.md 把剧本、配音、数字人生成、对口型、字幕、剪辑、渲染、质检一路跑完——2.6k Star、404 Fork、MIT 协议。

它的口号很直白:topic 或剧本进来,验证过的成片出去。没过解码和响度检查的文件,一律不算交付。

两条路线,agent 自己选

路线 视频长什么样 你提供什么 付费环节
数字人(Presenter) 真人形象的数字人出镜讲解,字幕+关键词动效辅助,默认 9:16 剧本 + 一张有授权的清晰人像 配音 + 数字人视频生成
风格讲解(Styled) 不出镜,每句旁白都被”演”在画面上,默认 16:9 剧本(或自己的录音) 仅配音(自己录音则免费)

你不需要事先懂这些名词——直接描述想要的视频,agent 推断路线;不确定就问你一次,并甩出风格图库让你挑。

同一个 KV cache 知识点,被九种视觉风格各"演"了一遍(图:官方仓库)
同一个 KV cache 知识点,被九种视觉风格各”演”了一遍(图:官方仓库)

九种风格,一套合同

风格讲解路线内置九种可复用的视觉套件:社论纸感、科技 HUD、笔记本、纸立体书、波普漫画、3D 一镜到底、工程制图纸、粉笔板、黏土小镇。九种风格共用一套合同——词级时间轴字幕、章节标签、表演式收尾句、一帧回顾——差别只在”想法怎么被演出来”。

新主题丢进去,几条命令就是一个可播放的草稿:配音、词时间、字幕、章节、收尾、音效全部生成,agent 再逐句把场景表演出来。九种风格的草稿可以一次全出(new_topic.sh),零额外成本——因为风格路线唯一付费的只有配音,而且按句缓存,改哪句只重配哪句。

当导演的规矩:证据门禁 + 花钱前先报价

这个技能最有意思的部分不是生成,是工程纪律:

  • 音频锁轴:定稿旁白是唯一主时钟,数字人动作、字幕、剪辑点、成片时长全部对齐到它——对口型和场景边界不会飘。
  • 八道证据门:从 intake 到 verified 共 8 个生产状态,check_state.py 从磁盘上的实际产物算出来,agent 不能自己口头宣称”做完了”。想跳步?状态检查直接非零退出。
  • 花钱前先报价:第一次付费调用前,agent 必须讲清楚要上传什么、要生成多少秒、单价多少、试拍多大、重试上限几次;远端任务中断先按保存的 task ID 续查,不重复扣费;同一类失败被毙掉三个付费候选就停手复盘。
  • 交付即验收:母版和分享版全量解码 + 响度检查(−16 LUFS ±0.5,真峰值 ≤ −1 dBTP),还要排查黑场和冻结帧,附带 contact sheet 和交付报告。

换句话说,它把”AI 视频工作流”当成软件工程流水线在管:状态可计算、成本可审计、产物可验证。

上手

装进你 harness 的 skills 目录(文件夹名必须保持 lanshu-create-ai-presenter-video):

git clone https://github.com/cclank/lanshu-create-ai-presenter-video.git \
  ~/.claude/skills/lanshu-create-ai-presenter-video

然后直接说需求就行,多数 harness 会自动按描述选中这个技能:

用这份脚本和这张照片做一条 30 秒 16:9 数字人视频,带实时字幕。
做一个 40 秒的 RAG 讲解视频,不要出镜。都有哪些风格?

不支持 Agent Skills 的 agent 也行:clone 到任意目录,开场让它”读 SKILL.md 并严格按流程执行”。

诚实门槛

  • 本体只是技能,不含也不绑定任何一家生成服务:数字人路线需要你能调到配音、数字人视频、对口型中的至少各一个能力(云 CLI、API 或本地模型都行);风格路线需要 MiniMax API key(配音+词级时间戳的来源),或者你自己录好旁白。
  • 环境要求:Python 3.9+、带 ffprobe 的 FFmpeg、Bash/jq/awk/sed;风格路线另需 Node.js(HyperFrames 走 npx)和 rsync。
  • 安全是硬约束:人像权利和成年出镜状态必须在上传前确认,声音克隆必须显式授权,仓库里没有任何密钥或签名 URL。

对正在用 coding agent 做内容的团队来说,这个仓库更大的参考价值在工作流设计本身:怎么让 agent 的每一步都留下可验证证据、怎么把付费操作关进笼子、怎么用一个 markdown 技能把任意 harness 变成视频流水线——即使你不用它出数字人,这套门禁思路也值得抄。


仓库:github.com/cclank/lanshu-create-ai-presenter-video | 技能生态:agentskills.io | 作者 X:@LufzzLiz

Comments

No comments yet. Why don’t you start the discussion?

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注