跳转到内容

文艺片 / 照片故事

你会得到一条用照片和几段小视频做成的故事片:由 AI 配音或你自己克隆的声音讲述,或者按音乐小节卡点。画面里有推拉摇移、拼贴、地图、时间轴、引语、红笔圈重点和胶片质感,配中英双语字幕、带章节进度的页眉、章节卡、封面和发布文案。

一位画家素描主题的照片故事联系表:带章节的页眉、章节卡、拼贴、草稿与成品对比、放大镜、构图三角形和中英双语字幕

  • 照片,可以加几段手机小视频。适合看展、旅行、讲一位艺术家、一段历史或一个产品。
  • 一个故事:带中英文句子的旁白脚本;如果只配音乐,有章节和字幕文字就够了。
  • 要旁白的话:用 OpenAI 配音需要 OpenAI API key;用自己的声音则准备一段 5 到 15 秒、干净的录音,在本地克隆。
  • 只配音乐的话:一首你有使用权的曲子,节拍清楚的最好。

口播素材不适合这个流程,请看口播短视频。

  1. 在首页输入框里描述这个故事,把照片和视频拖进来。说清楚要旁白还是只配音乐、发哪个平台。
  2. 方案里写明模式、平台、音色和标题。
  3. 选片与章节。故事写成一份脚本:有哪些章节、每句的中英文、每句下面放哪些镜头和特效。可以让 Agent 根据你的照片和笔记起草,你再调整。
  4. 版式确认。先渲染几张静帧,在花钱配音之前检查字幕、页眉和裁切。
  5. 批量生成配音(或分析音乐)、渲染视频,并写好封面、字幕、文稿和文案。
  6. 审片,发布。

把照片文件夹和故事交给 Claude。技能按 workflows/photo-story 来做:写好 work/spec.py,先渲染版式静帧给你看,再逐句配音。每句最多录三遍,选转写结果和脚本最吻合的一遍。录好的会缓存,所以换镜头不会重新计费,改一句也只重配那一句。

终端窗口
python3 $VSTUDIO/workflows/photo-story/scripts/photostory/render.py work/spec.py --stills 2,10,25,40
python3 $VSTUDIO/workflows/photo-story/scripts/photostory/tts.py work/spec.py --sample
模式 节奏怎么定
旁白(默认) 配音决定时间线,下面可以垫一层音乐。配音用 OpenAI TTS,或在 Apple Silicon 上用 Qwen3-TTS 本地克隆你自己的声音。
音乐 没有配音。每一刀都落在小节(或节拍)上,你的句子变成安静的标题字。音乐自己的段落变化靠近章节时,章节就从那里开始。

克隆用的参考录音放在本地的人设文件里,不要放进仓库。

类别 可选
镜头类型 单张照片或视频、拼贴、胶片条、左右对比、宫格、倾斜、叠卡、引语、路线地图、圆环徽章、横排。
照片运动 推近、拉远、左摇、右摇、上移、下移、静止、镜像翻转。
叠加效果 素描、显影、微光、灰尘、针刺;红笔圈重点;构图三角形;移动放大镜;时间轴;数字滚动。
转场 淡入淡出、推、甩、闪白、缩放、圆形开合、漏光、墨迹、百叶窗、撕纸、上滑、硬切。
胶片质感 选定的章节加颗粒、暖调降饱和、闪烁、划痕和灰尘。
选项 默认 作用
模式 旁白 narration 旁白或 music 音乐卡点。
配音引擎 openai openai,或 clone(你自己的声音,离线)。
平台 小红书 3:4 决定画布、安全区、字幕大小、响度和封面尺寸。
画布 跟随平台 也可直接指定:3:4(1080×1440)、3:4 高清(1620×2160)、9:16、16:9。
卡点粒度 小节 音乐模式下按每小节、每拍或每两拍切。
视频原声 静音 每段可以设为前景原声、环境声或静音。有人说话的片段可以用统一的去口癖工具清理。
  • 「用这 40 张照片做一条 3:4 的看展视频,三个章节,中英双语字幕,最后一章加胶片回忆感。」
  • 「旁白用我自己的声音,参考录音在我的 voice 文件夹里。」
  • 「这次不要旁白,按这首歌的小节卡点,60 秒左右,发抖音。」
  • 「草稿那张多停一会儿,在手的位置加个放大镜。」