跳转到内容

访谈切成问答

每个问题一条:开头是问题(文字卡、提问者的原声,或两者都有),接着是回答,「好问题」和口头禅、停顿都剪掉了;问题一直显示在画面上方,说话人按角色标注(主持人、嘉宾;Host、Guest),除非你给了名字。

  • 一段对话录像。需要上下分栏、三人同框和名字打码的宫格会议录像,更适合用播客与访谈切片;这个配方会顺手帮你写好它的选段表。
  • 嘉宾的同意。流程会停下来等你确认,永远不替你决定。
  • 名字:想显示名字而不是角色,就告诉千剪。名字从来不会去猜。
  1. 首页选 访谈切成问答(或直接说「把这期访谈切成一问一答的切片,中英双语字幕」),把录像拖进来。
  2. 嘉宾同意:确认嘉宾同意发布(露脸或遮脸)。
  3. 审核问答。千剪(Reelfold)分辨谁在什么时候说话,找出每个问题和紧跟着的回答,并把回答剪紧。可以改问题文字、回答保留的片段或角色。
  4. 渲染:每对问答按每种平台画幅各出一条,带字幕(默认双语)。
  5. 审片发布。

方案和审核里都会写明用了哪种方法:

方法 什么时候
本地说话人分离(pyannote) 本机装了并且有本地模型。
声纹聚类 其他情况:按声音区分。声音相近时方案会注明「不确定」,请在审核时检查角色。
无 只有一个人说话,或者语音太少:照样能找到问题,但不画说话人标签。

问问题最多的人是主持人。

终端窗口
python -m vstudio.qa plan --source talk.mp4 --out work/pairs.json --segments work/segments.yaml --count 8
python -m vstudio.qa render work/pairs.json --source talk.mp4 --platforms xiaohongshu:full,douyin \
--question audio --subtitles bilingual --out out
选项 默认 作用
开头怎么给问题 原声 audio 提问者原声、card 问题卡(停留 2.5 到 6 秒,够读完)、both 都要。
问答条数 8 保留几对问答;回答 15 到 75 秒。
语速 1.1 回答的语速,保持音高。
名字 (角色) S1=Ziyun,S2=Alex,显示名字而不是「主持人 / 嘉宾」。
嘉宾遮脸 不遮 sticker 贴纸或 blur 模糊,作用在画面主脸或你给的区域。
字幕 双语 bilingual、mono 或 translated。
  • 「把这期访谈切成一问一答的切片,中英双语字幕」
  • 「把这期播客切成问答,问题用文字卡,嘉宾遮脸」
  • 「辅导课录像:每个问题一条,名字 S1=教练,S2=学员」