帖子介绍了一套用 Claude Design、TTS、STT 和 Claude Video export 制作解说视频的流程:先让 Claude 写脚本,再把脚本交给文本转语音模型生成音频,随后用语音转文本模型从音频中提取关键时间戳,最后把脚本和 STT 输出一起交回 Claude Design,生成与音频对齐的动画,并导出带声音的 MP4。作者强调,Claude Design 本身能做出不错的动画,但与常规直接生成动画或单独配 TTS 的做法不同,难点在于最终视频缺少音频,且普通 TTS 音频不会自动和画面节奏匹配,因此引入 STT 时间戳作为对齐依据。信息边界也很明确:帖子只概述流程,并称完整提示词在外部拆解中;正文没有给出具体模型选择、成本明细、成片质量评测或稳定性数据,因此可参考的是音画对齐思路,而不是…
来源:Reddit(r/artificial)
原始发布时间:2026-05-19 15:07