把 AI 视频提示词,从“画面描述”升级成“真实素材设计”。
一个专门为 AI 视频生成设计的真实感提示词 Skill。
它不只帮你写“电影感、高清、光影漂亮”。 它会先判断这段素材是谁拍的,用什么设备拍的,在哪个年代拍下来的,再把设备缺陷、自然失误、环境声音和时间轴写进提示词。
用户输入:
纽约街头早晨
Skill 不会只输出“cinematic morning street, beautiful light”。它会先把这段视频设定成一段有来源的真实素材:
2020 年代,一个路人用智能手机竖屏在纽约曼哈顿街角随手拍到的早晨通勤片段。
然后生成结构化视频提示词:
主要角色:
一名 30 岁左右的纽约上班族,深灰色羊毛大衣,白色棉质衬衫,黑色直筒长裤,左手拿着纸质咖啡杯,右肩背着黑色通勤包。短发被晨风吹得有几缕贴在额头,脸上有真实皮肤纹理和轻微疲惫感。在整个视频中保持一致的身份、服装、发型和外貌。
地点:
清晨 7 点半的纽约曼哈顿街角,人行道边有湿润的柏油路面、黄色出租车、冒着热气的下水井盖、早餐餐车、不锈钢咖啡壶、红绿灯按钮、地铁站楼梯口和刚升起的阳光。
摄像风格:
智能手机竖屏拍摄,9:16 竖构图,轻微过度锐化和 HDR 处理感,走路时画面有上下浮动,光线从阴影切到阳光时曝光短暂波动。没有横屏。没有三脚架稳定。没有专业布光。
时间轴:
00:00-00:02 镜头从地铁站出口抬起,先拍到湿润的人行道,再对准街角。
00:02-00:04 上班族从地铁口走出来,下水井盖冒出的白色蒸汽从他腿边飘过。
00:04-00:06 他停在斑马线前看红灯,阳光从两栋楼之间落到大衣肩部,曝光突然变亮又恢复。
...
这类提示词会让模型明确素材身份:一段路人手机里真实存在过的城市清晨,而非广告片或旅游宣传片。
用户输入:
一个韩国老社区,下午,女生走过小巷,想要很真实的家庭录像感
Skill 会切换到 2000 年代消费级 DV 设备包:
中等数字压缩伪影,褪色的色彩,柔和的对比度,轻微传感器噪点,强烈手持抖动,频繁自动对焦搜索,在阳光和阴影间移动时曝光波动。
没有稳定。没有电影化的摄像机移动。没有现代色彩分级。
它还会在时间轴里加入非完美事件:
00:04-00:06 女生经过晾衣绳,白色衬衫在风里轻轻晃动,镜头稍晚才跟上她的转身。
00:06-00:08 一只猫从巷口走过,她停下来低头看,自动对焦短暂落到猫身上再回到她的脸。
00:12-00:14 镜头垂下拍到水泥地和拍摄者鞋尖,然后突然切黑,像摄像机被关掉。
这类真实感来自缺陷和生活细节,继续堆风格词反而会把画面推回 AI 样片。
很多 AI 视频 prompt 看起来完整,生成后还是一眼假。
常见问题是:
- 运镜太稳,像自动生成的样片
- 画面太干净,没有真实设备的缺陷
- 人物像摆拍,动作没有生活逻辑
- 场景自动变成广告片、咖啡馆、商业街
- 音频和画面不对应
- 镜头之间没有时间推进,只是漂亮画面拼贴
- 角色跨镜头换脸、换衣服、换发型
真实视频提示词要写清楚素材来源:谁拍的,为什么拍,用什么设备拍,拍摄时发生了哪些小失误。
- Seedance、Sora、Kling、Runway、Veo 等 text-to-video / image-to-video prompt
- 真实街拍、家庭录像、DV 怀旧、VHS、Super 8 胶片、手机竖屏、监控录像
- 城市清晨、社区小巷、旅行随拍、生活片段、纪录片观察
- 想去掉 AI 视频里过度干净、过度稳定、过度商业调色的创作者
- 想把一句模糊场景扩展成 10 到 15 秒完整视频提示词的人
- 需要角色一致性、时间轴、环境声音和负面约束的短视频工作流
这个 Skill 会把一个视频想法拆成 7 个部分。
1. 主要角色:谁出现在画面里,外貌和服装如何保持一致
2. 地点:具体空间、时代元素、光影和环境细节
3. 视觉风格:真实感层级和素材气质
4. 摄像风格:设备类型、画面缺陷、操作失误、负面约束
5. 时间轴:10 到 15 秒内每个镜头发生什么
6. 音频:现场声音和环境声音如何对应画面
7. 目标:这段素材最终要像什么
它内置三类参考库。
不同设备会产生不同的真实感。
2000 年代消费级 DV:压缩伪影、褪色、手持抖动、自动对焦搜索
VHS 家用摄像机:扫描线、色彩溢出、时间戳、低分辨率
Super 8 胶片:胶片颗粒、暗角、划痕、18fps 卡顿
智能手机竖屏:9:16、HDR 处理、电子防抖、手指擦过镜头边缘
监控摄像头:高位俯视、低帧率、时间戳、无声
它会把抽象词翻译成可拍到的现象。
温暖:阳光透过树叶、织物微微摇晃、杯口热气、人物拨头发
孤独:大面积负空间、空旷街道、青白色荧光灯、脚步回声
紧张:灯管闪烁、走廊阴影、人物频繁回头、远处金属碰撞声
生活气息:摊贩动作、蒸汽油烟、多人交谈、自行车铃
输出前检查:
角色是否一致
地点是否具体
摄像段是否有物理缺陷
时间轴是否有非完美事件
音频是否和画面对应
有没有混进广告片式运镜和商业调色
git clone https://github.com/zhouwei713/seedance-prompt.git \
~/.hermes/skills/creative/realistic-video-prompting重启 Hermes,或开启新会话后即可使用:
realistic-video-prompting
如果你不使用 Hermes,也可以直接把 SKILL.md 放进 Claude、Codex、Cursor、OpenCode 或其他支持 Skill / long prompt 的 Agent 环境里。
直接阅读:
SKILL.md
references/camera-aesthetics.md
references/atmosphere-dictionary.md
references/anti-ai-checklist.md
你可以这样说:
纽约街头早晨,真实手机随拍感,15 秒
韩国老社区,一个女生下午走过小巷,像 2000 年代 DV 家庭录像
深夜便利店门口,一个人等车,孤独一点,要监控录像感
帮我把这个视频 prompt 改得更真实,去掉 AI 感
.
├── README.md
├── SKILL.md
├── references/
│ ├── anti-ai-checklist.md
│ ├── atmosphere-dictionary.md
│ └── camera-aesthetics.md
└── LICENSE
真实感不靠多加几个“cinematic”“ultra realistic”“8K”。
真实感来自素材身份:谁在拍,拿什么设备拍,拍摄者有没有经验,现场光线和声音怎么变化,镜头里出现了哪些不完美的小事。
如果不写这些,视频模型会自动补成它最擅长的样子:稳定、干净、对称、商业调色、像样片。
这个 Skill 的价值,是把“真实素材”的判断流程固定下来,让每次生成 AI 视频前都先过一遍设备、年代、空间、动作、声音和失误。
MIT License.