AI 视频给 AI 智能体用MCP · SKILL
AI 照片说话
上传一张人像照片和一段录音。照片里的人会说出你的音频,视频和录音一样长。
会在工作室里打开“照片说话”,文件到那里再添加。没登录的话要先登录。

使用方法
照片说话怎么用
添加人像照片
上传一张照片,里面只有一张清晰的脸,正对镜头。支持 PNG、JPEG或WEBP 格式,最大 20 MB。
添加音频
上传要让这个人说的话或唱的歌(MP3、WAV、M4A;3 秒 – 2 分钟)。视频和音频一样长。
描述动作并生成
写明人物说话时该怎么动:表情、头部动作、情绪。然后查看价格并生成。
使用场景
大家用 AI 照片说话做什么
留言和祝福
录一段生日祝福或感谢的话,让你自己的照片替你说出来。
口播视频
用一张大头照和一段配音做出口播视频,用来讲解、上课或介绍产品更新,不用拍摄。
AI 角色
拿一张你用 AIdol(DER 的 AI 网红生成工具)做的角色照片,让它说出你录的一句台词。
会唱歌的照片
把说话的音频换成一首歌,照片里的人就会唱出来。
对比
照片说话和视频对口型的区别
两者都能让人说出你的音频。看你手上有什么素材来选。
| 你会得到 | 照片说话 | 视频对口型 |
|---|---|---|
| 你上传 | 一张照片和一个音频文件 | 一条视频和一个音频文件 |
| 会发生什么 | 静态人像动起来,开口说话 | 视频里的嘴型跟着新音频走 |
| 适合 | 手上只有一张照片时 | 已经有这个人的视频时 |
已经有视频了?AI 视频对口型
为什么选 DER
让照片开口说话
一张人像照片
照片清晰、脸容易看清,效果会更好。
你自己的音频
上传说话或唱歌的音频,照片里的人会照着它开口,视频时长跟着音频走。
引导动作
加一段简短的提示词,说明人物说话时该怎么动。
怎样效果更好
选对照片和音频,效果更好
脸要容易看清,声音要清楚。上传之前两样都检查一下。
照片
建议
- 只有一张脸,正对镜头
- 整张脸都在画面里,而且对焦清楚
- 光线均匀
避免
- 多人合照
- 墨镜、口罩,或者手挡着嘴
- 侧脸照,或者脸转得太偏
音频
建议
- 说话或人声清楚
- 时长:3 秒 – 2 分钟
- MP3、WAV、M4A,最大 50 MB
避免
- 音乐或噪音盖过人声
- 几个人同时说话、互相盖住
示例
照片说话示例
按量付费
无需订阅,没有每月最低消费:只有生成时才消耗积分。最低充值 US$5。
生成失败不扣积分
如果生成失败,这次用掉的积分会自动退回账号余额。
常见问题
AI 照片说话常见问题
AI 照片说话是什么?
用一张静态人像和一段音频生成的短视频。照片里的人的嘴唇、脸和头会跟着音频动,有时也叫照片对口型。
怎么让照片开口说话?
上传一张人像照片,上传音频,描述人物该怎么动,查看价格,然后生成。视频和你的音频一样长。
可以用什么音频?
MP3、WAV、M4A 格式的录音,最大 50 MB。视频和音频一样长。
照片说话和数字人对口型有什么区别?
照片说话每次都是让你上传的那张照片动起来。数字人对口型用的是现成的数字人,或者你之前定制的数字人,让它说出你的音频。那个工具是“AI 对口型”。
可以用谁的照片和声音?
你自己的,或者本人同意的。不要用照片说话做出来的视频冒充真实内容。
AI 照片说话是免费的吗?
不是。每条视频都要消耗积分。价格按音频时长计算,开始之前工作室会显示。积分通过一次性充值获得,最低充值 US$5。无需订阅,生成失败会退还积分。
我的结果会保存多久?
7 天。想留的可以保留进“Library”(作品库),最多 200 个,这样就不会过期。
现在就让照片说话
照片说话