照片说话 — 开源神级AI技能让照片开口说话,一键生成漫画对话气泡
- 免费干货
- 7小时前
- 32热度
- 0评论
开头先问一句

不知道你们的手机相册里,是不是也塞满了这种东西:
路边瞎拍的野花、沙雕特效视频截图、街角随手按下的风景照……
删吧觉得可惜,发朋友圈吧又觉得拿不出手。
直到前几天我突然冒出个脑洞:
这些照片里的东西,如果会说话呢?
就像漫画里那样,把物体识别出来,配上符合情境的对话框。
一张废片立马变身叙事海报。
做完之后效果真的绝了,生动得不行。
于是我和朋友老科把它做成了一个开源 Skill。
下面聊聊它做了什么、背后的开发逻辑,以及怎么借鉴优秀开源项目来实现这个效果。
老铁们,坐稳发车。
核心效果:从贴图到对话
在讲技术之前,先看三组实测对比,直观一点。
场景一:路边手持的红玫瑰(浪漫告白)
原图就是一朵随手抓到的红玫瑰。
经过 Skill 处理,AI 自动识别出手里的花是发声主体。
在花瓣上方的绿叶虚化背景里,弹出一个经典漫画对话框:
“我积攒了一整个春天的盛开,只为了遇见你。”
手部肌肤质感、腕表反光、花瓣丝绒纹理——全部像素级保留。
没有任何二次元涂抹感,浪漫和生活气息扑面而来。

场景二:案头的石雕佛像摆件(禅理开示)
原图是一尊青绿墙面加顶光下的石刻佛首造像。
旁边还放着绿植和汾酒,生活感拉满。
处理后,AI 自动定位到佛像。
在佛首头顶上方的光影留白处,浮现出禅意对话框:
“若无闲事挂心头,便是人间好时节。”
砂岩颗粒感和宁静光影都原原本本保留下来了。
生活烟火气和超脱禅意,就在那一刻融合了。

场景三:视频聊天里的搞怪好友(神经发疯)
原图是一张朋友戴着滑稽大便特效滤镜的视频通话截图。
处理后,AI 自动避开左上角的画中画和小窗。
在右上角弹出搞怪对白:
“医生说我现在的精神状态领先全人类五百年!”
界面、灵动岛完全无损。
对话框尾巴精准指向大便头套咧开的嘴巴,笑果直接拉满。

P 图软件它不香吗
市面上能给图片加文字的 App 确实不少。
但它们有个硬伤:
你得自己想文案、自己调位置,最后出来的效果就像一张生硬的表情包。
而本 Skill 的优势在于——内置了自动化图文互动与语义理解引擎。
智能语义识别与文案生成
它不会随便往你照片里塞废话。
模型会先读你的照片:
这是一朵正在盛开的花?一尊静坐的佛像?还是那位戴搞怪滤镜的好友?
然后根据物体属性和画面情绪,生成最符合当下语境的台词。
花朵说情话,佛像吐禅理,好友开启发疯文学——各玩各的。
字体、材质与气泡的自动匹配
这里引入了系统的 Recipe 配方架构。
如果是花,气泡线条柔润优雅,带着浪漫气息。
如果是佛像,对话框偏居一隅,静谧安详。
如果是搞怪截图,气泡则充满冲击力。
文字居中加粗,层次分明。
拒绝二次元重绘,100% 保护生活原图

很多人讨厌 AI 改图,是因为动不动就把真人真物变成动漫脸。
SpeakUp 坚决不做破坏原图的画风重绘。
真实照片像素完全保真,仅仅叠加带有微阴影的对话框。
就像直接在洗出来的真实相片上,贴了一枚精巧的对白贴纸。
开发与技术原理解析
做类似设计 Skill 的过程中,我一直在琢磨一件事:
AI 在视觉创作里到底应该扮演什么角色
这个项目沿用了 Yingzao 的核心开发理念:
程序负责测量、碰撞、对齐这些纪律活。
大语言与图像模型负责语义提取、幽默文案与光影重构。

在开发层面,工作流分成以下几个核心步骤:
第一步:照片预检与对象框选
调用图像模型之前,程序会先做确定性检查——photo_preflight.py。
利用显著性检测与轮廓分析算法,识别原图中的主要实体。
算出物体的边界。
由此划定 60% 核心禁穿区 和 安全排版区。
确保弹出的对话框绝不会遮挡花蕊、佛面或朋友的面部——这点很关键。
第二步:三维视觉输入合并机制
和常规给图片套滤镜不一样,生成过程同时输入三样核心信息:
校正后的原图:负责保留物体的真实身份、摄影质感与光影锚点。
气泡排版垫图:通过代码生成的稀疏排版垫图,由 bubble_compose.py 负责生成。
告诉图像模型对话框该出现在哪里,以及怎么与原图物体遮挡、避让,尾巴指向谁。
主导风格配方:决定对话框的视觉风格。
比如经典白底气泡、爆裂吐槽气泡、极简冷幽默、涂鸦便签等等。
图像模型的任务就是把这几样融合进同一个视觉世界里。
对话框甚至会受到照片环境光的影响,自带自然的软阴影——仿佛它原本就在那里。
第三步:生成前门控与单次交付
生成前通过 prepare_generation.py 执行硬门控校验。
只有返回 READY 才会调用模型,避免浪费。
生成后把判断权交还给用户。
直接交付成图可以节省不必要的 Token 消耗。
如果你提出反馈,再基于当前图像做定向修改——比如:“把对话框里的字换成更生气的语气”。
适用范围与运行要求
适合的场景:日常生活抓拍、花草植物、宠物生活照、桌面静物与摆件、朋友聚会随拍、搞怪视频聊天截图。
凡是带点生活感的场景,它都能处理得不错。
运行要求:需要一个支持 Skills 功能、能够读取本地图片并调用图像生成工具的 Agent。
比如 Trae、WorkBuddy、Codex 这些都可以用。
30 秒开始体验

先把项目放进 agent 智能体的工作目录里。
然后直接对智能体说出以下指令:
将 speakup 技能解压至当前工作区的 .agents/skills/speakup,并通过技能工具加载。
安装完成后,在 Agent 中直接拖入你的真实生活照片。
用自然语言描述你的需求就行了。
示例 1(花朵告白):
用 $speakup 处理这张手持玫瑰的照片,让花朵说出告白的浪漫情话
示例 2(静物禅理):
用 $speakup 处理这张案头佛像照片,让佛像说一句充满禅理的解压短句。
示例 3(好友搞怪发疯):
用 $speakup 处理我和朋友的视频聊天截图,让戴着大便特效的朋友说出很神经的搞笑台词。
如果对生成的文案不满意,可以继续跟 Agent 聊。
比如:“台词不够搞怪,帮我把文案改成‘我刚刚用意念拯救了银河系’,然后把气泡尾巴微调一下。”
最后想说的话
说实话,把照片变成故事,需要的其实不是更大的模型。
很多时候大家讨论图文创作,更本质的诉求可能是:
给那些平淡的生活碎片,递一个讲真话的话筒。
规则管住边界,模型负责发散。
不喧宾夺主,但足够有戏。
我觉得这或许才是人与 AI 协作里最舒服的分工方式。
多模态 Agent 的演进才刚刚起步。
后面的空间还很大,真的。
只要有好玩的点子,我都会继续尝试动手做出来。
相册里如果有你舍不得删又发不出去的废片,可以在评论区留下你的画面描述,一起试试。
GitHub 开源地址:https://github.com/lke-aihub/speakup
FAQ
SpeakUp 支持哪些 Agent 平台
目前支持 Trae、WorkBuddy、Codex 等支持 Skills 功能的智能体平台。
生成的图片会被二次创作吗
不会。SpeakUp 采用非重绘方案,原图像素完全保真,仅叠加对话框贴纸效果。
如何修改生成的文案
生成后直接向 Agent 提出修改要求就行,比如更换台词语气或者调整气泡位置。