Agnes 平台之外,51 星的客户端把短剧和数字人做成了流水线
- 工具收集
- 51分钟前
- 6热度
- 0评论

我有一段话:
"夏天来了,猫咪在窗台打了个哈欠,伸了个懒腰。"
我想让它变成一个 10 秒的小短剧。
我没有打开剪映,没有打开 Midjourney,没有打开任何视频生成网页。我双击了一个 46MB 的 EXE 文件,浏览器跳到 http://127.0.0.1:5000,把这段话粘进去,按了一个按钮。
5 分钟之后,我下载到了一段 10 秒的视频。猫咪真的在窗台伸懒腰,配音是普通话,还烧了字幕。
这个工具叫 Agnes AI Studio。51 star,Python 写的,PyInstaller 打成单 EXE。它干的事特别朴素——把"文生图、图生图、文生视频、参考图生视频"打包成一个能一键跑的全流程客户端。
它不是一个 API,是一个能双击就跑的产品
上个月我写过 Agnes 平台本身(免费文本图像视频 API 那篇),平台是平台,客户端是客户端。
Agnes AI Studio 不调任何独家 API,它做的是桌面端图形化封装:把 6 家厂商(Agnes AI、DeepSeek、通义千问、豆包、MiniMax、Ollama)的接口按模型名自动路由。你填一次 API Key,它按需调用。
回退链写得很清楚:{vendor}_api_key → text_api_key → api_key,缺哪个就降级用默认的。Ollama 本地模型连 Key 都不用,系统自动跳过认证。
整个项目的代码量其实很小:
app.py # 入口,45 行
src/services/ # 业务逻辑 4 个:text_model / video_gen / video_merge / tts
src/routes/ # 8 个 Flask Blueprint
是的,8 个 Blueprint。一个桌面小工具分了 8 个模块:pages、api_config、image、video、drama、anchor、files。这是正经的应用工厂 + 模块化架构。
TTS 用的是微软的 edge-tts,14 种中文音色。视频拼接用的是 ffmpeg,通过 imageio-ffmpeg 内置,连装环境都不用。
它的两个杀手锏:短剧生成 + 数字人主播

大多数 AI 视频工具都停在"文生视频"单点功能上。Agnes AI Studio 多走了一步:把多个 AI 视频 API 串成两个高阶流水线。
第一个叫"短剧生成"。一条流水线五步:
脚本 → 分镜 → 素材(图生图/文生图)→ 视频(按镜头独立生成)→ 拼接
每一步用什么模型可以分别配。脚本和分镜默认走文字模型;素材和视频走图像视频模型;最后 ffmpeg 拼起来。
整个过程是按镜头独立生成的——不是把整个脚本塞给一个视频 API 让它自己脑补,是每段都生一段视频,按分镜拼。
第二个叫"数字人主播",三种模式:
- A. 静态人像 —— 上传一张主播图,TTS 念稿时画面循环
- B. 视频素材 —— 上传主播视频,按段剪辑/循环
- C. AI 生成帧 —— 风格 prompt 驱动,每段调用视频 API 生成画面
配置项里能调分段时长(3-20 秒)、TTS 音色(14 种中文)、底模用哪家的。
当然,得说句公道话
第一,免费额度是真的有限。Agnes 平台的免费档够你试 5 分钟新鲜;要正经做短视频,建议至少配一个 DeepSeek 或通义的 Key 当兜底。
第二,参数不是自动的,得自己调。视频有个坑:num_frames 必须 8n+1 格式,最大 ≤441,frame_rate 范围 1-60。常用的搭配作者写在了 README 里——121 帧 / 24fps ≈ 5 秒,241 帧 / 24fps ≈ 10 秒。
第三,短剧生成不是自动写剧本。脚本这步你得自己想,或者用文字模型生成。Agnes AI Studio 是流水线,不是编剧。
第四,拼接效果看分镜。ffmpeg 拼接多段视频,最后能不能顺畅,主要看每段视频的画面风格是不是接近。

Agnes 平台给的是 API,Agnes AI Studio 给的是"我把 6 家 API 拼成一条流水线、46MB 一份、传给你同事就能用"的桌面客户端。
Agnes 平台解决的是"模型在云端怎么调",Agnes AI Studio 解决的是"模型怎么变成能交给剪辑组直接用的视频文件"。
这俩不是一个东西,别搞混了。
常见问题
Agnes AI Studio 和 Agnes 平台是一回事吗?
不是。Agnes 平台是云端 API 服务,Agnes AI Studio 是桌面端图形化客户端工具,按模型名自动路由 6 家厂商 API。
Agnes AI Studio 需要 Python 环境吗?
不需要。直接下载 dist/Agnes-AI-Studio.exe(约 46MB)双击运行,浏览器自动打开 http://127.0.0.1:5000。
支持哪些大模型?
6 家厂商:Agnes AI、DeepSeek、通义千问、豆包、MiniMax、Ollama(本地免 Key)。文字/图像/视频模型总计 20+ 个,详见 README 模型清单。
短剧生成是怎么跑的?
五步流水线:脚本→分镜→素材→视频→拼接。每步可独立配置模型,按镜头生成视频,最后 ffmpeg 拼起来烧字幕。
数字人主播支持几种模式?
三种:静态人像循环(A)、视频素材剪辑(B)、AI 生成帧(C)。可配置 3-20 秒分段时长、14 种中文 edge-tts 音色。
网址
Github 开源:https://github.com/LGQLIFE/agnes-ai-studio/tree/master
Agnes AI Studio 下载:https://github.com/LGQLIFE/agnes-ai-studio/tree/master/dist