让AI自己造AI助手,PenguinHarness 两毛钱搞定

8月4日开源的 PenguinHarness,主打一句话生成一个能跑的AI应用。我翻完它的官网和 GitHub 仓库,把两张跑分表的数字抄下来重新算了一遍,省钱这件事有真的部分,也有被放大的部分。

我想要一个只干一件事的助手,一直卡在同一个地方

我做自媒体运营,手上堆着一批重复活。每天扫热点、核实数据、整理素材,这些事我都希望有个只管这一件的小助手帮我盯着。
真要动手做一个,麻烦就来了。我得先选框架,再想清楚给它开哪些工具,然后一遍一遍改提示词,改完还得自己造几个例子测测,测完发现哪步不对再回去调。这个过程我折腾过几轮,每次卡住的都不是技术,是烦。烦到后来我宁可自己干。
所以看到 PenguinHarness 开源的消息,我停下来了。做这个项目的是郑耀威,LlamaFactory 的作者,那个项目在 GitHub 上攒了七万多星标。一个把模型微调门槛拉下来的人,现在转头来拉造助手的门槛,我愿意花时间看看他做了什么。
我花了大半个上午,把官网 penguin.ooo 从头翻到尾,又去 GitHub 仓库把 README 读完,中英文两版都看了。这篇文章里所有内容的来源就是这两处,加上几家媒体的报道。我没有下载安装,也没跑过任何一个任务,这点我先摆在前面。


原来你要当四个角色,现在只剩半个

我把自己搭助手的过程拆开看,发现一个人其实同时在当四个角色。
架构师,决定用什么框架、接哪些工具、整体怎么搭。 写手,一句一句写提示词,写完发现AI理解偏了再重写。 考官,出题目测它、看它答得对不对、记下哪里丢分。 修理工,照着丢分的地方回去改,改完再测一遍。
四个角色轮着转,一轮下来大半天没了。PenguinHarness 想做的事,是把后面三个角色交给AI自己干,你只剩下第一个角色的一小半,说清楚你要什么。
官网把这套东西叫 Harness,中文没有特别贴的译法,我理解成给AI套的一副马具。马还是那匹马,模型也还是那些模型,区别在于缰绳握得顺不顺手。


一句话生成一个应用,官网摆出来的那个例子

官网首页有个案例我看了两遍。
输进去的需求是这么一句,把某个 GitHub 文档仓库的内容收集起来,做一个能回答 Claude Code 相关问题的问答应用,答案要带出处链接。
出来的结果是一个跑在本地 127.0.0.1:7364 上的网页应用,能回答问题,答案下面挂着可点击的引用来源,还预置了几个示例问题。官网写明这一整个应用生成下来,用掉的 Token 折算是 0.02 美元,人民币两毛钱,跑的模型是 DeepSeek V4 Pro。
另一个案例是个 2D 企鹅雪橇小游戏。
我对这类演示一向留三分怀疑,官网放的当然是跑得最漂亮的那次。但两毛钱这个数字有个好处,它低到你根本不用纠结值不值得试。以前我评估一个工具,心里要先算一笔投入产出;两毛钱这个量级,算这笔账的时间成本都比钱贵。
除了演示,官网还写了两个落地场景。一个体检机构把报告质检交给了本地部署的 Qwen3 14B 驱动的助手,数据不出院区,人工一轮要三十分钟的核查,现在一分钟过三十份,结论和医学专家一致。另一个来自媒体报道,一家制造企业用它搭了多个助手做产线巡检,产线停机时间减少 65%,产出提升近两倍。第二个案例我只在报道里见过,官网上没找到对应描述,我把它标出来,你自己判断权重。


它自己给自己打分再改自己,这条循环怎么转

这是我觉得整个项目里最有意思的一块,也是官网讲得最细的一块。
它设了三种身份。一个是干活的目标助手,一批是打分的评审,还有一个是优化器。优化器同时调度多个评审并行给目标助手打分,拿到分数和运行轨迹之后,找出丢分的位置,把助手从第 N 版升级到第 N+1 版。每一轮开始前会存一份快照,这轮改砸了可以一步退回去。
有家科技媒体的分析文章里提到,实测中一个助手的评分从 53 分被优化到 95 分,Token 成本约五毛钱。这个数字我没能在官网找到对应出处,只能标注为来自第三方分析。
我更在意的是它给这套自我优化划的边界。仓库里有个文件叫 CONTRACT.md,里面列了十条,我挑三条印象深的说。
自我改进只能发生在工作区和技能目录里,框架内核和安全机制不允许改。这条是防AI把自己越改越野。
每次模型请求和工具调用都完整写进轨迹,花了多少 Token、跑了多久、为什么失败,事后能一行一行回放。
凭证隔离,API 密钥落在权限 0600 的隐藏文件里,不进模型上下文,界面上全程打码。
我看完这十条的感觉是,这个团队想清楚了一件事,自我进化最怕的不是不够聪明,是没有刹车。他们把刹车写成了文件,摆在仓库根目录。这个态度我认可。


省下的钱要拆成三笔账算

官网放了两张跑分表,宣传口径是成本只有对手的几十分之一。我把六行数字抄进表格自己算了一遍,结论比宣传复杂。
先看数据分析那套,15 个复杂任务跑一轮。

组合 准确率 Token 用量 花费
PenguinHarness + DeepSeek V4 Pro 66.67% 18.04M 0.55 美元
Claude Code + Claude Opus 4.8 53.33% 22.20M 38.48 美元
OpenAI Codex + GPT-5.5 53.33% 13.72M 19.41 美元

准确率确实最高,花费确实是 Claude Code 的七十分之一。但我算了另一个比例,Token 用量只比 Claude Code 少了约 19%。
七十倍的差距,从哪来的。绝大部分来自模型单价,DeepSeek V4 Pro 和 Claude Opus 4.8 本来就不是一个价位。框架自己挣来的,是那 19%。
所以这笔账我拆成三份看。
第一笔是模型账。 换成便宜模型,任何框架都能省,这笔不该算在它头上。
第二笔是调用账。 工具集精简、少绕弯路省下来的 Token,数据分析这套省了 19%,是真本事,但它不是七十倍的主角。
第三笔是人工账。 一句话出应用,省掉的是我前面说的那四个角色里的三个。这笔最大,也最没法用数字证明,官网证明不了,我也证明不了。
我的判断是,前两笔账要分开说才诚实,第三笔账才是这个工具真正值钱的地方。


编程任务它输了,这几处我得说清楚

只说优点的介绍我自己都不信,所以下面这几条我一条不藏。
编程套件上它准确率输了。 40 个任务跑两轮,PenguinHarness 是 71.25%,和 OpenAI Codex 打平,Claude Code 是 86.25%,高出整整 15 个百分点。写代码这件事上,它离顶尖还有距离。
同一套编程任务里,它的 Token 反而更费。 200.00M 对 Claude Code 的 151.61M,多用了三成多。成本仍然低 38 倍,但那 38 倍这次是百分之百来自模型单价,框架一分没省。「工具少所以省 Token」这个说法,在编程场景不成立。
版本还很早。 仓库里的最新版本号是 0.2.1,8 月 4 日发布的。0.2 这个位置的软件是什么状态,用过开源项目的都懂。
它不管模型钱。 装完还得自己去 DeepSeek 或者 OpenRouter 申请 API 密钥填进去,工具免费不等于用起来免费。
用 npm 装的话要 Node 24 以上。 这个门槛对非技术读者不算低,好在还有桌面版可以躲开。


装起来要几步,我把官网的路径抄了下来

以下路径全部来自官网快速开始那一节和 GitHub README,我没有实操验证过,照抄给你,出入以官网为准。
最省事的是桌面应用,官网下载页有 macOS 11 以上的 dmg、Windows 10 以上的 exe、Linux 的 AppImage 和 deb,双击装完就带一个本地服务,打开就是登录好的界面。
命令行的话,Windows 在 PowerShell 里跑 irm https://penguin.ooo/install.ps1 | iex,Mac 和 Linux 用 curl -fsSL https://penguin.ooo/install.sh | sh。装完敲 penguin web,浏览器自动开到 127.0.0.1:7364。第一次启动终端会打印一个初始管理员密码,形如 penguin-1234,官网提醒进去之后马上改掉。
数据全部落在本地 ~/.penguin/data 目录,官网强调不经过第三方服务。还有离线包,给那种完全不联网的机器用,每个 Release 里带 SHA256 校验。
模型这块支持得挺全,README 的表格里列了 DeepSeek V4、Kimi K3、GLM 5.2、Hunyuan 3、Qwen 3.8 Max、GPT-5.6、Gemini 3.6 Flash、Claude 5 这些,另外任何走 OpenAI 协议的接口都能接,官网说加起来一千多个模型。
内置技能分四组共十四个,办公类有数据分析和网页抓取,开发类有网页设计和软件工程,还有一组专门是给助手做调优的,包括创建、出题、评估、优化。这一组我觉得是它区别于普通框架的地方,别的工具让你调助手,它让助手调助手。


我的判断,以及现在该做什么

先说判断。这个工具真正的价值不在便宜,在于它把「造助手」这件事从项目制变成了流水活。 便宜是模型选型带来的,换个框架配 DeepSeek 一样便宜。但把出题、打分、返工这三件事变成AI自己转的循环,还配了刹车和快照,这个是它自己的东西。
编程能力落后 15 个百分点这件事我不打算替它圆场,写代码你还是用别的。它适合的是那种边界清楚、要反复跑、跑完能打分的活,比如报告质检、数据整理、格式转换,正好是官网那个体检机构的场景。
建议我分三种人说。
手上有重复流程、又有一点技术底子的,值得这周就装。两毛钱一个应用的量级,试错成本约等于零,先拿一件最烦的活丢给它,跑通了再说别的。
在企业里、数据不能出内网的,这个可能是目前最值得看的一档。本地部署、凭证隔离、全量审计轨迹,加上能接本地 Qwen 这类模型,合规那关比调云端接口好过。
完全不写代码的普通职场人,我劝先等等。桌面版是降了门槛,但配 API 密钥、理解技能和轨迹这些概念,0.2.1 这个版本还不会替你兜住。等它做到装完就能用,再来不迟。
最后补一句我自己的打算。我会去装桌面版,拿我每天扫热点核实数据这件事试一试,跑完把真实体验单独写一篇。到时候这篇里所有我没验证的部分,我会一条一条回来对账。

PenguinHarness 官网:https://penguin.ooo/
Github 开源:https://github.com/Prism-Shadow/penguin-harness