Ornith-1.5实测:9B模型本机部署,让AI自己出题刷题
- 未分类
- 1小时前
- 5热度
- 0评论
说实话,最近开源模型发新版,标题里最爱挂俩字:对标。
Ornith-1.5 也没跑掉。
按官方那个博客自己吹的,旗舰 397B 在 Terminal-Bench 2.1 拿了 86.1,而 Claude Opus 4.8 是 85.0。
数字是真好看。
但我更关心的其实是另一回事:这东西,我手里这台破电脑到底带不带得动?

榜单上的“对标Claude”这玩意儿是会过期的。真正变了的是啥?模型开始自己出题、自己搭架子、自己刷题了。而且,9B 版本一条命令就能拉到你本机。
它是什么:一只爱自己出题的鸟
Ornith 这一系出自 DeepReinforce / Ornith 团队,定位很明确,主打 coding、推理,还有 agent 任务。1.5 版本是 2026 年 8 月中下旬放出来的,官方标题起得特别直白:From Self-Scaffolding to Self-Improvement(从自我搭建到自我改进)。
我觉得这个名字挺形象。
它不只会练题,还把“怎么搭任务脚手架”当成了一门可学习的本事。
权重开源,公开页面写的是 MIT 协议,商用和研究的限制相对松。Ollama 官方库已经挂上了,一行命令就能开聊:
ollama run ornith-1.5:9b
装完别光顾着闲聊。
先丢个你平时真会做的小事给它试试:比如让它看一张界面截图,指出哪里别扭;或者改一段你自动化脚本里的报错提示。记得把模型 API 指到本机的 Ollama(常见地址是 http://localhost:11434)。

官方说明博客在这儿:https://ornith.ai/ornith_1_5.html
自己出题、搭脚手架、再刷rollout
很多人一听“自改进”就觉得是科幻片。
其实官方描述得很工程化,每个训练周期大概就三步走:
- 出题:根据任务类型和历史表现,提出比模型现在会做的更难、但依然可验证的新题。这一步很关键,难度得卡得准。
- 搭脚手架:给这道新题生成或修改指令、工具、拆解方式、甚至评判方式。说白了,就是设计“怎么考”。
- 刷题:在这套脚手架下真正去解题;奖励信号再回传给“出题、搭脚手架、解题”这三个环节。
奖励设计这块儿,官方抠得很门。题要有效可验证,难度得卡在能力边界附近。还得有点新颖性,避免翻来覆去出同质化的烂题。脚手架侧还要防 reward hacking,要是评测器被钻了空子,模型就会“看起来变强,实际只会骗分”。
为什么这么说?
我倒是认为,这比单纯“参数更大”更值得普通人记住。因为 agent 产品最痛的点,从来不是单次答题准不准,而是任务怎么定义、工具怎么编排、失败怎么被诚实打分。
Ornith 把这三件事塞进同一个强化学习环里练,这点挺实在。
Ollama别一上来装397B
Ollama 当前提供三档,上下文窗口都是 256K,页面也标注支持文本+图像输入(vision)。
| 标签 | 体量(Ollama) | 结构印象 | 我怎么选 |
|---|---|---|---|
| ornith-1.5:9b | 约6.6GB | 9B Dense | 先装这个尝鲜、接轻量agent |
| ornith-1.5:35b | 约23GB | 35B MoE,约3B激活 | 本机甜点,有24GB级显存再上 |
| ornith-1.5:397b | 约242GB | 397B MoE 旗舰 | 多卡/云机器的事,别当笔记本玩具 |
默认请先跑官方 ornith-1.5 标签,别一上来就混用第三方 fork。
模型默认是 reasoning 形态:回答前往往会先走一段思考块,再给最终答案。接进 Cursor、OpenHands 时,记得确认客户端能不能正确解析思考内容,不然容易出幺蛾子。
官方数字怎么读
旗舰 397B 那张表里,coding 侧确实打得很满。
但我每次看这类表,都会先做三道过滤:
1. Harness(评测脚手架)会改分数。 同是 Terminal-Bench 2.1,不同跑分套件数字就不一样。换你自己的 Cursor 工作流,排名可能再洗一次牌。
2. 厂商自报,五次平均。 官方脚注写了多跑平均、超时、禁网防作弊等细节,这很好;但仍不等于第三方复现已经盖章。
3. 强项偏 agentic coding。 通用闲聊、中文长文、配图文案,不一定是它最想赢的赛道。别拿错赛场,不然容易失望。
对普通人意味着什么
Ornith-1.5 不是唯一答案,但它把两件稀缺的东西叠在一起了:开源可商用的许可叙事,以及明确冲着 agent 任务去的自改进训练。
你不需要今晚搞懂 GRPO。
你只需要决定一件小事:本周装一次 ornith-1.5:9b,用你自己的一个真实小任务跑通。
参考资料
官网:https://ornith.ai/
Github开源:https://github.com/ornith-ai/Ornith-1
Ollama地址:https://ollama.com/library/ornith-1.5
官方博客:https://ornith.ai/ornith_1_5.html
FAQ
Ornith-1.5的9B版本需要多大的显存?
根据Ollama数据,9B版本体积约6.6GB,通常8GB显存的显卡即可流畅运行,适合笔记本尝鲜。
Ornith-1.5的自改进机制具体是如何工作的?
模型通过“出题、搭脚手架、刷题”三步闭环训练,奖励信号同时反馈给任务生成器和解题器,防止reward hacking。
为什么不建议直接安装397B版本?
397B版本体积约242GB,远超普通消费级硬件极限,仅适用于多卡服务器或云端部署环境。