Jev强决策AI从0到1入门实操:0.5秒跑完判断,还能猜你下一步

Jev最近是真的火。今天我不整虚的,直接带大家从0到1实操这个新玩意。不光是拆解我如何快速上手一个完全陌生的前沿模型——说实话,这个过程中我们还真碰撞出了一些能落地的思路。你猜怎么着?

这篇文章呢,记录的就是我跟Agent(豆包工作)协同逆向探索Jev的全过程——从官方演示台一路推演到生产工作流。感觉这事儿还挺有意思的。

操作也不复杂。先去官网 console.typesafe.ai 登录,没账号的也不用慌,先加入等待列表,我用了大概一天就通过了。之后在控制台复制官方给Agent准备好的安装指令,顺手创建好API Key——对了,这两样都要打包发给豆包工作,让它先把TypeSafe skill装上。你说这流程是不是挺快的?

我试的时候,就让它直接按官方指引来装,命令大概是这样的:

claude plugin marketplace add typesafe-ai/skills
claude plugin install typesafe@typesafe-ai

要是你用的是其他Agent,那就走 npx skills add typesafe-ai/skills --skill typesafe-ai 这套,选对Agent类型就行。我觉得这里没啥坑,基本不会出幺蛾子。

01 让AI陪我逛官网:一次协同浏览指令

密密麻麻的英文文档,说实话我真懒得逐字死磕。直接让豆包工作调用多模态与渲染能力,现场给我出一套全局可视化能力地图。你看,这可比自己啃快多了。


Jev是刚出来的新物种,目前大多数文章只讲概念,真实操作还是得自己摸索。官网一打开是全英文操作台:中间排着4个示例,右侧是快速启动,左侧又是长演示流程,手动一个个试很耗时。是不是有点懵?

既然豆包工作自带浏览器控制,交互做得不错,为什么不让它陪我一起看?让AI在前排实时解析英文界面与示例逻辑,我在后排把握探索节奏,效率直接翻倍。你猜怎么着?效果还真不错。

官网首页看着简洁但容易懵。4个例子、安装方法、文档全堆在首页,我便直接让豆包工作出了一个图片辅助理解。这玩意儿是真方便,一张图啥都清楚了。

跟着官网教程过了一遍,大概看懂怎么回事。但具体到这个操作台,如果自己新建例子,还是比较费时间。我觉得AI擅长这个事,它很容易理解新概念,于是我直接让豆包工作看看这个playground怎么用。反正自己琢磨也是琢磨,不如让它先探探路。

02 Playground上手:0.5秒跑完一次判断

从截图中能看到清晰布局:上方输入框是问题的上下文状态(State),左下角官方默认预置了一个经典的Noul原语问题——“Is hotdog a sandwich?”,右侧是对该原语的设计意图说明。

点击【Run】按钮,系统瞬间完成判断,整个过程不到0.5秒。

03 运行结果解读:Noul、Choice、Score三种原语

这0.5秒的推演,展示了Jev的常识语义校准能力。传统关键词匹配会被名字里的“sandwich”直接带偏,而Jev解构了实体常识——“两片面包夹馅才叫三明治,冰淇淋三明治用的是饼干威化”。这种语义直觉,正是自动化流最需要的

摸清Noul的门道,我继续让豆包驱动测试剩下的两种核心原语:Choice(选择)Score(打分)

Choice(选择题):先问“天空是什么颜色?”,再问“龙卷风来的时候天空是什么颜色?”→ 海泡绿 56%。

TypeSafe知道龙卷风要来时天空会发绿,这就是Choice类型——从多个选项中选,还给你概率分布

再看Score(打分原语):在经典的“Naruto猕猴自拍版权案”中,评估猴子和人谁对照片贡献大。Jev给出了细腻的连续谱打分:猴子 3.33/4,人 1.08/4。

这意味着对于内容合规、质量评分或意图迫切度,程序不用再让大模型吐一大堆分析再正则提取数字,一次请求直接拿到浮点分值

结果:猴子自拍谁的贡献大?→ 猴子 3.33/4,人 1.08/4


通过和豆包工作这么交互,我基本了解了这个东西。那接下来肯定不能一直停留在这个场景,得加入到自己的工作流,放进自己的Agent里。

04 套娃自测:让Jev猜我下一步想干什么

突然脑子里蹦出来一个念头——“套娃自测”。你看,Jev不是擅长做上下文决策吗?那我干脆把刚才人类跟Agent整场对话的历史,打包成State丢给它,让Jev亲自来猜:我下一步到底想干嘛?

说实话,这不只是玩玩而已。它其实是在验证一件事——“决策外包”到底行不行得通:把当前环境的交互状态喂给Jev,让System One充当Agent的前脑,实时裁决该走哪个分支。

第一轮预测出来了……但我觉得差点意思。问题应该出在输入上——给Jev的信息还不够真实。调整之后,我注入了更客观、更具体的行为事实进去。这次的结果,确实击中我了:74%倾向直奔“集成到现有工作流”,而且它还在【是否必须先讨论对齐】这一项上,给出了0.96(96%)的超高倾向。

有意思的是,Jev居然主动给AI踩了刹车:它提醒AI别急着闷头写脚本,必须先跟人类对齐讨论架构。这正好补上了我上一轮没好意思说出口的顾虑。AI不光是执行,它还能反向校准人类的盲区。

这不就是垃圾进垃圾出(GIGO)的活教材嘛。

对了,我还有个打算——让Jev去审判一下豆包工作某几轮对话,看看它有没有在骗我。比如,提示词里要求豆包工作去某个聊天会话里找东西,或者验证一下它在搜索场景里搜到的结果靠不靠谱。这真挺值得试的。

05 接进工作流:飞书多维表格批量打分与语义清洗

接着让豆包工作用Jev给我的飞书多维表格批量打分与语义清洗。

利用Jev的强类型Score/Choice批量扫描表格脏数据,毫秒级打标,免去维护臃肿Prompt的烦恼。比如上下文压缩场景,扫描100篇帖子,哪些该留?Jev做打分,低分直接丢。

06 当打假官:先审判一条推文

行,咱们接着看其他例子。我刷到一个Jev的实践视频,第一反应是——这演示到底是剪辑出来的?还是说Claude Code本来就有那种红色消失的动态过程?你猜怎么着,我反复看了好几遍也没完全确定。

这一帧画面里,Claude Code的终端标题栏写着“claude — checkout-service”,任务名叫 fast-jev-compaction,上下文已经走到156,000 tokens、78%——这个数字正好对上推文里说的“用Jev压缩上下文”的演示,对吧。

你看,这是豆包工作拿Jev实际跑出来的结果:

所以结论其实比较明确了——这个特效跟Jev压根没啥关系。要么是后期剪辑加的效果,要么就是Claude Code自带的。说实话……豆包工作这次给这个推文内容下了一个概率性的判决,没有把话说死那种。我觉得这态度挺严谨的。

07 再看一个开源仓库

browser-use/jev-ultrafast —— Jev驱动的超快速浏览器Agent

这个案例我让豆包工作去判定一个GitHub仓库,比上面更有技术含量。让Jev自己当打假官,去审判一个基于Jev的开源项目。

我给豆包工作的输入仅仅是帖子的链接 + 让它使用Jev。有意思的是,豆包工作直接去仓库读了源码,这让我觉得可信度可以给它涨几分。

对仓库的评价:Jev不是做摘要,而是做“选择题决策引擎”——把复杂的UI交互压缩成编号选项,一次API调用就出结果,所以快且便宜。

7.1秒和$0.0039是挑了Google Flights这种结构化好的页面的最佳表现,但架构思路(Jev做离散决策 + 小LLM只在必要时生成文本)确实是浏览器Agent降本提速的一个实在方向


写在最后

好了,以上大概就是初步使用豆包工作入门Jev的过程。我还收集了许多有意思的例子,只能说这个Jev可想象空间很大


Jev是什么?

Jev是TypeSafe推出的强决策AI,专为Agent设计,提供Noul、Choice、Score三种原语,一次请求即可完成语义判断、选项决策或打分。

Jev怎么获取?

去console.typesafe.ai官网注册并加入等待列表,通过后创建API Key,再按官方安装指令将TypeSafe skill集成到Claude Code或其他Agent中。

Jev适合什么场景?

适合所有需要快速、结构化决策的场景,比如内容质量评分、意图识别、数据清洗、上下文压缩,以及浏览器Agent的UI交互决策等。