一个悄然崛起的国产开源项目
- 免费干货
- 3小时前
- 10热度
- 0评论
刚拿到一份体检报告,想找医生帮忙看下里面各项数据指标,结果排队一小时,几分钟就完事。
回到家翻出去年的体检报告,对比了一下,发现两份报告同个指标的写法和单位还不一样。
看得我一脸懵逼,直接拍照发给 AI 分析,回答得头头是道,但也只是一些指标值的解释。
它无法结合我平时穿戴设备上的健康数据,以及过往医院病历信息,做出综合性的回答。
直到最近,我在 GitHub 上发现了一个刚开源不久的 AI 原生健康数据引擎:Mirobody。
GitHub:https://github.com/thetahealth/mirobody

它能将我们的体检报告、穿戴设备等各种来源的健康数据,统一变成 AI 能读懂的标准格式。
真正让 AI 了解我们过去和现在的身体健康状况,并给出有数据依据的回答。
还意外发现,Mirobody 背后的 Theta Health 其实是盛大创始人陈天桥旗下的公司。
前段时间,刚看到陈天桥官宣进军健康数据领域的消息,没想到这么快就有了动作。
他前前后后在脑科学上投入了数十亿,这个项目算是这条线延伸到个人健康数据上的落点。
他们认为模型会更新,设备会换,但今天没存下来的数据,明天再强的 AI 也补不回来。
于是 Mirobody 就诞生了,下面跟大家详细介绍一下它,核心就三条链路。
第一收集,解决数据的来源
散落在各处的体检报告单,还有穿戴设备上的健康数据,都可以作为数据来源。
比如一份体检报告 PDF 文件拖拽到界面上传,几秒内各项指标就被提取出来并存储在本地。
在列表里点击每一项指标,还能查看到对应原文件的那一页,数据出自哪里有迹可循。

第二标准化,整个引擎的核心
将收集的体检报告、穿戴设备等各种各样的数据格式,统一转换为标准格式 FHIR R4。
指标名统一成国际标准编码 LOINC,单位统一成标准写法 UCUM,一套医疗系统通用的语言。
这背后靠的是一张 44 万节点、59 万个来源 ID 的医学概念图谱。
就算是中、日、英、繁体等不同语言的不同写法,同一个指标也都能落到同一个编码上。
其中没见过的词不硬猜,主动留空,不给错误的答案,这点原则我还挺认同的。
毕竟这些都关乎到回答人健康的问题上,严谨一点比较好,宁愿不回答。

第三回答,数据理顺了,AI 问答才有意义
随时都可以在 Mirobody 上问一句,比如「最近这两年她的糖化血红蛋白指标有什么变化」。
AI 就会去查找数据、画出趋势图、标注数据来源,连数据有什么局限,都会主动说明。
时刻了解自己身体过往的状况,在就诊时也能让医生直接查看到某项指标变化的趋势。

从零开始,打造专属的 AI 健康助手
项目提供了一键安装脚本,只需执行几条命令,即可完整部署 Mirobody 使用。
不想手动执行命令,也可以让 Agent 工具帮忙,比如打开 Claude Code 发送一句话就行:
帮我完整部署这个项目 https://github.com/thetahealth/mirobody

不用多久就部署完成,打开浏览器访问项目的服务地址,则看到一个登录页面。
输入内置账号的邮箱和验证码,登录进去之后就能直接体验,里面也有演示数据可查看。

往后我们的检查报告、电子病历本等健康数据都可以上传到这里记录,它会自动提取相关指标。
所有上传的数据,均存储在本地,健康数据这种比较隐私的数据,还是放在自己电脑上踏实。

但想要使用 AI 对话和语义搜索功能,则需要在.env 环境变量文件里配置模型 Key。
支持 Google、OpenAI、OpenRouter 和阿里云百炼这几大模型供应商。
配置好 Key 之后,需要再次重启 Docker,如果不懂的话,直接让 Agent 帮忙操作也行。
重启后,我们就可以在对话里,随时询问 AI 了解自己身体各项指标的情况。
它会基于我们上传报告单里的真实数据进行回答,还会说出具体是哪个时间的报告。

除了能记录自己的健康数据之外,还可以创建一个关爱圈子,邀请家里人一起加入进来。
大家的健康数据各自管理,也可以自由选择是否分享给家里人查看。
这样我们就可以关心到家里任何一个人的健康情况,家里有老人的朋友,这个功能超实用。

另外团队还配套开源了两个项目,mirobody-science 负责清洗多来源、多格式的科研数据集,mirobody-eval 负责评测健康 AI 答得靠不靠谱。
其中 eval 里内置了 HealthBench、ESL-Bench 等 6 个评测基准,团队自建的 3 个基准,在 Hugging Face 上最近一个月各有 4000 多次下载,同类数据集中下载量最高。
就连 Mirobody 自己「该把数据存进数据库还是丢给 RAG」的架构选择,都是拿 eval 实测了 13 种方法后定下来的。
写在最后
其实 AI 健康早就是公认的热门赛道,各大科技巨头们都盯上了这块蛋糕。
苹果每年发布新穿戴设备都在持续加码健康功能,OpenAI 今年也推出了 ChatGPT Health,据统计每周有超 2.3 亿人在向 ChatGPT 咨询健康问题。
需求端更不用说,截至去年年末,国内 60 岁以上人口 3.23 亿,高血压患者约 2.45 亿,今年腕戴设备预计出货近 8000 万台。
也就是说,健康数据每天都在海量产生。但体检报告锁在医院系统里,心率睡眠躺在手表 App 里,病历本压在抽屉里,各是各的孤岛,谁也读不了谁。
回头仔细一想,这大概就是陈天桥入场 AI 健康领域的原因。
而在我看来,这个赛道要跑通,光靠更强的模型不够。
数据得先被接进来,再说上同一种语言,AI 的回答才有意义,这正是 Mirobody 收集、标准化、问答三条链路在做的事。
连 ChatGPT Health 上线做的第一件事,都是先接入电子病历和 Apple 健康数据,可见瓶颈从来不在模型,而在数据。
如果这套标准化层持续被开发者和机构采纳,很可能像早年的 Markdown 语法那样,不靠谁钦定,靠用的人多,慢慢长成大家默认的对接方式。
再往远处想一层,如果我们从年轻时就开始记录,几十年积累下来,AI 看到的就是一条身体状态随时间变化的完整轨迹。
从多年数据的细微变化里提前发现值得检查的趋势,理论上都能做到,相当于每个人都有一份持续更新的「健康数字孪生」。
当然这条路要走通,还需要长年的积累和医学界的认可,现在谈还早,但方向说得通。
模型会越来越强,也越来越容易获得,真正无法复制的,是一个人连续积累的健康记录。
今天存下来的数据,就是明天 AI 读懂我们的起点。
感兴趣的朋友,可以到 GitHub 上了解看看。
GitHub 项目地址:https://github.com/thetahealth/mirobody
Hugging Face:https://huggingface.co/mirobody
论文:https://arxiv.org/abs/2604.02834
mirobody-eval:https://github.com/thetahealth/mirobody-eval