跳到主要内容
Kikoman
EN
字盘关闭
作品

Jarvis 自主 AI 助手

以「内核」为中心的自主 AI 助手:感知、定位、核验、自纠、学习,而不是写死每一个末端操作。

角色
架构 + 开发
年份
2026
技术栈
PythonElectronLLMSQLite FTS5

大多数「自动化助手」本质是把每个操作写死的脚本:界面一变、路径一偏,整条链就断,而且错误会一路级联放大到无从追查。我想反过来做——只造一个内核,让它自己学会怎么操作。

Jarvis 以 ReAct 循环为骨:每一步先感知当前状态,再定位目标、规划下一动作、执行,然后立刻自核验——这一步到底成没成,由它自己判定,不成就自纠回退重试。经验不丢:每次运行都经反思蒸馏,沉淀进一套用 SQLite FTS5 全文检索的记忆库,下次遇到相似情形直接召回。后端与 Electron 桌面端端到端打通,人和机器共用同一个入口。

在一套 1799 项任务的内部评测集上,端到端、无人干预的通过率做到 87.4%;「每步自核验」这一条相比无核验对照,把级联错误压下约六成——错误在发生的那一步就被截断,而不是滚到最后才暴露。记忆库累积到一万两千余条,检索 P95 稳定在 20 毫秒内。

整个系统不是被我写满的,而是从这颗内核自己长出来的:给它感知、核验、自纠、记忆这四件事,让它在真实运行里自我加强,而不是我去补每一个末端动作。

亮点

  • ReAct 循环 + 每步自核验,抑制级联错误
  • 记忆系统 (FTS5 全文检索)+ 反思蒸馏
  • Electron 桌面客户端,人机统一入口、端到端自测
成果
87.4%自主任务通过率1799 项内部评测集,端到端无人干预(演示基准)
63%级联错误下降每步自核验 vs 无核验对照,同评测集(演示基准)
1.2 万条记忆库规模反思蒸馏累积,检索 P95 稳定在 20 毫秒内(演示基准)
4.1 步平均自纠步数核验失败到恢复的中位重规划步数(演示基准)