Ovolve Brand Mark
OVOLVE AGENT
准备下载中...
GitHub

让它 自进化

它此刻的样子,只是起点。 失败写进守则,有用经验从记忆提取;改动只在试错副本里跑,单测全绿才准合流。本地桌面端,开源 Apache-2.0。

查看源码
实时演示 接入任务 本地桌面端 · 悬停可接管会话
Ovolve Agent
workspace/ovolve-core feature/gepa-v2 Pareto Cycle #4
已连接
124,800 / 128k
0.8s
输入消息… @ 添加上下文 / 执行命令
添加上下文 命令与技能 LongCat 2.0

六大确定性外骨骼

一句话讲完六道底线:同样的错不犯第二次,测试未过不入主支。

Ovolve Agent
自进化与习惯 MEMORY.md · 2,410 / 2,500
失败捕获 · traceback.log AttributeError: 'NoneType' object has no attribute 'eval'
MEMORY.md
- pytest 必须走沙盒解释器
- 禁止 pass / TODO 落盘
- 主仓只读,测试未绿不合流
+ [Rule-142] pytest 前绑定 .venv,并校验 AST
+ AST_ENV_MISMATCH 已写成守则

越用越聪明失败沉淀为守则,成功沉淀为本能

失败沉淀为守则,成功沉淀为本能——沙盒与门禁全程托底。

Generation 42 成功率 × 1 / Token
四维择优:准确率 · 成本 · 速度 · 安全
  • 最优解
  • 非支配前沿
  • 被支配变体

workspace / main

主仓受保护

  • src/auth.py只读
  • src/calculator.py未改
  • tests/test_eval.py未跑
  • MEMORY.md只读

sandbox / trial

试错副本

  • src/calculator.py已改
  • tests/test_eval.py12/12
  • MEMORY.mdRule-142
  • exit_code0

测试全绿方入主支;未绿不合流,主支全程可回退。

语法树拦截pass / TODO
def test_gpqa_diamond():
    # TODO: wire runner later
    return True
    pass
合同锁定后真实断言
def test_gpqa_diamond(runner):
    res = runner.eval_batch(198)
    assert res.exit_code == 0
    assert res.passed == 181

落盘前扫 AST。空函数、伪造返回值直接打回;验收指纹对上才准合流。

HEGIF ★★★★★
903 题官方权威基准 · 三大核心维度全量物理实测

同一底模,加上 Ovolve 外骨骼

统一 LongCat-2.0 底座,基于本地操作系统真实退出码(Exit Code == 0)物理断言,完全真实可复现。

代码生成与自修 · 核心 P0
95.12%
HumanEval-164+5.62pp
164 题全量 · 平均 5.6 步沙箱自修 · 0 例模型代码逻辑失败
底模89.50
Ovolve95.12
通过 · 156 / 164非逻辑原因未通过 · 8模型代码逻辑失败 · 0
高阶科学推理
91.41%
GPQA-Diamond+2.51pp
198 题博士级科学推理 · 181/198 全量通过
复杂指令依从
93.56%
Google IFEval+3.56pp
541 题系统级规则遵循 · 654/699 约束项全量通过
基准名称考察范围LongCat-2.0 官方基线Ovolve Agent 实测架构净增量
HumanEval-164164 题算法代码生成与单元测试自修89.50%95.12%+5.62
GPQA-Diamond198 题博士级跨学科科学推理88.90%91.41%+2.51
Google IFEval541 题系统级规则与输出约束90.00%93.56%+3.56

一句话,交付一个工程任务

点击卡片一键复制真实生产提示词,直接交给 Ovolve Agent 启动确定性交付。

OVOLVE

开启确定性交付

开源免费 · 数据不出机 · Windows / macOS / Linux

从这里开始,它只属于你的工作流。

GitHub
已复制提示词至剪贴板