workspace/ovolve-core
feature/gepa-v2
Pareto Cycle #4
已连接
124,800 / 128k
0.8s
输入消息… @ 添加上下文 / 执行命令
六大确定性外骨骼
一句话讲完六道底线:同样的错不犯第二次,测试未过不入主支。
Ovolve Agent
自进化与习惯
MEMORY.md · 2,410 / 2,500
失败捕获 · traceback.log
AttributeError: 'NoneType' object has no attribute 'eval'
MEMORY.md
- pytest 必须走沙盒解释器
- 禁止 pass / TODO 落盘
- 主仓只读,测试未绿不合流
+ [Rule-142] pytest 前绑定 .venv,并校验 AST
+ AST_ENV_MISMATCH 已写成守则
越用越聪明失败沉淀为守则,成功沉淀为本能
失败沉淀为守则,成功沉淀为本能——沙盒与门禁全程托底。
- 最优解
- 非支配前沿
- 被支配变体
workspace / main
主仓受保护
- src/auth.py只读
- src/calculator.py未改
- tests/test_eval.py未跑
- MEMORY.md只读
sandbox / trial
试错副本
- src/calculator.py已改
- tests/test_eval.py12/12
- MEMORY.mdRule-142
- exit_code0
测试全绿方入主支;未绿不合流,主支全程可回退。
def test_gpqa_diamond():
# TODO: wire runner later
return True
pass
def test_gpqa_diamond(runner):
res = runner.eval_batch(198)
assert res.exit_code == 0
assert res.passed == 181
落盘前扫 AST。空函数、伪造返回值直接打回;验收指纹对上才准合流。
HEGIF
★★★★★
同一底模,加上 Ovolve 外骨骼
统一 LongCat-2.0 底座,基于本地操作系统真实退出码(Exit Code == 0)物理断言,完全真实可复现。
代码生成与自修 · 核心 P0
95.12%
HumanEval-164+5.62pp
164 题全量 · 平均 5.6 步沙箱自修 · 0 例模型代码逻辑失败
底模89.50
Ovolve95.12
通过 · 156 / 164非逻辑原因未通过 · 8模型代码逻辑失败 · 0
高阶科学推理
91.41%
GPQA-Diamond+2.51pp
198 题博士级科学推理 · 181/198 全量通过
+2.51 pp · 纵轴 80–100%
复杂指令依从
93.56%
Google IFEval+3.56pp
541 题系统级规则遵循 · 654/699 约束项全量通过
+3.56 pp · 纵轴 80–100%
| 基准名称 | 考察范围 | LongCat-2.0 官方基线 | Ovolve Agent 实测 | 架构净增量 |
|---|---|---|---|---|
| HumanEval-164 | 164 题算法代码生成与单元测试自修 | 89.50% | 95.12% | +5.62 |
| GPQA-Diamond | 198 题博士级跨学科科学推理 | 88.90% | 91.41% | +2.51 |
| Google IFEval | 541 题系统级规则与输出约束 | 90.00% | 93.56% | +3.56 |
一句话,交付一个工程任务
点击卡片一键复制真实生产提示词,直接交给 Ovolve Agent 启动确定性交付。