开源自动化验证流水线
AgentRunDB 实验室
每一条经过验证的运行,都在这里被执行、捕获与发布。
CORE PRINCIPLE
“网站内容不是写出来的,而是跑出来的。”
五步自动化验证流水线
每一条兼容性结论如何从隔离环境中的真实执行事实中诞生。
01
GitHub Actions 触发
定时任务(每周六 03:17 UTC)或手动触发,针对 Agent 与目标模型矩阵发起全面验证。
02
隔离环境启动
创建独立的临时工作目录并复制 fixture 仓库,内置一个待修复的失败单元测试。
03
Agent 无头执行
通过 CLI(如 claude -p)无头调用 Agent,注入对应厂商端点环境变量,执行限时 10 分钟。
04
事实与结论判定
执行 node --test(退出码 0 为 passed),通过 SHA-256 哈希比对文件变更,确立能力事实。
05
证据归档与入库
将 report.json、log.txt 与代码 diff 归档为 artifact,调用 POST /api/runs/import 自动更新站点。
最近验证运行
由自动化验证器执行并实时入库 AgentRunDB 的真实运行记录。
| 日期 | 兼容性 | 状态 | 耗时 | Tokens | 成本 | 运行 |
|---|---|---|---|---|---|---|
| 2026-08-19 | OpenClaw × DeepSeek V4 Pro | 通过 | 0ms | — | — | details |
| 2026-08-19 | OpenClaw × DeepSeek V4 Pro | 通过 | 0ms | — | — | details |
| 2026-08-19 | OpenClaw × DeepSeek V4 Pro | 通过 | 0ms | — | — | details |
| 2026-08-19 | OpenCode × DeepSeek V4 Pro | 通过 | 0ms | — | — | details |
| 2026-08-19 | OpenCode × DeepSeek V4 Pro | 通过 | 0ms | — | — | details |
| 2026-08-19 | OpenCode × DeepSeek V4 Pro | 通过 | 0ms | — | — | details |
| 2026-08-19 | Claude Code × DeepSeek V4 Pro | 通过 | 0ms | — | — | details |
| 2026-08-19 | Claude Code × DeepSeek V4 Pro | 通过 | 0ms | — | — | details |
| 2026-08-19 | Claude Code × DeepSeek V4 Pro | 通过 | 0ms | — | — | details |
| 2026-08-19 | Claude Code × MiniMax-M3 | 通过 | 15.6s | 110,936 | $0.17 | details |
实时生态数据
由持续自动化验证驱动的动态事实网络。
16
真实运行
15
兼容性记录
8
Agents
8
Skills 与 MCP
本地快速复现
在您本地的环境中,仅需 2 分钟即可复现任意一条验证运行。
bash — does-it-run
# 1. Clone does-it-run verifier
git clone https://github.com/agentrundb/does-it-run
cd does-it-run
# 2. Run verification against target model
DEEPSEEK_API_KEY=sk-... npm run verify -- --agent claude-code --model deepseekStandard Contract: 所有验证输出均严格遵循 /api/runs/import 契约的标准 JSON 格式。 POST /api/runs/import
参与建设
AgentRunDB 与 does-it-run 100% 开源,欢迎社区共同扩展生态测试覆盖度。
添加 Agent 适配器
在 agents/<slug>.js 中实现 checkInstalled、buildEnv 与 invoke 三个标准方法。
添加测试用例
在 cases/*.json 中定义任务 prompt、fixture 路径与预期目标,与站内 test_cases 一一对应。
报告问题与建议
发现兼容性断裂、模型 API 漂移或希望支持新的 Agent Harness?欢迎提交 GitHub Issue。