开源自动化验证流水线

AgentRunDB 实验室

每一条经过验证的运行,都在这里被执行、捕获与发布。

CORE PRINCIPLE

“网站内容不是写出来的,而是跑出来的。”

五步自动化验证流水线

每一条兼容性结论如何从隔离环境中的真实执行事实中诞生。

01

GitHub Actions 触发

定时任务(每周六 03:17 UTC)或手动触发,针对 Agent 与目标模型矩阵发起全面验证。

02

隔离环境启动

创建独立的临时工作目录并复制 fixture 仓库,内置一个待修复的失败单元测试。

03

Agent 无头执行

通过 CLI(如 claude -p)无头调用 Agent,注入对应厂商端点环境变量,执行限时 10 分钟。

04

事实与结论判定

执行 node --test(退出码 0 为 passed),通过 SHA-256 哈希比对文件变更,确立能力事实。

05

证据归档与入库

将 report.json、log.txt 与代码 diff 归档为 artifact,调用 POST /api/runs/import 自动更新站点。

最近验证运行

由自动化验证器执行并实时入库 AgentRunDB 的真实运行记录。

查看全部运行记录 →
日期兼容性状态耗时Tokens成本运行
2026-08-19OpenClaw × DeepSeek V4 Pro通过0msdetails
2026-08-19OpenClaw × DeepSeek V4 Pro通过0msdetails
2026-08-19OpenClaw × DeepSeek V4 Pro通过0msdetails
2026-08-19OpenCode × DeepSeek V4 Pro通过0msdetails
2026-08-19OpenCode × DeepSeek V4 Pro通过0msdetails
2026-08-19OpenCode × DeepSeek V4 Pro通过0msdetails
2026-08-19Claude Code × DeepSeek V4 Pro通过0msdetails
2026-08-19Claude Code × DeepSeek V4 Pro通过0msdetails
2026-08-19Claude Code × DeepSeek V4 Pro通过0msdetails
2026-08-19Claude Code × MiniMax-M3通过15.6s110,936$0.17details

实时生态数据

由持续自动化验证驱动的动态事实网络。

16
真实运行
15
兼容性记录
8
Agents
8
Skills 与 MCP

本地快速复现

在您本地的环境中,仅需 2 分钟即可复现任意一条验证运行。

bash — does-it-run
# 1. Clone does-it-run verifier
git clone https://github.com/agentrundb/does-it-run
cd does-it-run

# 2. Run verification against target model
DEEPSEEK_API_KEY=sk-... npm run verify -- --agent claude-code --model deepseek
Standard Contract: 所有验证输出均严格遵循 /api/runs/import 契约的标准 JSON 格式。 POST /api/runs/import

参与建设

AgentRunDB 与 does-it-run 100% 开源,欢迎社区共同扩展生态测试覆盖度。

添加 Agent 适配器

在 agents/<slug>.js 中实现 checkInstalled、buildEnv 与 invoke 三个标准方法。

添加测试用例

在 cases/*.json 中定义任务 prompt、fixture 路径与预期目标,与站内 test_cases 一一对应。

报告问题与建议

发现兼容性断裂、模型 API 漂移或希望支持新的 Agent Harness?欢迎提交 GitHub Issue。