Harbor
Harbor 是由 Terminal-Bench 创作者推出的框架,用于在容器环境中指定沙箱化智能体任务,以评估和优化智能体与语言模型。它支持评估 Claude Code、OpenHands、Codex CLI 等任意智能体,构建和分享基准与环境,通过 Daytona、Modal、LangSmith、Blaxel、Novita Sandbox、Tensorlake 和 Runta 等提供方并行开展数千个环境的实验,并生成用于 RL 优化的 rollout。
访问 harbor-framework/harbor项目简介
Harbor 是来自 Terminal-Bench 创作者的框架,用于指定沙箱化智能体任务以进行评估和优化。它可以评估 Claude Code、OpenHands、Codex CLI 等任意智能体,构建和分享基准与环境,并行运行数千个环境中的实验,并生成用于 RL 优化的 rollout。
核心功能
- 可评估 Claude Code、OpenHands、Codex CLI 等任意智能体;可构建和分享自定义基准与环境;可通过 Daytona、Modal、LangSmith、Blaxel、Novita Sandbox、Tensorlake 和 Runta 等提供方,在数千个环境中并行开展实验;可生成用于 RL 优化的 rollout;是 Terminal-Bench-2.0 的官方 harness。
适用场景
- 在本地用 Docker 运行 Terminal-Bench-2.0 等基准,或在 Daytona 等云提供方上运行;在受支持数据集上评估任意智能体与语言模型;探索 SWE-Bench 和 Aider Polyglot 等第三方基准;生成用于 RL 优化的 rollout。
快速开始
- 使用 uv tool install harbor 或 pip install harbor 安装 Harbor。运行 Terminal-Bench-2.0 示例前设置 ANTHROPIC_API_KEY,然后可使用 harbor run --dataset terminal-bench@2.0 --agent claude-code --model anthropic/claude-opus-4-1 --n-concurrent 4。使用 harbor run --help 查看受支持智能体与选项;使用 harbor datasets list
部署与要求
- 本地基准运行使用 Docker。云运行可通过 --env 标志使用 Daytona 等提供方。Anthropic 模型需设置 ANTHROPIC_API_KEY;Daytona 云运行需设置 DAYTONA_API_KEY。
采用前须知
- 许可证:Apache-2.0。在使用、修改或分发项目前,请确认其具体条款。