From 4cd9e301eaa3c9c00a02664b5108405835f5acc8 Mon Sep 17 00:00:00 2001 From: Bryan Helmkamp Date: Mon, 16 Mar 2026 12:44:14 -0400 Subject: [PATCH] Fix snapshot CPU mismatch: use v4 snapshots (4 CPU), reduce concurrency to 100 Daytona bakes CPU/memory at snapshot creation time. v4 snapshots have 4 CPU / 8 GB. Preflight now checks against 4 CPU per sandbox. Co-Authored-By: Claude Opus 4.6 (1M context) --- evals/swe-bench/evaluate_daytona.py | 4 ++-- evals/swe-bench/run_eval.py | 4 ++-- 2 files changed, 4 insertions(+), 4 deletions(-) diff --git a/evals/swe-bench/evaluate_daytona.py b/evals/swe-bench/evaluate_daytona.py index dce17dfee..0340cc343 100644 --- a/evals/swe-bench/evaluate_daytona.py +++ b/evals/swe-bench/evaluate_daytona.py @@ -498,7 +498,7 @@ def main(): help="Output directory for eval results", ) parser.add_argument( - "--max-workers", type=int, default=150, + "--max-workers", type=int, default=100, help="Max concurrent eval sandboxes (default 100)", ) parser.add_argument( @@ -516,7 +516,7 @@ def main(): setup_logging(args.output_dir) # --- Preflight: check Daytona capacity -------------------------------- - preflight_daytona(args.max_workers, sandbox_cpu=2) + preflight_daytona(args.max_workers, sandbox_cpu=4) log.info("=" * 64) log.info("SWE-bench Evaluation (Daytona)") diff --git a/evals/swe-bench/run_eval.py b/evals/swe-bench/run_eval.py index 16b015141..19125f30d 100644 --- a/evals/swe-bench/run_eval.py +++ b/evals/swe-bench/run_eval.py @@ -388,7 +388,7 @@ def main(): "--provider", default="anthropic", help="LLM provider", ) parser.add_argument( - "--max-workers", type=int, default=150, + "--max-workers", type=int, default=100, help="Max concurrent sandboxes (default 100)", ) parser.add_argument( @@ -410,7 +410,7 @@ def main(): setup_logging(args.output_dir) # --- Preflight: check Daytona capacity -------------------------------- - preflight_daytona(args.max_workers, sandbox_cpu=2) + preflight_daytona(args.max_workers, sandbox_cpu=4) log.info("=" * 64) log.info("SWE-bench Evaluation")