diff --git a/evals/swe-bench/evaluate_daytona.py b/evals/swe-bench/evaluate_daytona.py index 551c4c874..dce17dfee 100644 --- a/evals/swe-bench/evaluate_daytona.py +++ b/evals/swe-bench/evaluate_daytona.py @@ -498,7 +498,7 @@ def main(): help="Output directory for eval results", ) parser.add_argument( - "--max-workers", type=int, default=200, + "--max-workers", type=int, default=150, help="Max concurrent eval sandboxes (default 100)", ) parser.add_argument( diff --git a/evals/swe-bench/record_results.py b/evals/swe-bench/record_results.py index e928edd3b..d53fb29b2 100644 --- a/evals/swe-bench/record_results.py +++ b/evals/swe-bench/record_results.py @@ -80,7 +80,7 @@ def main(): help="Additional notes or observations", ) parser.add_argument( - "--timeout", type=int, default=600, + "--timeout", type=int, default=1200, help="Per-instance timeout used (seconds)", ) parser.add_argument( diff --git a/evals/swe-bench/run_eval.py b/evals/swe-bench/run_eval.py index 1298e67d2..16b015141 100644 --- a/evals/swe-bench/run_eval.py +++ b/evals/swe-bench/run_eval.py @@ -388,7 +388,7 @@ def main(): "--provider", default="anthropic", help="LLM provider", ) parser.add_argument( - "--max-workers", type=int, default=200, + "--max-workers", type=int, default=150, help="Max concurrent sandboxes (default 100)", ) parser.add_argument(