ReMe/benchmark
方应 0835b05ae4 refactor(benchmark): 重构LongMemEval基准测试中的ReMe实例管理
- 移除未使用的shutil导入
- 将固定的ReMe实例改为每个问题创建独立实例以实现隔离
- 更新LLM配置名称从qwen3-max-think到qwen-max-t
- 修改模型调用逻辑使用正确的model_name参数
- 添加qwen-flash和GPT-4o-mini等新模型配置
- 统一使用"User"作为用户名,通过集合名实现隔离
- 调整并发处理数从4降至1,批处理大小从10增至30
- 每个问题类型采样数从2增至4
- 添加异步上下文管理确保资源正确释放
2026-03-02 20:42:26 +08:00
..
appworld update for pre-commit check 2026-02-27 13:30:22 +08:00
bfcl update for pre-commit check 2026-02-27 13:30:22 +08:00
halumem halumem和longmemeval的Benchmark评估代码 (#124) 2026-03-02 18:58:37 +08:00
longmemeval refactor(benchmark): 重构LongMemEval基准测试中的ReMe实例管理 2026-03-02 20:42:26 +08:00