ReMe/benchmark/longmemeval
方应 0835b05ae4 refactor(benchmark): 重构LongMemEval基准测试中的ReMe实例管理
- 移除未使用的shutil导入
- 将固定的ReMe实例改为每个问题创建独立实例以实现隔离
- 更新LLM配置名称从qwen3-max-think到qwen-max-t
- 修改模型调用逻辑使用正确的model_name参数
- 添加qwen-flash和GPT-4o-mini等新模型配置
- 统一使用"User"作为用户名,通过集合名实现隔离
- 调整并发处理数从4降至1,批处理大小从10增至30
- 每个问题类型采样数从2增至4
- 添加异步上下文管理确保资源正确释放
2026-03-02 20:42:26 +08:00
..
compute_stats.py halumem和longmemeval的Benchmark评估代码 (#124) 2026-03-02 18:58:37 +08:00
eval_longmemeval_reme.py refactor(benchmark): 重构LongMemEval基准测试中的ReMe实例管理 2026-03-02 20:42:26 +08:00
eval_longmemeval_reme_retrieve.py halumem和longmemeval的Benchmark评估代码 (#124) 2026-03-02 18:58:37 +08:00
eval_reme.yaml halumem和longmemeval的Benchmark评估代码 (#124) 2026-03-02 18:58:37 +08:00
eval_tools.py halumem和longmemeval的Benchmark评估代码 (#124) 2026-03-02 18:58:37 +08:00
llms.py halumem和longmemeval的Benchmark评估代码 (#124) 2026-03-02 18:58:37 +08:00