ReMe/benchmark/longmemeval
方应 bb59a36f2c refactor(benchmark): 重构长记忆评估中的模型配置
- 将原有的 eval_model_name 替换为专门的 retrieve_model_name 用于检索操作
- 添加对 qwen-max 模型配置的支持
- 更新参数解析器以支持新的检索模型参数
- 修改最大并发数默认值从 1 提升到 4
- 调整样本数量默认值从 4 减少到 1
- 统一模型参数命名规范,区分摘要、检索和评估模型
- 优化内存处理器初始化逻辑,支持独立的检索模型配置
2026-03-03 11:26:45 +08:00
..
compute_stats.py halumem和longmemeval的Benchmark评估代码 (#124) 2026-03-02 18:58:37 +08:00
eval_longmemeval_reme.py refactor(benchmark): 重构长记忆评估中的模型配置 2026-03-03 11:26:45 +08:00
eval_longmemeval_reme_retrieve.py halumem和longmemeval的Benchmark评估代码 (#124) 2026-03-02 18:58:37 +08:00
eval_reme.yaml halumem和longmemeval的Benchmark评估代码 (#124) 2026-03-02 18:58:37 +08:00
eval_tools.py halumem和longmemeval的Benchmark评估代码 (#124) 2026-03-02 18:58:37 +08:00
llms.py halumem和longmemeval的Benchmark评估代码 (#124) 2026-03-02 18:58:37 +08:00