ReMe/benchmark
方应 bb59a36f2c refactor(benchmark): 重构长记忆评估中的模型配置
- 将原有的 eval_model_name 替换为专门的 retrieve_model_name 用于检索操作
- 添加对 qwen-max 模型配置的支持
- 更新参数解析器以支持新的检索模型参数
- 修改最大并发数默认值从 1 提升到 4
- 调整样本数量默认值从 4 减少到 1
- 统一模型参数命名规范,区分摘要、检索和评估模型
- 优化内存处理器初始化逻辑,支持独立的检索模型配置
2026-03-03 11:26:45 +08:00
..
appworld update for pre-commit check 2026-02-27 13:30:22 +08:00
bfcl update for pre-commit check 2026-02-27 13:30:22 +08:00
halumem refactor(benchmark): 重构长记忆评估中的模型配置 2026-03-03 11:26:45 +08:00
longmemeval refactor(benchmark): 重构长记忆评估中的模型配置 2026-03-03 11:26:45 +08:00