From 27fdcb2a1fafc07cf8c89582a943393a6b50e51b Mon Sep 17 00:00:00 2001 From: mubashir1osmani Date: Mon, 13 Jul 2026 18:59:59 -0700 Subject: [PATCH] test(e2e): refresh arize_phoenix burst registry cell for otel_v2 The fail_before_fix marker and proven-red rationale described the v1 pipeline's non-streaming /v1/messages double-log, which does not reproduce on otel_v2; the cell now documents the gate as a strict regression fence --- tests/e2e/coverage_registry/logging.yaml | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/tests/e2e/coverage_registry/logging.yaml b/tests/e2e/coverage_registry/logging.yaml index bada7fface8..4e8415e018c 100644 --- a/tests/e2e/coverage_registry/logging.yaml +++ b/tests/e2e/coverage_registry/logging.yaml @@ -14,7 +14,7 @@ - {id: logging.langsmith.success.logs_spend, module: logging, tier: P1, event: success, assertions: [logs_spend], exercised_on: [chat_completions, messages], source: "integrations/langsmith.py", rationale: "LangChain ecosystem"} - {id: logging.arize.success.logs_spend, module: logging, tier: P1, event: success, assertions: [logs_spend], exercised_on: [chat_completions, embeddings], source: "integrations/arize/arize.py", rationale: "ML-ops observability"} - {id: logging.arize_phoenix.success.logs_spend, module: logging, tier: P1, event: success, assertions: [logs_spend], exercised_on: [messages], source: "integrations/arize/arize_phoenix.py", rationale: "Phoenix OTLP delivery: trace lands, spend row flushes, tool use on the trace"} -- {id: logging.arize_phoenix.stream.logs_spend, module: logging, tier: P1, event: stream, assertions: [logs_spend], exercised_on: [messages], source: "integrations/arize/arize_phoenix.py", fail_before_fix: proven, rationale: "Claude Code-style /v1/messages burst: exactly one generation span per request, no duplicate traces. Proven red: non-streaming /v1/messages double-logs success (sync+async handlers both fire; _is_sync_litellm_request has no anthropic_messages marker)"} +- {id: logging.arize_phoenix.stream.logs_spend, module: logging, tier: P1, event: stream, assertions: [logs_spend], exercised_on: [messages], source: "integrations/arize/arize_phoenix.py", rationale: "Claude Code-style /v1/messages burst: exactly one generation span per request, no duplicate traces. Guards the v1-pipeline double-log (sync and async handlers both fired for anthropic_messages); otel_v2 ships one span per request and the gate stays strict as the regression fence"} - {id: logging.mlflow.success.logs_spend, module: logging, tier: P1, event: success, assertions: [logs_spend], exercised_on: [chat_completions], source: "integrations/mlflow.py", rationale: "Experiment tracking cost/run"} - {id: logging.opik.success.logs_spend, module: logging, tier: P1, event: success, assertions: [logs_spend], exercised_on: [chat_completions], source: "integrations/opik/opik.py", rationale: "Eval platform spend/case"} - {id: logging.openmeter.success.exports_metric, module: logging, tier: P1, event: success, assertions: [exports_metric], exercised_on: [chat_completions, messages, embeddings], source: "integrations/openmeter.py", rationale: "Usage metering for billing"}