all tasks / Debugging in a vendor payout senario - not many cases, but hard 😬 / vendor-payout-multi-model-gpt-5.6-luna-pro / run_yzox5chy153uvgzy
run · run_yzox5chy153uvgzy · filed 2026-07-25 22:31:12
Share
vendor-payout-multi-model-gpt-5.6-luna-pro
Grader output
free-form JSON · this task's own0.750grader.score3 of 4 cases passed
- score
- 0.750
- passed
- ✓
- total cases
- 4
- passed cases
- 3
- skipped cases
- 0
- pass threshold
- 0.500
- cost total
- null
- latency p95
- 35.80 s
- latency total
- 81.00 s
- latency median
- 15.44 s
score by category
supplier_change_dated
100%
royalty_change_with_b2b
100%
supplier_change_alltime
100%
srp_change_recalc_royalty
0%
extras
n_scored=4n_skipped_no_gold=0Fields here are the task author's — trap neither interprets nor validates them.
Run frame
written by trap · always present- cases
- 4
- duration total
- 81.00s
- cost
- —
- engine
- openai/gpt-5.6-luna-pro
environment · self-reported, not validated
- os
- macOS 14.0
- arch
- arm64
- kernel
- Darwin 23.0.0
- cpu
- Apple M1 · 8 cores
- memory
- 8.0 GB
- trap
- 0.0.8
per-case results · all 4, in case_id order
casesolutiondurationcostjudge