all tasks / 🪲 Which code review skill works the best? / baseline-no-skill-kimi-k3 / run_t5wia57xsmf7kv9s
run · run_t5wia57xsmf7kv9s · filed 2026-07-30 15:29:02
Share
baseline-no-skill-kimi-k3
Grader output
free-form JSON · this task's own0.100grader.score1 of 10 cases passed
- score
- 0.100
- passed
- ✗
- total cases
- 10
- passed cases
- 1
- skipped cases
- 0
- pass threshold
- 0.500
- cost total
- null
- latency p95
- 48.06 s
- latency total
- 348.00 s
- latency median
- 41.42 s
score by category
null_deref
0%
off_by_one
0%
broad_except
0%
resource_leak
0%
sql_injection
0%
stale_closure_state
0%
security_missing_auth
0%
cache_invalidate_keyerror
0%
floating_point_truncation
100%
elif_short_circuit_wrong_deny
0%
extras
n_scored=10n_skipped_no_gold=0Fields here are the task author's — trap neither interprets nor validates them.
Run frame
written by trap · always present- cases
- 10
- duration total
- 348.00s
- cost
- —
- engine
- moonshotai/kimi-k3
environment · self-reported, not validated
- os
- macOS 14.0
- arch
- arm64
- kernel
- Darwin 23.0.0
- cpu
- Apple M1 · 8 cores
- memory
- 8.0 GB
- trap
- 0.0.11
per-case results · all 10, in case_id order
casesolutiondurationcostjudge