good_bad_grey — scoring algo evaluation

Ranking-first evaluation of the product scoring algo against a blind multi-LLM judge panel. Experiments collapse by algo content ({prompt+config} hash), so re-runs, branches, and merges of the same algo appear once.

Experiments (1) — agreement vs baseline

Baseline ⭐ = 33b6b6bc52cc (branch main). Each cell is this experiment's ensemble Spearman with the delta vs baseline; green = closer to the judge panel, red = further. #inv = consensus rank inversions.

experimentoil_controlantioxidantbrighteningfirmness_collagen#inv
33b6b6bc52cc
main · 91fd5565 · 2 run(s)
0.5240.8020.5830.4665

Trend — ensemble Spearman across experiments

0.000.250.500.751.0033b6b6bc52ccoil_controlantioxidantbrighteningfirmness_collagen

Experiment details

33b6b6bc52cc

2026-08-11T13:24:18.616591+00:00 · clean · branch main · code 91fd5565 · prompt 3c1cb0a2a9fbda8f · config d778abee4d239730

benchmark serums-v1 v1 · judges: gpt-5.6-sol(inci), deepseek-v4-pro(inci), gpt-5.4-pro(full)

Ensemble ranking agreement

metricspearmanndcg@5top5
oil_control0.5240.8620.600
antioxidant0.8020.8570.600
brightening0.5830.8590.600
firmness_collagen0.4660.8260.600

Consensus inversions

metricproductalgo rankjudge rankdirection
oil_control1272752718–20algo over-ranks
oil_control1252974167–7algo under-ranks
brightening5003153813–19algo over-ranks
brightening5003158165–7algo under-ranks
firmness_collagen5003166161–4algo under-ranks
Full per-judge scorecard
metricjudgespearmankendallndcg5top5mean_drankbucket_exact
oil_controlgpt-5.6-sol:inci0.5370.3790.8770.6004.6000.250
oil_controldeepseek-v4-pro:inci0.5180.3640.8410.6004.9000.200
oil_controlgpt-5.4-pro:full0.4520.3330.8430.6004.9500.200
oil_controlensemble0.5240.3640.8620.6004.7500.200
antioxidantgpt-5.6-sol:inci0.7190.5540.8990.6003.4000.400
antioxidantdeepseek-v4-pro:inci0.7600.5790.8200.6003.3500.300
antioxidantgpt-5.4-pro:full0.6800.5080.8460.6003.7000.450
antioxidantensemble0.8020.6070.8570.6002.8000.500
brighteninggpt-5.6-sol:inci0.6300.4420.9230.4004.0000.500
brighteningdeepseek-v4-pro:inci0.4930.3370.8050.6004.6000.350
brighteninggpt-5.4-pro:full0.4870.2950.8200.4004.8000.250
brighteningensemble0.5830.3850.8590.6004.3500.250
firmness_collagengpt-5.6-sol:inci0.5490.4060.8820.4004.2000.350
firmness_collagendeepseek-v4-pro:inci0.4120.3060.8150.6005.3500.250
firmness_collagengpt-5.4-pro:full0.4100.2950.7550.6004.9000.200
firmness_collagenensemble0.4660.3370.8260.6004.8000.250

Generated by eval.portal. Source of truth: eval/results/.