Ranking-first evaluation of the product scoring algo against a blind multi-LLM judge panel. Experiments collapse by algo content ({prompt+config} hash), so re-runs, branches, and merges of the same algo appear once.
Baseline ⭐ = 33b6b6bc52cc (branch main). Each cell is this experiment's ensemble Spearman with the delta vs baseline; green = closer to the judge panel, red = further. #inv = consensus rank inversions.
| experiment | oil_control | antioxidant | brightening | firmness_collagen | #inv |
|---|---|---|---|---|---|
| 33b6b6bc52cc ⭐ main · 91fd5565 · 2 run(s) | 0.524 | 0.802 | 0.583 | 0.466 | 5 |
2026-08-11T13:24:18.616591+00:00 · clean
· branch main
· code 91fd5565
· prompt 3c1cb0a2a9fbda8f
· config d778abee4d239730
benchmark serums-v1 v1
· judges: gpt-5.6-sol(inci), deepseek-v4-pro(inci), gpt-5.4-pro(full)
| metric | spearman | ndcg@5 | top5 |
|---|---|---|---|
| oil_control | 0.524 | 0.862 | 0.600 |
| antioxidant | 0.802 | 0.857 | 0.600 |
| brightening | 0.583 | 0.859 | 0.600 |
| firmness_collagen | 0.466 | 0.826 | 0.600 |
| metric | product | algo rank | judge rank | direction |
|---|---|---|---|---|
| oil_control | 1272752 | 7 | 18–20 | algo over-ranks |
| oil_control | 1252974 | 16 | 7–7 | algo under-ranks |
| brightening | 5003153 | 8 | 13–19 | algo over-ranks |
| brightening | 5003158 | 16 | 5–7 | algo under-ranks |
| firmness_collagen | 5003166 | 16 | 1–4 | algo under-ranks |
| metric | judge | spearman | kendall | ndcg5 | top5 | mean_drank | bucket_exact |
|---|---|---|---|---|---|---|---|
| oil_control | gpt-5.6-sol:inci | 0.537 | 0.379 | 0.877 | 0.600 | 4.600 | 0.250 |
| oil_control | deepseek-v4-pro:inci | 0.518 | 0.364 | 0.841 | 0.600 | 4.900 | 0.200 |
| oil_control | gpt-5.4-pro:full | 0.452 | 0.333 | 0.843 | 0.600 | 4.950 | 0.200 |
| oil_control | ensemble | 0.524 | 0.364 | 0.862 | 0.600 | 4.750 | 0.200 |
| antioxidant | gpt-5.6-sol:inci | 0.719 | 0.554 | 0.899 | 0.600 | 3.400 | 0.400 |
| antioxidant | deepseek-v4-pro:inci | 0.760 | 0.579 | 0.820 | 0.600 | 3.350 | 0.300 |
| antioxidant | gpt-5.4-pro:full | 0.680 | 0.508 | 0.846 | 0.600 | 3.700 | 0.450 |
| antioxidant | ensemble | 0.802 | 0.607 | 0.857 | 0.600 | 2.800 | 0.500 |
| brightening | gpt-5.6-sol:inci | 0.630 | 0.442 | 0.923 | 0.400 | 4.000 | 0.500 |
| brightening | deepseek-v4-pro:inci | 0.493 | 0.337 | 0.805 | 0.600 | 4.600 | 0.350 |
| brightening | gpt-5.4-pro:full | 0.487 | 0.295 | 0.820 | 0.400 | 4.800 | 0.250 |
| brightening | ensemble | 0.583 | 0.385 | 0.859 | 0.600 | 4.350 | 0.250 |
| firmness_collagen | gpt-5.6-sol:inci | 0.549 | 0.406 | 0.882 | 0.400 | 4.200 | 0.350 |
| firmness_collagen | deepseek-v4-pro:inci | 0.412 | 0.306 | 0.815 | 0.600 | 5.350 | 0.250 |
| firmness_collagen | gpt-5.4-pro:full | 0.410 | 0.295 | 0.755 | 0.600 | 4.900 | 0.200 |
| firmness_collagen | ensemble | 0.466 | 0.337 | 0.826 | 0.600 | 4.800 | 0.250 |
Generated by eval.portal. Source of truth: eval/results/.