Human Verdicts are the ranked input. Automatic scoring is not used for ranking. Latency over 5,000 ms is flagged.
| # | Server Variant | Translation failures | Audited pass rate | Mean MER accuracy | Mean latency | Offending Takes |
|---|---|---|---|---|---|---|
| 1 | mini_auto_bare_deg gpt-4o-mini-transcribe · degraded · auto · bare | 0 | — (0 judged, 291 unaudited) | — | 704 ms | — |
| 2 | mini_prod_baseline gpt-4o-mini-transcribe · degraded · en · bare | 0 | — (0 judged, 291 unaudited) | — | 714 ms | — |
| 3 | mini_auto_prompt_deg gpt-4o-mini-transcribe · degraded · auto · mixed prompt | 0 | — (0 judged, 291 unaudited) | — | 717 ms | — |
| 4 | gpt_tw_en_bare_deg gpt-transcribe · degraded · zh-tw + en · bare | 0 | — (0 judged, 291 unaudited) | — | 726 ms | — |
| 5 | mini_auto_bare_clean gpt-4o-mini-transcribe · clean · auto · bare | 0 | — (0 judged, 291 unaudited) | — | 730 ms | — |
| 6 | mini_zh_prompt_deg gpt-4o-mini-transcribe · degraded · zh · mixed prompt | 0 | — (0 judged, 291 unaudited) | — | 753 ms | — |
| 7 | gpt_tw_en_prompt_clean gpt-transcribe · clean · zh-tw + en · mixed prompt | 0 | — (0 judged, 291 unaudited) | — | 754 ms | — |
| 8 | gpt_tw_only_prompt_deg gpt-transcribe · degraded · zh-tw · mixed prompt | 0 | — (0 judged, 291 unaudited) | — | 760 ms | — |
| 9 | mini_auto_prompt_64k gpt-4o-mini-transcribe · 64k · auto · mixed prompt | 0 | — (0 judged, 291 unaudited) | — | 761 ms | — |
| 10 | mini_auto_prompt_clean gpt-4o-mini-transcribe · clean · auto · mixed prompt | 0 | — (0 judged, 291 unaudited) | — | 768 ms | — |
| 11 | gpt_tw_en_prompt_64k gpt-transcribe · 64k · zh-tw + en · mixed prompt | 0 | — (0 judged, 291 unaudited) | — | 770 ms | — |
| 12 | mini_zh_prompt_clean gpt-4o-mini-transcribe · clean · zh · mixed prompt | 0 | — (0 judged, 291 unaudited) | — | 774 ms | — |
| 13 | gpt_tw_en_prompt_deg gpt-transcribe · degraded · zh-tw + en · mixed prompt | 0 | — (0 judged, 291 unaudited) | — | 774 ms | — |
No winner selected yet.