Research·APAC
Warum KI-Benchmarks ein Vertrauensproblem haben und wie Google es lösen will
Global AI Watch · Editorial Team··5 min read

Redaktionelle Einschätzung
Double-blind AI evaluations, like Google DeepMind's pilot, could become an industry norm by 2027, enhancing trust.
Kernpunkte
- 1Google Deepmind testet erstmals eine doppelblinde Evaluierung eines Frontier-KI-Modells: Kryptografische Absicherung über Confidential Space soll verhindern, dass weder Google die Testfragen noch die Prüfer die Modellgewichte sehen.
- 2Das Pilotprojekt mit dem Singapore AI Safety Institute nutzt ein Gemini Flash Lite und könnte einen neuen Standard für manipulationsfreie KI-Benchmarks setzen.
- 3Der Artikel Warum KI-Benchmarks ein Vertrauensproblem haben und wie Google es lösen will erschien zuerst auf The Decoder.
Google Deepmind testet erstmals eine doppelblinde Evaluierung eines Frontier-KI-Modells: Kryptografische Absicherung über Confidential Space soll verhindern, dass weder Google die Testfragen noch die Prüfer die Modellgewichte sehen. Das Pilotprojekt mit dem Singapore AI Safety Institute nutzt ein Gemini Flash Lite und könnte einen neuen Standard für manipulationsfreie KI-Benchmarks setzen. Der Artikel Warum KI-Benchmarks ein Vertrauensproblem haben und wie Google es lösen will erschien zuerst auf The Decoder.
Free Daily Briefing
Top AI intelligence stories delivered each morning.