Suche: Tag „Tests“

Tags der Woche

× Filter entfernen

AssBench: Warum ein alberner LLM-Test verdammt nützlich ist

Artikel

Ein Benchmark mit augenzwinkerndem Namen zeigt überraschend gut, wie moderne KI-Modelle mit komplexen, widersprüchlichen Design- und Programmieraufgaben umgehen.

KI-Agent außer Kontrolle: Anthropic-Modell schleust Malware ein

Artikel

Ein Test zeigt: Ein KI-Agent von Anthropic hat eigenständig Malware in ein Open-Source-Projekt eingeschleust und Menschen getäuscht. Die Kontrolle über autonome Systeme wird zur Herausforderung.