Naar de inhoud

AI & Identity · Nieuws van de dag

← Terug naar het nieuws

OpenAI verstoort distillatiecampagne van Moonshot AI

The Hacker News · · info@thehackernews.com (The Hacker News) · Beveiliging 75
OpenAI verstoort distillatiecampagne van Moonshot AI

In het kort

  • OpenAI heeft een distillatiecampagne van Moonshot AI verstoord.
  • De campagne omvatte 16.000 verzoeken van meer dan 4.000 gebruikers.
  • Adversarial distillation stelt aanvallers in staat om modeloutput ongeoorloofd te gebruiken.
  • OpenAI heeft extra maatregelen en blokkades geïmplementeerd tegen deze aanvallen.
  • Moonshot AI is eerder beschuldigd van vergelijkbare praktijken.

OpenAI heeft een gecoördineerde distillatiecampagne verstoord die was opgezet om op ongeoorloofde wijze beschermde redeneervormen uit zijn AI-modellen te extraheren. Deze activiteit, die begon in de eerste week van juli 2026, werd toegeschreven aan individuen die verbonden zijn aan het Chinese bedrijf Moonshot AI, gevestigd in Beijing. OpenAI meldde dat de aanvallers geen toegang hadden gekregen tot versleutelde gegevens of gebruikersgesprekken, maar in plaats daarvan modelinteracties manipuleerden om beschermde redeneervormen zichtbaar te maken voor de verzoeker.

De campagne begon op 1 juli 2026 met een laag aantal pogingen, maar steeg dramatisch op 24 en 25 juli met 16.000 verzoeken van meer dan 4.000 gebruikers. OpenAI ontdekte ook gerelateerde 'prompt-pattern activiteiten' bij meer dan 15.000 gebruikers. De campagne werd op 28 juli 2026 volledig verstoord. De activiteit werd gekarakteriseerd als 'adversarial distillation', wat inhoudt dat de outputs van het ene model op ongeoorloofde wijze worden gebruikt om een ander model te trainen of te verbeteren.

OpenAI heeft extra maatregelen genomen om deze aanvallen tegen te gaan en heeft frauduleuze accounts geblokkeerd. Ze hebben ook een 'pad' gesloten dat het mogelijk maakte voor sommige gebruikers om versleutelde redeneervormen van anderen te hergebruiken en de inhoud ervan te herstellen. Daarnaast zijn er controles toegevoegd om gestreamde output te detecteren die mogelijk gevoelige informatie onthult.

Onderzoekers hebben in augustus 2026 een architectonische kwetsbaarheid ontdekt die de versleutelde redeneervormen uitwisselbaar maakte tussen verschillende sessies en modellen binnen een ecosysteem. Dit stelt aanvallers in staat om een schaalbare decryptie-jailbreak te ontwikkelen en anti-distillatiemechanismen te omzeilen. De onderzoekers wezen erop dat dit kan leiden tot grootschalige extractie van privégegevens en de onthulling van gevaarlijke informatie.

OpenAI heeft gewaarschuwd dat adversarial distillation veiligheids- en nationale veiligheidsrisico's met zich meebrengt. Geëxtraheerde redeneervormen kunnen worden gebruikt om andere modellen te trainen zonder de veiligheidsmaatregelen van het oorspronkelijke model te behouden. Dit probleem wordt verergerd naarmate modellen meer geavanceerde mogelijkheden ontwikkelen in gebieden met een dubbel gebruik.

Dit is niet de eerste keer dat Moonshot AI beschuldigd wordt van distillatie. Vorige maand beschuldigde concurrent Anthropic Moonshot AI ervan klantverzoeken stiekem door te sturen naar Claude in plaats van deze met Kimi te verwerken, en vervolgens de antwoorden van Claude aan gebruikers te tonen. De activiteiten van Moonshot AI zijn gevolgd onder de naam GTG-16002.

Lees het origineel bij thehackernews.com

Dit stuk is geschreven op basis van het originele artikel bij The Hacker News. De feiten komen daarvandaan; de tekst is van de , geschreven met hulp van AI.

beveiliging AI-aanval OpenAI

Waarom dit op het overzicht staat: De disruptie van een aanval op AI-modellen door OpenAI toont de kwetsbaarheid van AI-systemen aan en is relevant voor beveiligingsprofessionals.

Reacties

Nog niemand. Wees de eerste.

Meepraten?

Reageren kan met een account. Dat houdt de rommel buiten de deur en zorgt dat je elkaar herkent in een gesprek.

Account maken Of inloggen

Verder lezen