Naar de inhoud

AI & Identity · Nieuws van de dag

← Terug naar het nieuws

Nieuwe DSpark-draftmodel versnelt vision-language modellen

Hugging Face blog · · Overig 48

In het kort

  • Nieuwe DSpark-draftmodel versnelt vision-language modellen.
  • Model verhoogt snelheid tot 3,13x zonder outputkwaliteit te beïnvloeden.
  • Ongeveer 280 miljoen parameters met een toename van 8,9% in geheugengebruik.
  • Significante prestatieverbeteringen op zowel on-device als GPU-inferentie.
  • Ondersteuning voor verschillende ontwikkeltools zoals llama.cpp en MLX-VLM.

Vandaag is een experimenteel DSpark-draftmodel voor het vision-language model LFM2.5-VL-3B uitgebracht. Dit model introduceert een speculatieve decodering die een kleine toename in geheugengebruik met zich meebrengt, maar tegelijkertijd de snelheid aanzienlijk verhoogt zonder de outputkwaliteit aan te tasten.

Het vision drafter maakt gebruik van dezelfde architectuur als de tekst LFM2.5-DSpark drafters. Het model vangt de verborgen toestanden van de doelmodel op een vaste set van lagen en gebruikt deze om een blok van k kandidaat-token te genereren. Zowel afbeeldingspatches als teksttokens worden geprojecteerd in een gedeelde representatie, waardoor de drafter op identieke verborgen toestandsvectoren kan werken, ongeacht de invoermodus.

De DSpark-draftmodellen zijn getraind met een mix van vision-language SFT-gegevens, waarbij de focus ligt op de verwachte workloads. Het resultaat is een model met ongeveer 280 miljoen parameters, dat de parameter telling van het gedeployde model met slechts 8,9% verhoogt. Bij de inferentie is een blokgrootte van 8 of 9 aanbevolen, afhankelijk van de hardware.

De prestaties zijn indrukwekkend: op een M5 Max zijn de decoderingstijden 2,30x tot 3,13x sneller, terwijl de end-to-end latentie met 1,56x tot 2,62x verbetert. Op een H100 GPU zijn de snelheidsverbeteringen nog groter, met decodering tot 20,4x sneller.

Voor organisaties die AI-modellen implementeren, biedt deze ontwikkeling mogelijkheden om de efficiëntie van vision-language toepassingen te verbeteren. De verbeterde snelheid van decodering kan de reactietijden van AI-systemen verkorten, wat cruciaal is voor toepassingen zoals beeldherkenning en interactieve conversaties.

De DSpark-draftmodellen zijn beschikbaar op Hugging Face in Safetensors en GGUF-formaten, met directe ondersteuning voor llama.cpp, MLX-VLM en SGLang. Dit maakt het voor ontwikkelaars eenvoudiger om deze modellen lokaal en versnelde VLM-inferentie te verkennen.

Lees het origineel bij huggingface.co

Dit stuk is geschreven op basis van het originele artikel bij Hugging Face blog. De feiten komen daarvandaan; de tekst is van de , geschreven met hulp van AI.

vision-language modellen LFM2.5-VL-DSpark technologie Hugging Face

Waarom dit op het overzicht staat: Het onderwerp is te specifiek en biedt geen directe relevantie voor de lezers van RedFlare.

Reacties

Nog niemand. Wees de eerste.

Meepraten?

Reageren kan met een account. Dat houdt de rommel buiten de deur en zorgt dat je elkaar herkent in een gesprek.

Account maken Of inloggen

Verder lezen