Skip to the tool workspace
Browser 106
no file limit
Alibaba Cloud Draait op je GPU

Qwen3 4B in je browser draaien

Capable general model with a reasoning mode; a good fit for 8 GB machines.

modelQwen3-4B-q4f16_1-MLC engineWebLLM 0.2.84 netwerkhet model wordt één keer gedownload
Download2.1 GB
GPU-geheugen3.4 GB
Context4k tokens
Parameters4B
Varianten2

Qwen3 4B in de browser gebruiken Alle modellen Eén keer downloaden · daarna offline

Open deze pagina in een browser met JavaScript om te controleren of Qwen3 4B op dit apparaat past. Het heeft ongeveer 3.4 GB GPU-geheugen en een download van 2.1 GB nodig.
Specificaties Overgenomen van de modelkaart
Familie
Qwen
Uitgegeven door
Alibaba Cloud
Parameters
4B
Kwantisatie
q4f16_1 · 4-bit
Download
2.1 GB · 74 bestanden
GPU-geheugen
3.4 GB
Contextvenster
4k tokens
Redeneren
Optioneel
Licentie
Apache 2.0
Basismodel
Qwen/Qwen3-4B
Goed in
Chat · Redeneren · Meertalig
Varianten Dezelfde gewichten, andere precisie
# Variant Download GPU-geheugen Context Toelichting
01 q4f16_1 2.1 GB 3.4 GB 4k tokens 4-bits gewichten, f16 Aanbevolen
02 q4f32_1 2.3 GB 4.2 GB 4k tokens 4-bits gewichten, f32
Zo draai je het
01 Open de chat De knop hierboven opent Qwen3 4B in de AI-chat in de browser, met het model al geselecteerd.
02 Eén keer downloaden 2.1 GB komt binnen vanaf Hugging Face en blijft in de cache van je browser. Je kunt alvast typen tijdens het downloaden.
03 Privé chatten Het model draait op je GPU. Niets van wat je typt wordt geüpload, en het blijft offline werken.
Vragen
Hoe groot is de download van Qwen3 4B?

2.1 GB voor de q4f16_1-variant, verdeeld over 74 bestanden. Het wordt één keer gedownload en blijft in de cache van je browser, zodat elk later bezoek meteen begint en offline werkt.

Wat heeft mijn apparaat nodig om Qwen3 4B te draaien?

Een browser met WebGPU — een recente Chrome, Edge, Firefox of Safari — en ongeveer 3.4 GB GPU-geheugen. Het hulpmiddel controleert je GPU, geheugen en vrije ruimte en zegt of Qwen3 4B past voordat er iets wordt gedownload.

Wordt er iets van wat ik typ naar een server gestuurd?

Nee. Qwen3 4B draait op je eigen GPU in het browsertabblad. Het enige netwerkverkeer is de eenmalige download van de modelbestanden vanaf Hugging Face; je prompts en de antwoorden verlaten het apparaat nooit, en de chats staan in deze browser.

Welke variant van Qwen3 4B kan ik het beste kiezen?

Begin met q4f16_1 — dat is de kleinste download en draait het snelst. De f32-varianten zijn groter en gebruiken meer geheugen, maar werken op GPU's zonder ondersteuning voor 16-bits shaders. Varianten met 1k houden een korter gesprek vast in ruil voor minder geheugen.

Hoe lang kan een gesprek met Qwen3 4B worden?

Het contextvenster is 4k tokens. Langere gesprekken blijven werken — de oudste beurten vallen met een melding weg zodra het gesprek niet meer past.

Laat Qwen3 4B zijn redenering zien?

Qwen3 4B kan nadenken voordat het antwoordt. Zet de redeneermodus aan in de chatinstellingen; het denken verschijnt in een inklapbaar blok boven het antwoord en wordt nooit als onderdeel van het gesprek teruggestuurd.

Onder welke licentie is Qwen3 4B uitgebracht?

De gewichten vallen onder Apache 2.0, overgenomen van de modelkaart van Qwen/Qwen3-4B. Controleer de licentie zelf voordat je het commercieel gebruikt.

Andere modellen Eerst dezelfde familie, dan dezelfde grootte

Alle 65 modellen Open de chat

Cijfers afgelezen uit de WebLLM 0.2.84-catalogus en de modelkaart op 2026-09-03.

/ai/browser-based-ai-chat
1 tool selected
Runs locally·The model downloads once·Your input never leaves
Out0 B
Ready