Skip to the tool workspace
Browser 106
no file limit
TinyLlama Draait op je GPU

TinyLlama 1.1B Chat v1.0 in je browser draaien

TinyLlama 1.1B Chat v1.0 is een 1.1B TinyLlama-model. In de browser downloadt het 590 MB en heeft het ongeveer 697 MB GPU-geheugen nodig.

modelTinyLlama-1.1B-Chat-v1.0-q4f16_1-MLC engineWebLLM 0.2.84 netwerkhet model wordt één keer gedownload
Download590 MB
GPU-geheugen697 MB
Context2k tokens
Parameters1.1B
Varianten4

TinyLlama 1.1B Chat v1.0 in de browser gebruiken Alle modellen Eén keer downloaden · daarna offline

Open deze pagina in een browser met JavaScript om te controleren of TinyLlama 1.1B Chat v1.0 op dit apparaat past. Het heeft ongeveer 697 MB GPU-geheugen en een download van 590 MB nodig.
Specificaties Overgenomen van de modelkaart
Familie
TinyLlama
Uitgegeven door
TinyLlama
Parameters
1.1B
Kwantisatie
q4f16_1 · 4-bit
Download
590 MB · 24 bestanden
GPU-geheugen
697 MB
Contextvenster
2k tokens
Redeneren
Licentie
Apache 2.0
Goed in
Chat
Varianten Dezelfde gewichten, andere precisie
# Variant Download GPU-geheugen Context Toelichting
01 q4f16_1 590 MB 697 MB 2k tokens 4-bits gewichten, f16 · heeft f16-shaders nodig Aanbevolen
02 q4f16_1 590 MB 675 MB 1k tokens 4-bits gewichten, f16 · korte context, minder geheugen · heeft f16-shaders nodig
03 q4f32_1 656 MB 840 MB 2k tokens 4-bits gewichten, f32
04 q4f32_1 656 MB 796 MB 1k tokens 4-bits gewichten, f32 · korte context, minder geheugen
Zo draai je het
01 Open de chat De knop hierboven opent TinyLlama 1.1B Chat v1.0 in de AI-chat in de browser, met het model al geselecteerd.
02 Eén keer downloaden 590 MB komt binnen vanaf Hugging Face en blijft in de cache van je browser. Je kunt alvast typen tijdens het downloaden.
03 Privé chatten Het model draait op je GPU. Niets van wat je typt wordt geüpload, en het blijft offline werken.
Vragen
Hoe groot is de download van TinyLlama 1.1B Chat v1.0?

590 MB voor de q4f16_1-variant, verdeeld over 24 bestanden. Het wordt één keer gedownload en blijft in de cache van je browser, zodat elk later bezoek meteen begint en offline werkt.

Wat heeft mijn apparaat nodig om TinyLlama 1.1B Chat v1.0 te draaien?

Een browser met WebGPU — een recente Chrome, Edge, Firefox of Safari — en ongeveer 697 MB GPU-geheugen. Het hulpmiddel controleert je GPU, geheugen en vrije ruimte en zegt of TinyLlama 1.1B Chat v1.0 past voordat er iets wordt gedownload.

Wordt er iets van wat ik typ naar een server gestuurd?

Nee. TinyLlama 1.1B Chat v1.0 draait op je eigen GPU in het browsertabblad. Het enige netwerkverkeer is de eenmalige download van de modelbestanden vanaf Hugging Face; je prompts en de antwoorden verlaten het apparaat nooit, en de chats staan in deze browser.

Welke variant van TinyLlama 1.1B Chat v1.0 kan ik het beste kiezen?

Begin met q4f16_1 — dat is de kleinste download en draait het snelst. De f32-varianten zijn groter en gebruiken meer geheugen, maar werken op GPU's zonder ondersteuning voor 16-bits shaders. Varianten met 1k houden een korter gesprek vast in ruil voor minder geheugen.

Hoe lang kan een gesprek met TinyLlama 1.1B Chat v1.0 worden?

Het contextvenster is 2k tokens. Langere gesprekken blijven werken — de oudste beurten vallen met een melding weg zodra het gesprek niet meer past.

Onder welke licentie is TinyLlama 1.1B Chat v1.0 uitgebracht?

De gewichten vallen onder Apache 2.0, overgenomen van de modelkaart van TinyLlama/TinyLlama-1.1B-Chat-v1.0. Controleer de licentie zelf voordat je het commercieel gebruikt.

Andere modellen Eerst dezelfde familie, dan dezelfde grootte

Alle 65 modellen Open de chat

Cijfers afgelezen uit de WebLLM 0.2.84-catalogus en de modelkaart op 2026-09-03.

/ai/browser-based-ai-chat
1 tool selected
Runs locally·The model downloads once·Your input never leaves
Out0 B
Ready