
Lokale Sprachmodelle auf Android und eine OpenAI-kompatible API im eigenen WLAN
KI & LLM · Android
Privater Offline-KI-Chat auf Android mit GGUF-Modellen und llama.cpp
Llama.cpp Edge Gallery führt Sprachmodelle direkt auf einem Android-Smartphone aus. Sie laden ein passendes GGUF-Modell herunter, laden es einmal und chatten lokal mit CPU-Inferenz. Prompts und Antworten bleiben in der App und werden nicht an einen Cloud-Dienst geschickt.
Große Sprachmodelle auf dem Smartphone sind vor allem eine Frage von Arbeitsspeicher und Wärme, darauf ist die App ausgelegt: Hinweise zum RAM helfen bei der Wahl von Modellgröße und Quantisierung, die Thread-Steuerung wägt Tempo gegen Akku und Temperatur ab, und ein Benchmark vergleicht Tokens pro Sekunde über Modelle und Quantisierungen. Antworten erscheinen Token für Token, Modelle lassen sich als Favoriten speichern und wechseln.
Ja, sobald ein Modell heruntergeladen ist. Internet wird nur für den Download der Modelle gebraucht.
Die App zeigt an, welche Modellgrößen und Quantisierungen zum Arbeitsspeicher Ihres Geräts passen. Die Geschwindigkeit hängt außerdem vom Prozessor und von der Temperatur des Geräts ab.

Lokale Sprachmodelle auf Android und eine OpenAI-kompatible API im eigenen WLAN

KI-Router und LLM-Gateway, bei dem die API-Schlüssel auf dem Smartphone bleiben

Ladealarm bei 80, 85, 90 oder 100 Prozent, dazu Akkutemperatur und Ladezyklen
App-Entwicklung
Ich entwickle Android-Apps von der ersten Idee bis zur Veröffentlichung bei Google Play. Beschreiben Sie kurz, was Ihre App können soll.