
KI-Router und LLM-Gateway, bei dem die API-Schlüssel auf dem Smartphone bleiben
KI & LLM · Android
Lokale Sprachmodelle auf Android und eine OpenAI-kompatible API im eigenen WLAN
Ollama Local AI macht ein Android-Smartphone zu einem lokalen KI-Server. Die App führt quantisierte GGUF-Modelle über eine eingebettete llama.cpp-Engine direkt auf dem Gerät aus und stellt OpenAI-kompatible Endpunkte (/v1/chat/completions, /v1/models, /health) für andere Rechner im selben WLAN bereit. So können Entwicklungsumgebungen wie Cursor, VS Code oder Windsurf das Smartphone als Modell-Backend nutzen.
Technisch ist die App zugleich ein Gateway für mehrere Anbieter: Anfragen gehen wahlweise an das Modell auf dem Gerät, an einen selbst betriebenen Ollama- oder llama.cpp-Server oder an eine Cloud-API wie OpenAI, Anthropic, NVIDIA NIM oder Hugging Face. Zugangsdaten bleiben auf dem Gerät und sind hardwaregestützt mit AES-256 verschlüsselt. Cloud-Anfragen laufen direkt vom Smartphone zum Anbieter, ohne Zwischenserver.
Nicht für Modelle auf dem Gerät. Ist ein GGUF-Modell einmal heruntergeladen, läuft die Berechnung lokal auf dem Smartphone. Internet ist nur nötig, wenn Anfragen an einen Cloud-Anbieter weitergeleitet werden.
Jedes Programm, das die OpenAI-API spricht und eine eigene Basis-URL erlaubt, zum Beispiel Cursor, VS-Code-Erweiterungen wie Continue, Cline oder Roo Code sowie Windsurf.

KI-Router und LLM-Gateway, bei dem die API-Schlüssel auf dem Smartphone bleiben

Privater Offline-KI-Chat auf Android mit GGUF-Modellen und llama.cpp

Andere Android-Geräte per WLAN steuern: Shell, Bildschirm spiegeln, Screenshots
App-Entwicklung
Ich entwickle Android-Apps von der ersten Idee bis zur Veröffentlichung bei Google Play. Beschreiben Sie kurz, was Ihre App können soll.