Local AI Runtime
Foundry Local
Fork von Microsoft Foundry Local: On-Device-AI-Runtime mit kuratiertem Modellkatalog, automatischer Hardware-Beschleunigung und OpenAI-kompatibler API.
ExperimentalOpen in signal graph →Overview
Foundry Local ist Microsofts End-to-End-Loesung fuer AI-Anwendungen, die vollstaendig auf dem Geraet der Nutzer laufen. Die Runtime uebernimmt Modellbeschaffung, Hardware-Beschleunigung und Inferenz ueber ONNX Runtime — Nutzdaten verlassen das Geraet nie, Antworten starten ohne Netzwerklatenz.
Fuer das ARV-Setup ist vor allem der Whisper-Pfad interessant: lokale Speech-to-Text-Transkription laesst sich direkt in Broadcast-Workflows einbauen, ohne Audiodaten in eine Cloud zu schicken.
Motivation
Modelle direkt auf dem Endgeraet ausfuehren: keine Tokenkosten, keine API-Keys, keine Cloud-Abhaengigkeit — relevant fuer Live-Setups, in denen Netzlatenz keine Option ist.
Problem
On-Device-Inferenz scheitert oft an Modellbeschaffung, Hardware-Erkennung und Lifecycle-Management. Foundry Local kapselt genau diese drei Probleme in einer rund 20 MB grossen Runtime.
Features
- Kuratierter Modellkatalog (GPT OSS, Qwen, DeepSeek, Mistral, Phi, Whisper)
- Automatische Auswahl von NPU, GPU oder CPU als Execution Provider
- Native SDKs fuer C#, JavaScript, Python und Rust
- OpenAI-kompatible API inklusive Responses-Format
- Audio-Transkription via Whisper-Modelle, auch streamend
Current state
Fork auf Stand von microsoft/foundry-local main; genutzt zur Evaluation lokaler Inferenz fuer ARV-Werkzeuge.
Architecture
Leichtgewichtige Runtime auf Basis von ONNX Runtime; Modelle werden versioniert heruntergeladen, lokal gecacht und in-process ausgefuehrt. Optionaler lokaler Webserver fuer Mehrprozess-Szenarien.
Tech stack
Known limitations
- Fuer Single-User-Clients gedacht, nicht als Server-Inferenz-Stack
- Modellkatalog bewusst kuratiert statt vollstaendig