AI Assistant Research
Always-On AI Assistant
Fork des Always-On-Assistant-Patterns von disler: sprachgesteuerter Engineering-Assistent mit DeepSeek V3, RealtimeSTT und ElevenLabs.
ExperimentalOpen in signal graph →Overview
Das Repository demonstriert ein vollstaendiges Always-On-Muster: Der Assistent "Ada" wird per Stimme geweckt, versteht gesprochene Auftraege, generiert daraus Typer-CLI-Kommandos und haelt seinen Arbeitsstand in einem Scratchpad fest.
Interessant ist die klare Rollenaufteilung in der Assistenten-Konfiguration: Gehirn, Job-Prompt, aktives Gedaechtnis, Ohren und Mund sind einzeln konfigurierbar — ein Muster, das sich auf jede Assistenz-Architektur uebertragen laesst.
Motivation
Ein Assistent, der permanent zuhoert und gesprochene Befehle in ausfuehrbare CLI-Kommandos uebersetzt — als Blaupause fuer sprachgesteuerte Studio-Workflows.
Problem
Haende sind im Studio oft belegt. Das Pattern koppelt lokales Speech-to-Text an ein LLM, das Typer-Kommandos generiert und in einem Scratchpad dokumentiert.
Features
- Awaken-Modus: Assistent reagiert auf Zuruf und fuehrt CLI-Kommandos aus
- Scratchpad als aktives Arbeitsgedaechtnis zwischen Mensch und Assistent
- Austauschbares Gehirn: DeepSeek V3 remote oder phi4 lokal via Ollama
- RealtimeSTT fuer lokale Spracherkennung, ElevenLabs fuer Sprachausgabe
Current state
Fork von disler/always-on-ai-assistant auf Upstream-Stand; dient als Architektur-Referenz fuer sprachgesteuerte ARV-Tools.
Architecture
Python-Anwendung mit uv-Toolchain: RealtimeSTT als Ohr, LLM als Gehirn, Typer-Kommandodatei als Faehigkeitenkatalog, ElevenLabs oder lokale TTS als Stimme.
Tech stack
Known limitations
- Benoetigt API-Keys fuer DeepSeek und ElevenLabs im Remote-Betrieb
- Kommandoausfuehrung erfordert bewusstes Sicherheits-Design