Build local voice agents with open-source models
Bu repo, açık kaynaklı modeller kullanarak yerel sesli asistanlar oluşturmaya imkan veren, düşük gecikmeli ve tamamen modüler bir sesli asistan boru hattı sağlar. Boru hattı, Voice Activity Detection (VAD), Speech to Text (STT), Language Model (LLM) ve Text to Speech (TTS) bileşenlerinden oluşur ve OpenAI Realtime uyumlu WebSocket API'si aracılığıyla erişilebilir. Her bileşen değiştirilebilir ve LLM bileşeni, OpenAI uyumlu protokolleri konuşur, böylece barındırılan bir sağlayıcıya, Hugging Face Inference Providers'a veya kendi donanımınızda bir vLLM veya llama.cpp sunucusuna işaret edebilirsiniz.
🎯 Hedef Kitle: Python geliştiricileri, özellikle sesli asistanlar ve doğal dil işleme uygulamaları geliştirenler
Bir sesli asistan uygulaması geliştiren bir yazılımcı, bu repo'yu kullanarak yerel bir sesli asistan oluşturabilir. Örneğin, bir kullanıcı bir sesli komut vererek asistanı çalıştırabilir ve asistan, kullanıcının sesini algılar, metne çevirir, bir yanıt üretir ve yanıtı sesli olarak geri gönderir.