最近在 GitHub 上注意到一個蠻實用的開源專案 FluidVoice 。如果你自己做過語音對話機器人,應該很清楚目前的痛點:從「錄音、轉文字、送給 LLM 思考、再把文字轉成語音」這一整套流程走完,中間往往要停頓兩三秒以上。對話只要一出現這種空檔,聽起來就很像在跟十年前的客服系統講話。FluidVoice 就是專門來解決這個延遲問題的。 FluidVoice 在做什麼? 簡單來說,FluidVoice 整合了流式傳輸(Streaming)的語音識別(STT)與語音合成(TTS)機制,縮短從輸入到輸出的反應時間。它讓 AI 可以在還沒完全生成整段文字前,就開始同步把語音串流播放出來,達到接近真人對話的即時感。 簡單上手教學 如果你想在本地環境測試,可以參考以下步驟: 1. 複製專案庫 先將專案抓到本地端: git clone https://github.com/altic-dev/FluidVoice.git cd FluidVoice 2. 安裝依賴套件 建議在 Python 虛擬環境中執行: pip install -r requirements.txt 3. 設定環境變數與 API Key 在專案根目錄建立 .env 檔案,填入你需要的 API 金鑰(例如 OpenAI 或相容的 TTS/STT 服務金鑰): OPENAI_API_KEY=your_api_key_here 4. 啟動服務 執行主程式即可開始體驗即時語音對話: python main.py 結語 雖然現在不少大廠都有推出原生語音模型,但對於想掌控資料隱私、或是需要彈性更換背後 LLM / TTS 模型架構的開發者來說,像 FluidVoice 這種開源模組依然相當有價值。如果你正打算幫自己的專案加上語音對話功能,不妨clone下來玩玩看。