Zum Inhalt springen

KI-Agenten

Pipecat
im Test.

Pipecat ist ein Python-Baukasten von Daily für Sprach- und Multimodal-Agenten in Echtzeit, quelloffen unter BSD-2-Clause und mit über 13.000 Sternen auf GitHub. Version 1.7 vom 01.08.2026 verbindet Spracherkennung, Sprachmodell und Sprachausgabe zu einer durchgehenden Verarbeitungskette und lässt seit Version 1.3 mehrere solcher Ketten als Verbund zusammenarbeiten, mit Übergaben zwischen Fachagenten und Betrieb über mehrere Maschinen hinweg.

4,0 von 5

Stand 4. August 2026

Preismodell Freemium, Baukasten kostenlos (BSD-2-Clause), Pipecat Cloud ab 0,86 Cent je Agenten-Minute (0,01 USD), Anrufe aus dem Telefonnetz 1,55 Cent je Minute (0,018 USD)
Betriebsort beides möglich
DSGVO im Einzelfall zu prüfen
Quelloffen ja, BSD-2-Clause

Ein Sprach-Agent besteht aus 3 Bausteinen, die selten vom selben Anbieter kommen. Spracherkennung, Sprachmodell und Sprachausgabe haben eigene Schnittstellen und brauchen jeweils Zeit, und was der Anrufer am Telefon hört, ist die Summe daraus. Pipecat ist der Rahmen, der sie zusammenhält. Du steckst die Bausteine zu einer Verarbeitungskette zusammen, tauschst einzelne Stufen aus, ohne den Rest anzufassen, und bekommst Messwerkzeuge mit, die zeigen, wo die Zeit hingeht.

Wichtigste Funktionen

  • Austauschbare Bausteine für jede Stufe der Kette: Im Quelltext stecken 58 Anbieter-Anbindungen und 11 Übertragungswege, von Deepgram, AssemblyAI und Speechmatics über OpenAI, Anthropic, Google und Mistral bis zu ElevenLabs, Cartesia und Rime. Der Wechsel von einem Spracherkennungs-Dienst zum nächsten ist eine Zeile Code, die übrige Kette bleibt unverändert.
  • Agenten-Verbund seit Version 1.3: Seit dem 28.05.2026 ist jede Verarbeitungskette zugleich ein eigenständiger Agent, der mit anderen über einen gemeinsamen Nachrichtenbus spricht. So übergibt ein Gesprächsagent an einen Fachagenten, verteilt eine Frage parallel an mehrere Modelle oder lagert Arbeit über eine Warteschlange in Redis oder PostgreSQL auf eine zweite Maschine aus. Lauffähige Beispiele für Übergabe, parallele Beratung und Fernsteuerung liegen bei.
  • Strukturierte Dialoge im Hauptpaket: Pipecat Flows beschreibt Gesprächsabläufe mit Verzweigungen, etwa für Terminbuchung oder Bestellannahme. Seit Version 1.5 vom 04.07.2026 steckt es im Hauptpaket unter pipecat.flows, das getrennte Paket pipecat-ai-flows ist eingestellt und sein Repository archiviert. In bestehenden Projekten ändern sich die Import-Zeilen und sonst nichts.
  • Gemessene Verzögerungswerte je Dienst: Für jeden angebundenen Spracherkennungs-Dienst bringt der Baukasten einen gemessenen Wert dafür mit, wie lange es vom Ende einer Äußerung bis zum fertigen Transkript dauert. Deepgram und Soniox liegen bei 0,35 Sekunden, AssemblyAI bei 0,42, Speechmatics bei 0,74 und die Standard-Schnittstelle von OpenAI bei 2,01. Die Gesprächssteuerung rechnet damit, für die eigene Umgebung misst du den Wert mit dem Prüfwerkzeug des Projekts nach.
  • Gesprächsende-Erkennung ohne Netzverbindung: Smart Turn v3 entscheidet am Audiosignal, ob der Mensch fertig gesprochen hat, statt starr auf eine Pause zu warten. Das Modell läuft als Datei im ONNX-Format auf dem eigenen Prozessor und fragt dafür keinen Dienst an.
  • Client-SDKs bis auf den Mikrocontroller: Für die Gegenseite gibt es fertige Bibliotheken für JavaScript, React, React Native, Swift, Kotlin und C++, dazu eine Fassung für den ESP32. Weboberfläche, Smartphone-App und ein eingebautes Gerät sprechen damit denselben Agenten an.

Preise und Tarife

Der Baukasten kostet nichts, die BSD-2-Clause-Lizenz erlaubt die kommerzielle Nutzung ohne Auflagen, und auf eurer eigenen Hardware fallen nur Rechenleistung und die Rechnungen der Modell-Anbieter an. Daily vermietet den Betrieb unter dem Namen Pipecat Cloud und rechnet Rechenzeit je laufender Agenten-Minute ab. Das kleinste Profil mit einem halben Prozessorkern und 1 GB Arbeitsspeicher kostet 0,86 Cent je Minute (0,01 USD), die beiden nächsten Stufen 1,72 und 2,58 Cent (0,02 und 0,03 USD). Fest reservierte Kapazität beginnt bei 0,04 Cent je Minute (0,0005 USD).

Die Übertragung rechnet Daily getrennt ab. Ein Sprachgespräch zu zweit über den Browser-Standard WebRTC ist frei, mit Video kostet jede Teilnehmerminute 0,34 Cent (0,004 USD). Anrufe aus dem Telefonnetz liegen bei 1,55 Cent je Minute (0,018 USD), über die Telefonie-Schnittstelle SIP zwischen 0,26 und 1,72 Cent (0,003 bis 0,02 USD).

Die Rauschunterdrückung Krisp VIVA ist für die ersten 10.000 Minuten frei und kostet danach 0,13 Cent je Minute (0,0015 USD), eine reine Audio-Aufzeichnung 0,43 Cent (0,005 USD). Das Freikontingent von 10.000 Minuten im Monat, mit dem Daily wirbt, gehört zum Video-SDK und nicht zu Pipecat Cloud.

Spracherkennung, Sprachmodell und Sprachausgabe stellt jeder Anbieter selbst in Rechnung, diese Posten stehen in keiner Preisliste von Daily. Daily rechnet in US-Dollar und ohne Steuer ab, die deutsche Umsatzsteuer fällt zusätzlich an.

Für wen ist Pipecat geeignet?

  • Entwicklerteams mit einem eigenen Sprachprojekt: Wer einen Telefon-Bot für die Anrufannahme oder eine Sprachbedienung für eine bestehende Anwendung bauen will, bekommt Verarbeitungskette, Übertragung und Anbieter-Anbindungen aus einem Paket und behält die Kontrolle über jeden einzelnen Baustein.
  • Unternehmen mit strengen Datenschutzvorgaben: Whisper für die Spracherkennung, ein lokales Sprachmodell und Piper oder Kokoro für die Sprachausgabe arbeiten im eigenen Unternehmen, ebenso Smart Turn für die Gesprächsende-Erkennung. Ein vollständiger Sprach-Agent ohne Konto bei einem Cloud-Anbieter ist damit möglich, hängt dann aber an passender Grafikkarten-Hardware.
  • Teams, die von einer geschlossenen Sprach-Plattform weg wollen: Wer mit Vapi oder Retell AI angefangen hat und an Preisen, Modellauswahl oder Datenschutzfragen hängenbleibt, findet in Pipecat denselben Aufbau in eigener Hand, zahlt das aber mit deutlich mehr Eigenbau.

DSGVO und Datenschutz

Pipecat ist eine Bibliothek auf eurer eigenen Hardware. Jede Verbindung entsteht erst durch die Dienste, die du einträgst. Die mitgelieferten Beispiele unter examples/getting-started tragen ab Werk Deepgram für die Spracherkennung, Cartesia für die Sprachausgabe und OpenAI als Sprachmodell ein, alle 3 US-Anbieter. Wer den Beispielen folgt, schickt Gesprächsaudio in die USA.

Ein rein europäischer Aufbau ist machbar und kostet Handarbeit. Whisper, Piper oder Kokoro und ein lokales Sprachmodell arbeiten auf eurer eigenen Hardware, ebenso Smart Turn v3. Für gehostete Dienste stehen mit Gladia aus Paris und Mistral 2 französische Adressen für Spracherkennung und Sprachmodell in der Anbieterliste.

Pipecat Cloud gehört Daily, Co. mit Sitz in San Francisco. Seit der allgemeinen Freigabe am 08.01.2026 läuft ein Agent wahlweise in 4 Regionen, darunter eu-central in Frankfurt, voreingestellt ist us-west in Oregon. Den Auftragsverarbeitungsvertrag legt Daily in der Fassung vom 01.05.2025 öffentlich als PDF ab.

Abschnitt 6.1 des Vertrags hält fest, dass die Hauptverarbeitung in den Vereinigten Staaten stattfindet, für die Übermittlung beruft sich Daily zuerst auf das EU-US Data Privacy Framework und ersatzweise auf die Standardvertragsklauseln nach irischem Recht. Die Anlagen, die diese Klauseln verlangen, also die Liste der Unterauftragnehmer und die technischen Maßnahmen, führt der Vertrag als Anhänge B und C, im veröffentlichten Dokument fehlen beide. Daily ist nach SOC 2 Type 2 zertifiziert und sagt zu, Audio und Video außerhalb der dokumentierten Aufzeichnungs-Schnittstellen nicht zu speichern.

Wir führen den Eintrag als nicht DSGVO-konform. Für Sprachaufnahmen und personenbezogene Daten bleibt der Betrieb auf eurer eigenen Hardware mit lokalen Modellen der belastbare Weg. Vor dem Einsatz von Pipecat Cloud wählst du mindestens die Frankfurter Region fest aus und holst die vollständigen Vertragsanlagen beim Anbieter ein.

Alternativen zu Pipecat

  • LiveKit: Ebenfalls quelloffen und auf Sprach-Agenten ausgelegt, unter Apache 2.0. LiveKit bringt Telefonie, einen Agent Builder im Browser und mehr Betriebswerkzeuge mit, ist dafür stärker auf die eigene Cloud hin gebaut. Pipecat kann LiveKit als Übertragungsweg nutzen, beide arbeiten also auch zusammen.
  • Vapi: Fertige Plattform für Sprach-Agenten mit geschlossenem Kern, ab 4,3 Cent je Minute (0,05 USD) für die Plattform allein, Modelle und Telefonie kommen dazu. Der Einstieg geht schneller als mit Pipecat, dafür fehlt der Betrieb auf eurer eigenen Hardware.
  • Retell AI: Telefon-Agenten entstehen hier in einer Oberfläche zum Zusammenklicken, ganz ohne Programmierung. Der Einstieg dauert Stunden statt Tage, dafür bleibt der ganze Aufbau in der Hand des Anbieters.

Wofür Pipecat taugt

  • Quelloffen unter BSD-2-Clause, Betrieb auf eurer eigenen Hardware ohne Lizenzkosten
  • 58 Anbieter-Anbindungen und 11 Übertragungswege, einzeln austauschbar ohne Umbau der Kette
  • Gemessene Verzögerungswerte für jeden Spracherkennungs-Dienst liegen dem Baukasten bei
  • Spracherkennung, Sprachmodell, Sprachausgabe und Gesprächsende-Erkennung gibt es auch als lokale Variante
  • Client-SDKs für JavaScript, React, React Native, Swift, Kotlin, C++ und den ESP32

Wo es hakt

  • Python-Kenntnisse nötig, es gibt keine grafische Oberfläche zum Zusammenklicken
  • Pipecat Cloud gehört dem US-Anbieter Daily, die Frankfurter Region muss ausdrücklich gewählt werden
  • Die mitgelieferten Beispiele tragen ab Werk Deepgram, Cartesia und OpenAI ein
  • Modellkosten für Spracherkennung, Sprachmodell und Sprachausgabe rechnet jeder Anbieter einzeln ab
  • Schnelle Versionsfolge, Version 1.5 hat die Import-Pfade für strukturierte Dialoge verschoben

Wofür es eingesetzt wird

Sprach-Agenten für den Kundenservice · Telefon-Bots mit festen Gesprächsabläufen · Sprachbedienung in eigenen Anwendungen · Agenten-Verbund mit Übergabe zwischen Fachagenten