Sprachsynthese — englisch Text-to-Speech (TTS) — ist die Technologie, die geschriebenen Text in gesprochene Sprache umwandelt. Sie bildet das „Sprachrohr“ jedes KI-Telefonassistenten: Die vom Sprachmodell formulierte Antwort wird hörbar gemacht.
Moderne neuronale TTS-Stimmen sind von menschlichen Sprechern kaum noch zu unterscheiden: Sie betonen natürlich, machen Sprechpausen an den richtigen Stellen und können auf Tonalität und Branche abgestimmt werden — von der freundlichen Praxisstimme bis zum sachlichen Service-Ton. Für flüssige Telefonate wird die Sprache im Streaming erzeugt, um die Latenz gering zu halten.
Zusammen mit Spracherkennung und Sprachmodell bildet die Sprachsynthese die technische Dreierkette der Voice AI. Die Qualität der Stimme prägt maßgeblich, wie professionell ein Unternehmen am Telefon wahrgenommen wird.