Speech to Text: API Speech Recognition

Nahtlos in Ihre Gesprächswerkzeuge integriert: erstklassige Spracherkennung, entwickelt für Entwickler.

Word Error Rate< 5 %Präziseste Engine in Frankreich, nach LMF
Latenz< 600 msBei Live-Gesprächsstreams, unter realen Bedingungen
PreisNiedrigsterAm Markt, bei minutengenauer Abrechnung

Das Vertrauen führender Unternehmen, Integratoren und Forschungseinrichtungen

Language Model Factory

Express-Anpassung der Sprachmodelle

Mit unserer Language Model Factory (LMF) bleibt kein Fachvokabular unerkannt. Trainieren Sie individuelle Modelle in nur 15 Minuten und wählen Sie das Modell, das am besten zu Ihrem Anwendungsfall passt.

  • Ein produktionsreifes Modell in 15 Minuten
  • Fachjargon, Eigennamen, Branchenakronyme
  • Vortrainierte Vertikalmodelle sofort einsatzbereit
01

Vertikalmodelle

Vortrainiert auf branchenspezifischen Daten.

02

Jargon und Eigennamen

Vokabular, das zu Ihrem Unternehmen passt.

03

Akronyme

Automatische Erkennung und Auflösung.

04

Geschäftsausdrücke

Spezifisch für Ihre Prozesse und Anwendungsfälle.

Anonymisierung

Schutz und Schwärzung sensibler Daten

Automatische Echtzeit-Schwärzung sensibler Informationen gemäß Ihren Anwendungsfällen: personenbezogene Daten, Bank- und Gesundheitsdaten.

Agent Acme Corp: Guten Tag, Sie sind bei Acme Corp[Unternehmen]. Was kann ich heute für Sie tun?

Kunde: Guten Tag, ich rufe an, um meine persönlichen Daten zu aktualisieren.

Agent Acme Corp: Kein Problem, dabei helfe ich Ihnen gern. Können Sie mir bitte Ihren vollständigen Namen nennen?

Kunde: Ja, das ist Jean Persona[Vorname] [Nachname].

Agent Acme Corp: Danke, Jean[Vorname]. Und wie lautet Ihre neue Adresse?

Kunde: Sie lautet 123 Rue de l’Élysée, 75000 Paris[Adresse].

Agent Acme Corp: Sehr gut, notiert. Haben Sie auch eine neue Telefonnummer?

Kunde: Ja, die neue lautet 06 12 34 56 78[Telefon].

Agent Acme Corp: Perfekt. Eine letzte Frage: Haben sich Ihre Zahlungsdaten geändert?

Kunde: Ja, ich habe eine neue Bankkarte: 1234 5678 9101 1121, gültig bis 12/26, CVV 321[Bankkarte].

Agent Acme Corp: Danke, Jean[Vorname]. Ihre Daten sind aktuell!

Batch

Speech-to-Text-API für Audioaufzeichnungen

Laden Sie Ihre Telefongespräche einfach auf einen sicheren FTP-Server hoch und erhalten Sie Transkripte in wenigen Minuten, oder nutzen Sie unsere Konnektoren:

NICEGenesysAxialysOdigo
Verfügbare Sprachen

Französisch, Englisch, Spanisch, Deutsch, Italienisch, +5 weitere (Europa)

PYTHON SDK
# Sicherer FTP-Upload
import uhlive
client = uhlive.connect("api.uh.live")
# Batch-Transkription
job = client.transcribe_file(
    file="call_2026-04-28.wav",
    model="de-telephony-v3",
    redaction=True
)
# Ergebnis
transcript = job.result()
print(transcript.text)
Abbildung: Mehrsprachige Transkription für Menschen
Streaming · Live

Streaming-API für Menschen

Verbinden Sie Ihre Audiostreams direkt über WebSocket für Echtzeit-Mehrsprechertranskription, oder über Trunk SIP / SIP REC.

Verfügbare Sprachen

Französisch, Englisch, Spanisch und Deutsch

Streaming · Bot

Streaming-API für Bots

Streaming-API für IVR und Voicebots. Transkribieren Sie Ihre Live-Interaktionen mit unseren fortschrittlichen Lösungen.

Abbildung: Mehrsprachiger Voicebot
Unsere Protokolle
  • › MRCP v2
  • › WebSocket
Standardmäßig in jeder Interaktion

Sprachaktivitätserkennung, Sprachmodellauswahl, Grammatiken, Adresserkennung, Daten, Zahlen und boolesche Antworten.

Verfügbare Sprachen

Französisch, Englisch, Spanisch und Deutsch

WER < 5 %Präziseste Engine in Frankreich
100 MAnalysierte Anrufe pro Jahr
40 %Der Analysen in Echtzeit

Bereit, Ihre ersten Anrufe zu transkribieren?

Nutzen Sie die uh!ive Speech-to-Text-API. Einrichtung in wenigen Minuten.

Kostenlos testen