OpenAI hat GPT-Realtime-2 und zwei neue Sprachvarianten vorgestellt, die ausschließlich über die API verfügbar sind
OpenAI erweitert die Möglichkeiten der Sprach-API
Das Unternehmen kündigte den Start neuer Funktionen für seine API an, mit denen Entwickler „lebendigere“ Sprachapplikationen erstellen können: sie werden in der Lage sein, mit Nutzern zu sprechen, Sprache in Text zu transkribieren und Gespräche live zu übersetzen.
Neue Realtime‑Modelle
Über die Realtime-Schnittstelle sind jetzt drei Modelle verfügbar:
ModellZweckSchlüsselmerkmaleGPT‑Realtime‑2Sprachinteraktion in EchtzeitAnalyse von Anfragen, Aufruf von Tools, Bearbeitung von Korrekturen und nahtloser Dialogfortsetzung. Basierend auf der GPT‑5-Logik kann es komplexere Aufgaben verarbeiten als GPT‑Realtime‑1.5.GPT‑Realtime‑TranslateLive-ÜbersetzungUnterstützt 70+ Eingabesprachen und 13 Ausgabesprachen. Bewahrt die Bedeutung auch bei Kontextwechseln, regionalen Akzenten oder fachspezifischer Terminologie.GPT‑Realtime‑WhisperSprachtranskriptionStreaming-Modell mit niedriger Latenz, das Audio nahezu sofort in Text umwandelt.
> „Unsere neuen Modelle übersetzen Audio in Echtzeit von einfachen Dialogen zu Sprachschnittstellen, die wirklich funktionieren: hören, nachdenken, übersetzen, transkribieren und Aktionen ergreifen, während sich das Gespräch entwickelt“, sagte das Unternehmen.
Kosten
ModellPreisGPT‑Realtime‑2$32 pro 1 Mio. Eingangs-Audiotoken, $0,40 pro 1 Mio. gecachte Token und $64 pro 1 Mio. Ausgangs-AudiotokenGPT‑Realtime‑Translate$0,034 pro MinuteGPT‑Realtime‑Whisper$0,017 pro Minute
Wie man es ausprobiert
Entwickler können die neuen Modelle auf der Online-Plattform OpenAI Playground testen und sofort sehen, wie sie in Echtzeit funktionieren.
Kommentare (0)
Teile deine Meinung — bitte bleib höflich und beim Thema.
Zum Kommentieren anmelden