Xiaomi hat die neue Version der KI-Modelle MiMo V2.5 eingeführt, mit denen Text in Sprache und umgekehrt konvertiert werden kann

Xiaomi hat die neue Version der KI-Modelle MiMo V2.5 eingeführt, mit denen Text in Sprache und umgekehrt konvertiert werden kann

29 software

Xiaomi startet neue Sprachmodelle der künstlichen Intelligenz

Das Unternehmen Xiaomi stellte zwei Versionen seiner sprachbasierten KI-Modelle vor, die mit Text und Audio arbeiten:

Modell | Funktion | Schlüsselmerkmale
MiMo‑V2.5‑TTS | Text → Sprache | 3 Varianten, kostenlos für einen begrenzten Zeitraum in MiMo Studio; Einstellung von Geschwindigkeit, Tonhöhe und Emotionen; Möglichkeit, neue Stimmen anhand einer kurzen Phrase zu erstellen (VoiceDesign) und eine Stimme aus wenigen Beispielen zu klonen (VoiceClone).
MiMo‑V2.5‑ASR | Sprache → Text | Spracherkennung unter schwierigen Bedingungen, Unterstützung chinesischer Dialekte + Englisch; zweisprachige Dialoge und Songtexte (Stimmen im Hintergrund von Musik); funktioniert bei starkem Rauschen; automatische Interpunktion anhand der Intonation.

Wie man MiMo‑V2.5‑TTS nutzt
1. Basisvariante – wählt einen der voreingestellten Stimmen aus und ermöglicht die Anpassung von Geschwindigkeit, Tonhöhe und emotionalem Unterton.

2. VoiceDesign – gibt eine kurze Phrase ein, danach generiert das System einen neuen Stimmlaut.

3. VoiceClone – lädt mehrere Samples einer ausgewählten Stimme hoch; das Modell reproduziert sie unter Beibehaltung des Stils und der Anweisungen.

Um den gewünschten Klang zu erzielen, kann der Benutzer:
- Spezielle Tags zum Text hinzufügen;
- Die Stimme in einfacher natürlicher Sprache beschreiben (auf Chinesisch oder Englisch);
- Szenarien für virtuelle Auftritte erstellen, bei denen mehrere Stimmen gleichzeitig interagieren.

Eigenschaften von MiMo‑V2.5‑ASR
- Mehrsprachigkeit – Unterstützung mehrerer chinesischer Dialekte und Englisch.
- Songdekodierung – das Modell erkennt die Gesangsstimme auch bei vorhandener Hintergrundmusik.
- Rauschresistenz – genaue Erkennung unter starkem Außengeräusch.
- Interpunktion nach Intonation – fügt automatisch Satzzeichen ein, was die Notwendigkeit manueller Korrekturen reduziert.

Damit erweitert Xiaomi seine Möglichkeiten im Bereich Sprachtechnologien und bietet flexible Werkzeuge sowohl für die Erstellung synthetischer Sprache als auch für die präzise Erkennung gesprochener Informationen.

Kommentare (0)

Teile deine Meinung — bitte bleib höflich und beim Thema.

Noch keine Kommentare. Hinterlasse einen Kommentar und teile deine Meinung!

Um einen Kommentar zu hinterlassen, melde dich bitte an.

Zum Kommentieren anmelden