DeepL AI Labs

La integración de Mixhalo en la plataforma DeepL no solo ha sumado nuevas funciones de traducción de voz en tiempo real a gran escala. Está transformando el alcance de lo que podemos conseguir con DeepL Voice. Cuando puedes controlar la velocidad de transmisión del audio y superar esa limitación, lo que antes era imposible puede convertirse rápidamente en un plan de desarrollo de producto.

Uniendo fuerzas, nuestros equipos están creando una capa de idioma hablado disponible para todo tipo de experiencias e interacciones. A través de la API de DeepL Voice, están impulsando a innovadores de todo el mundo a integrar traducciones de voz multilingües en tiempo real en todo tipo de experiencias de clientes y audiencias.

Por ejemplo, para captar toda la emoción de un comentarista de fútbol al describir un gol; ofrecer experiencias de voz accesibles al instante que evitan que los hablantes no nativos se sientan aislados en entornos sanitarios; diseñar cuidadosamente las experiencias de atención al cliente por teléfono para eliminar el estrés y la frustración; u organizar eventos multilingües en directo con traducción de voz mucho más rápida que la de intérpretes humanos.

Los pilares fundamentales del audio multilingüe en tiempo real

Vik Singh, cofundador de Mixhalo, y Leo Doin, director de DeepL Voice, han afrontado el reto de reducir la latencia en el audio multilingüe desde dos enfoques complementarios. Mixhalo surgió en la industria musical, transmitiendo el sonido de un baterista tocando la caja en un estadio lleno de miles de fans más rápido de lo que las propias ondas sonoras tardarían en llegar físicamente a sus oídos. Los modelos de lenguaje de DeepL son capaces de gestionar la traducción de audio en tiempo real de principio a fin, sin necesidad de pasar por diferentes API, lo que reduce la latencia de la traducción al mínimo posible.

Diseño de experiencias de audio traducido que conecten a nivel emocional

Procesadores en segundo plano (daemons) personalizados, protocolos de red a medida, detección de errores en tiempo real y motores de audio optimizados para acelerar la reproducción: todas estas innovaciones técnicas proporcionan el tiempo y el espacio para diseñar una experiencia de traducción de audio en directo mucho más eficiente. Si a esto le sumamos la IA lingüística, esa optimización puede producirse al instante, gracias a modelos que identifican el momento preciso para traducir y la forma de sincronizar idiomas con estructuras gramaticales distintas.

Lograr una experiencia de traducción en directo ideal no consiste en reproducir el audio traducido al instante. Se trata de ajustar la reproducción de forma inteligente mediante una IA que entiende a la perfección cómo funciona cada idioma.

Todo esto se materializa en la traducción de voz a voz en tiempo real para centros de atención telefónica. Es una de las aplicaciones más potentes de la API de DeepL Voice. Vik y el equipo de Mixhalo la están desarrollando para garantizar que los usuarios siempre sientan una conexión real con los agentes de atención al cliente y que la traducción no comprometa la percepción de que se les está escuchando de verdad.

Eventos en directo traducidos a una velocidad inalcanzable para el ser humano

Quizá el mayor beneficio de integrar DeepL y Mixhalo se palpe en los eventos en directo: en conferencias con miles de asistentes y cientos de ponentes, todos ellos compartiendo ideas y siguiendo las sesiones en su idioma preferido a través del audio que se transmite a sus dispositivos en todo el recinto.

Es en situaciones como esta donde el valor de una capa de voz multilingüe en tiempo real se vuelve realmente evidente. El audio de latencia ultrabaja permite a los asistentes escuchar al ponente que elijan mientras se desplazan por el recinto. Pueden seguir las sesiones aunque no se encuentren físicamente en la sala. Gracias a la traducción de voz en directo, cada asistente elige el idioma que mejor entiende, lo que le permite captar toda la emoción y la expresión implícita. También permite que cualquier ponente exponga sus ideas en el idioma en el que las concibe.

Sin embargo, quizá lo más llamativo sea la velocidad a la que ocurre todo esto. Estamos desarrollando nuevas formas innovadoras para que los modelos de IA de DeepL capten y procesen el contexto de las conferencias, mesas redondas y otras sesiones con ponentes de forma muy similar a como se preparan de antemano los intérpretes profesionales. Al combinar esto con la mayor velocidad de procesamiento de la IA, podemos generar traducciones en directo de un idioma a otro mucho más rápido de lo que son capaces los traductores humanos. Esto va a cambiar por completo las expectativas sobre cómo debería ser la experiencia con contenidos multilingües. Va a parecer futurista, casi mágico. Y empezará a transformar las expectativas sobre cómo funciona la comunicación oral.

Descubre más sobre Mixhalo y los planes de DeepL en esta entrada del blog.

Compartir

No te pierdas nada

Echa un vistazo a nuestras últimas innovaciones en IA.