Google ha lanzado VideoPoet, un innovador modelo de lenguaje grande (LLM) diseñado para la generación de videos. Este LLM multimodal tiene la capacidad de realizar diversas tareas, incluyendo la conversión de texto a video, imagen a video, estilización de video, pintura y pintura de video, así como la conversión de video a audio.
El nuevo modelo de Google, VideoPoet, se presenta como un LLM robusto capaz de procesar entradas multimodales como texto, imágenes y audio para generar videos. Destaca por su implementación de una «arquitectura de solo descodificador», permitiéndole generar contenido para tareas no específicamente entrenadas, según informa Indianexpress.
La formación de VideoPoet sigue dos pasos similares a otros LLM: una fase de preentrenamiento y otra de adaptación a tareas específicas. Este LLM previamente capacitado sirve como marco base que puede ser personalizado para diversas tareas de generación de videos.
En comparación con los modelos de video convencionales, VideoPoet se diferencia al combinar múltiples capacidades de generación de video en un solo modelo de lenguaje unificado. Mientras otros modelos utilizan componentes entrenados por separado, VideoPoet integra todo en un único LLM.
El modelo se destaca en la conversión de texto a video, imagen a video, pintura y pintura de video, estilización de video y generación de video a audio. Su enfoque autorregresivo implica la generación de resultados basados en lo creado anteriormente, y ha sido entrenado en video, audio, imagen y texto utilizando tokenizadores para procesar la entrada.
En el ámbito de la inteligencia artificial, la tokenización es esencial para el procesamiento del lenguaje natural, dividiendo el texto de entrada en unidades más pequeñas o tokens, como palabras o subpalabras.
Científicos involucrados en el desarrollo de VideoPoet señalan que los resultados evidencian el prometedor potencial de los LLM en la generación de videos, creyendo que su marco podría admitir el formato «cualquiera a cualquiera» en el futuro.
Además, VideoPoet presenta características interesantes como la capacidad para crear cortometrajes combinando diversos videoclips. Los investigadores solicitaron a Google Bard que redactara un guión breve con indicaciones, generando un video a partir de estas indicaciones y ensamblándolo para crear un cortometraje.
Este modelo también puede modificar videos existentes, alterando el movimiento de objetos en ellos. Un ejemplo ilustrativo sería la capacidad de hacer que la Mona Lisa bostece, demostrando la versatilidad y creatividad de VideoPoet en la manipulación de contenido visual.
