IA y modelos
Stability AI lanza Stable Audio 3.0 para la generación de música más larga
Stability AI lanzó Stable Audio 3.0, una nueva familia de modelos capaz de generar composiciones musicales de calidad profesional de más de seis minutos utilizando datos con licencia completa.
Stability AI está lanzando una nueva familia de modelos de audio llamada Stability Audio 3.0. Según la empresa, el modelo principal de esta familia puede generar música de calidad profesional de más de seis minutos de duración. Tanto el modelo mediano como el grande de este lanzamiento pueden crear composiciones completas de 6 minutos y 20 segundos que mantienen la estructura musical y el tono melódico. Esta capacidad representa un aumento significativo en la duración en comparación con Stable Audio 2.0, que se lanzó en 2024.
La empresa está lanzando cuatro modelos distintos bajo la nueva familia:
- Small SFX: 459 millones de parámetros, adecuado para la generación de sonido y música en el dispositivo de hasta dos minutos.
- Small: 459 millones de parámetros, también adecuado para la generación de sonido y música en el dispositivo de hasta dos minutos.
- Medium: 1400 millones de parámetros, capaz de generar composiciones completas de 6 minutos y 20 segundos.
- Large: 2700 millones de parámetros, también capaz de generar composiciones completas de 6 minutos y 20 segundos.
Stability AI está poniendo a disposición los modelos Small SFX, Small y Medium con pesos abiertos (open weights), lo que significa que los modelos están disponibles para uso y modificación pública. Esta es una mejora respecto a Stable Audio Open, lanzado en 2024, que permitía la generación de música de hasta 47 segundos.
En contraste, el modelo Large solo está disponible a través de la interfaz de programación de aplicaciones (API) y servicios de pago de alojamiento propio. Además, las empresas con más de USD 1 millón en ingresos necesitarían obtener una licencia empresarial para utilizar los modelos.
El lanzamiento se produce mientras diversas empresas, incluidas Google y ElevenLabs, lanzan modelos y herramientas para la generación de música. Sin embargo, la supervivencia a largo plazo de estos servicios podría depender en gran medida de las licencias de datos y las asociaciones con sellos discográficos, como lo destacan las continuas batallas judiciales que involucran a los competidores Suno y Udio. Para abordar estos desafíos, Stability AI declaró que su último conjunto de modelos de audio está construido sobre datos con licencia completa. Esto sigue a los acuerdos que la empresa firmó el año pasado con Warner Music Group y Universal Music Group para desarrollar modelos y herramientas de creación musical.
La empresa emergente también está desarrollando un nuevo conjunto de productos para músicos profesionales. Para liderar esta oferta de música profesional, Stability AI ha contratado a Ethan Kaplan, ex director digital de Universal Audio y Fender. Esta contratación refleja una tendencia más amplia de empresas de inteligencia artificial que reclutan ejecutivos de la industria musical para fortalecer sus posiciones. Por ejemplo, Suno contrató recientemente a Jeremy Sirota, ex director ejecutivo de Merlin (organización de derechos musicales), como su director comercial, mientras que ElevenLabs contrató a Derek Cournoyer, anteriormente de la editorial musical independiente Kobalt, como líder de estrategia para su negocio de música.
Por qué importa
Stability AI está diferenciando sus nuevos modelos de audio al enfatizar el uso de datos de entrenamiento con licencia completa, un movimiento estratégico para evitar los obstáculos legales que enfrentan actualmente los competidores en el espacio de la música generativa.