En vivoDólar Blue$1.495S&P 5005.304,70,35%Nasdaq16.685,30,62%Dólar MEP$1.486Bitcoin USD$63.8250,49%
Startups

Fish Audio recaudó US$50M en seed y ya factura US$21M anuales: la startup de voz con IA que desafía a ElevenLabs

Con 8 millones de usuarios y 15.000 controles de lenguaje natural, Fish Audio apunta a creadores y empresas con modelos de voz que suenan humanos.

Foto de Julián BrusPor Julián Brus · Cofundador y editor de Negocios y Economía5 min de lectura
Compartir:
Imagen: Fish Audio recaudó US$50M en seed y ya factura US$21M anuales: la startup de voz con IA que desafía a ElevenLabs
Foto: TechCrunch

Tres variantes de titular (recomendada: #1)

  1. Fish Audio recaudó US$50M en seed y ya factura US$21M anuales: la startup de voz con IA que desafía a ElevenLabs
  2. La startup de voz con IA que nació en una GPU y hoy vale una ronda de US$50M
  3. US$50M para la startup que quiere hacer que cada voz artificial suene humana, y ya convence a millones

Fish Audio no necesitaba capital para sobrevivir. Lo buscó para escalar a otro nivel.

Esa tensión —entre eficiencia orgánica y ambición de modelo enterprise— es el núcleo del salto que acaba de dar esta startup de Palo Alto: una ronda seed de US$50 millones liderada por Coreline Ventures y Capital Today, con participación de 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners y HF0.

El número que importa antes que la ronda

Antes de hablar de la inversión, hay un dato que define la tracción real: Fish Audio genera US$21 millones de ARR (ingresos anuales recurrentes) y cuenta con más de 8 millones de usuarios en sus versiones open-source y hospedada, según confirmó la empresa.

No es una promesa. Es una base de negocio sobre la que ahora llega el combustible.

De una GPU a 31.000 estrellas en GitHub

El origen de Fish Audio es el tipo de historia que los inversores en IA persiguen: Shijia Liao, ex investigador de NVIDIA, frustrado con la falta de expresividad de las voces sintéticas disponibles, entrenó un modelo de generación de voz en una sola GPU y lo liberó como open-source. El repositorio Fish Speech en GitHub acumula hoy más de 31.000 estrellas y es usado por desarrolladores indie, diseñadores de videojuegos y creadores de contenido.

Desde entonces, la compañía lanzó cinco modelos en un año: cuatro de generación de voz y uno de speech-to-text. Tres de los modelos de generación son open-source; el más reciente, S2.1 Pro, está disponible exclusivamente vía API de pago.

El diferencial técnico: 15.000 controles de lenguaje natural

Lo que Fish Audio vende no es solo calidad de voz, sino control. Su plataforma ofrece una librería de más de 15.000 controles de lenguaje natural, lo que permite a desarrolladores afinar el tono, el ritmo y la expresividad con una granularidad que los grandes laboratorios de IA no priorizan.

"Cada empresa tiene casos de uso diferentes. HeyGen quiere realismo para sus avatares de IA; un estudio de videojuegos quiere voz expresiva para sus personajes; y empresas de agentes de voz como LiveKit necesitan voces naturales, de baja latencia y expresivas para llamadas", explicó Rissa Cao, CEO y cofundadora de Fish Audio, en declaraciones a TechCrunch.

Clientes como HeyGen, Sanas y Plaud ya usan la plataforma enterprise de Fish Audio.

El riesgo que la plataforma no puede ignorar

El modelo de comunidad —donde usuarios suben sus propias voces para entrenar los modelos y reciben compensación si son utilizadas— tiene una grieta.

Hace unos meses, varios creadores denunciaron que sus voces habían sido subidas a Fish Audio sin su consentimiento. El proceso de DMCA para eliminación existía, pero era lento. Cao anunció que la startup automatizó el proceso de takedown: con una muestra de voz o un contrato, la voz en disputa se elimina en menos de 3 minutos.

Pero el problema estructural persiste: cualquier persona puede subir una voz sin autorización, y el artista afectado solo puede actuar una vez que se entera.

Oskue Honda, socio de Coreline Ventures, fue directo al respecto: "La confianza de los creadores es el único activo que puede hacer de este modelo una ventaja duradera. El consentimiento, la transparencia y la atribución deben estar en el producto, no ser un parche posterior. La industria necesita avanzar hacia propiedad verificada de voz, licencias claras y modelos de revenue sharing", señaló.

Hacia dónde va el dinero

Con los US$50M, Fish Audio tiene dos objetivos declarados: desarrollar modelos más avanzados y capturar el mercado enterprise, donde el interés inversor fue el detonante para salir a buscar capital, según explicó la propia Cao.

En el pipeline de producto: un modelo de comprensión de audio y un modelo de speech-to-speech, ambos previstos para este año.

El mercado es competitivo. ElevenLabs, WellSaid, Cartesia, Speechify, Async y Krisp ya pelean por los mismos presupuestos de creadores y empresas. Pero Rico Mallozzi, socio de 359 Capital, puso en contexto la ventaja de Fish Audio: "Lo que construyeron, con el equipo que tienen, frente a laboratorios de IA mucho mejor financiados, es notable. Demuestra capacidad técnica real para cerrar la brecha entre voz artificial y voz humana".

La pregunta que quedó abierta: ¿puede una plataforma construida sobre comunidad y confianza escalar a enterprise sin romper el contrato con los creadores que la hicieron posible?

Compartir: