Cómo funciona la transcripción de audio a MIDI con IA
Qué hace distinto a un modelo de inteligencia artificial de un afinador común, y sus límites reales.
Qué hace distinto a esto de un afinador
Un afinador detecta una sola frecuencia fundamental a la vez — sirve para una nota sostenida, no para una melodía completa con ritmo y silencios. El transcriptor de audio a MIDI usa un modelo de inteligencia artificial entrenado con miles de grabaciones reales, capaz de reconocer dónde empieza y termina cada nota, incluso cuando suenan varias notas a la vez (acordes).
Por qué corre en tu navegador y no en un servidor
El modelo pesa menos de 1 MB y corre con TensorFlow.js directamente en tu dispositivo. Eso significa dos cosas: tu audio nunca se sube a ningún lado, y no depende de que un servidor esté disponible o de límites de uso — funciona igual de bien sin conexión una vez que la página cargó por primera vez.
Qué hace bien y qué no
Funciona mejor con una sola fuente de sonido por vez: una voz, una guitarra, un piano. No separa instrumentos que suenan mezclados en una grabación completa (para eso hace falta una tecnología distinta, de separación de fuentes). Tampoco transcribe percusión sin tono definido, como una batería — el modelo busca notas musicales, no golpes rítmicos.
Qué hacer con el resultado
El archivo MIDI que descargás no incluye sonido — son instrucciones de qué nota, cuándo y por cuánto tiempo. Se abre en cualquier programa de notación (para ver la partitura) o en un DAW (para asignarle cualquier instrumento virtual y reproducirlo).