jeu. Oct 8th, 2026
Une Start-up d'Audio IA Fondée par des Vétérans de TikTok Lève 11 Millions de Dollars !

Une startup innovante spécialisée dans l’audio génératif, fondée par des professionnels issus des divisions IA et musique de TikTok, a réussi à lever 11 millions de dollars pour développer des modèles capables de créer de la musique et des effets sonores adaptés aux images.

Basée à San Francisco, Sonilo a obtenu ce financement avec B Capital à la tête du tour de table et Redpoint également présent. Ce capital servira à acquérir la puissance de calcul nécessaire pour étendre ses modèles. La société envisage également d’élargir son réseau avec les créateurs et les plateformes de développement, tout en développant son activité de licences musicales.

La technologie centrale de Sonilo, baptisée Sound World Model, est un système multimodal qui relie la compréhension vidéo à la génération audio et au rythme. Plutôt que de traiter la musique et les effets comme des éléments distincts, cette technologie analyse les mouvements et les émotions d’une scène avant de produire des sons adaptés à ces images. Les utilisateurs peuvent télécharger une vidéo, ajouter une description ou combiner les deux pour obtenir une bande-son synchronisée prête à l’emploi.

“Nous avons conçu Sonilo pour comprendre l’histoire visuelle. Vous nous fournissez le film, et Sonilo saisit ce qui se passe image par image, y compris le rythme, l’émotion et la narration, afin de générer une musique et des effets sonores qui s’intègrent naturellement à la scène,” a déclaré Shawn Song, PDG et co-fondateur de Sonilo.

Song, qui a étudié à Carnegie Mellon, a dirigé des travaux sur la technologie multimodale chez TikTok, aux côtés d’Alex Yin, CTO de Sonilo. Keli Li, COO, a géré l’opération musicale mondiale de TikTok et possède un solide parcours dans les partenariats avec l’industrie musicale. Trista Taylor, CMO, supervise le développement des produits et le lancement sur le marché, ayant participé à la création d’applications IA qui ont figuré dans le classement des 50 meilleures de a16z.

Cette plateforme cible les créateurs de contenu travaillant sur des vidéos courtes et des drames, les plateformes de développement d’outils vidéo IA, ainsi que les équipes de production en entreprise. Elle propose également un service de doublage IA avec synchronisation labiale, permettant aux studios de contenu de traduire des vidéos sans passer par le montage manuel. Les partenaires de distribution initiaux incluent l’agrégateur de créateurs IA TapNow et ComfyUI.

“Nous croyons que l’audio génératif deviendra une composante essentielle de la stack vidéo native à l’IA. Ce qui distingue Sonilo, c’est sa technologie multimodale qui offre aux créateurs deux manières de générer des musiques et des effets sonores : soit en décrivant ce qu’ils souhaitent par écrit, soit en fournissant une vidéo pour que le modèle crée le son associé,” a ajouté Daisy Cai, associée générale chez B Capital.

En ce qui concerne les droits, Shutterstock est un partenaire de licence précoce. Sonilo a indiqué que ses modèles s’inspirent de musique sous licence, garantissant ainsi que les artistes et détenteurs de droits reçoivent des redevances ainsi qu’un pourcentage des revenus. La société finalise également des accords d’édition et d’enregistrement avec de grandes organisations de droits, qu’elle espère conclure dans les semaines à venir.

Une application destinée aux consommateurs devrait être lancée au cours du quatrième trimestre, permettant aux créateurs de contenu d’accéder directement à cet outil vidéo-musiques.

B Capital, fondée en 2015, gère plus de 9 milliards de dollars et dispose d’équipes dans neuf régions aux États-Unis et en Asie.

Points à retenir

  • Sonilo utilise une approche multimodale pour relier audio et vidéo.
  • La startup vise divers segments, notamment les créateurs de vidéos courtes et les équipes de production d’entreprise.
  • Un accord avec Shutterstock garantit des droits pour les artistes.
  • Une application pour créateurs sera disponible en fin d’année.

Dans un monde où le contenu audiovisuel occupe une place prépondérante, il est fascinant de voir comment l’IA peut transformer la création artistique. En tant que passionné des nouvelles technologies, je me demande quelles seront les implications à long terme de telles innovations. L’audio génératif pourrait-il redéfinir notre expérience de la narration visuelle? Et comment les créateurs s’adapteront-ils à ces nouveaux outils?


Partager : X Facebook WhatsApp LinkedIn Reddit

By Sandrine Dubois

Sandrine Dubois est une Journaliste indépendante trilingue, elle est née sur île de la Grenade, puis a fait ses études aux Etats-Unis à l' "University of Northern Iowa" , aujourd'hui elle intervient sur différents médias Web pour partager ses compétences dans les thématiques sociétales, business, lifestyle et culture.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *