Accueil Entreprise & Leadership

Chanter en ligne a plusieurs : latence, outils et methode

11 min de lecture
Chanter en ligne a plusieurs : latence, outils et methode

Chanter en ligne a plusieurs se heurte a une contrainte physique : au-dela d’environ 25 millisecondes de decalage, deux voix cessent de tenir ensemble. Trois modes de pratique existent, du karaoke social au chant synchrone bas-delai, et chacun impose son materiel, son reseau et sa methode de repetition.

Trois facons de chanter en ligne, et une seule est simultanee

Le terme recouvre des pratiques que rien ne rapproche techniquement.

  • Le karaoke social : vous chantez sur une bande-son dans une application qui empile les prises. Smule et StarMaker reposent sur ce principe. Le duo existe, mais il reste differe.
  • Le chant asynchrone : chacun s’enregistre seul sur une piste de reference, puis un montage superpose les voix. C’est le format des chorales virtuelles.
  • Le chant synchrone : tout le monde chante au meme instant et entend les autres en direct. Seul mode qui reproduit la sensation d’un pupitre, seul mode aussi qui bute sur la physique.

Les deux premiers ne posent aucun probleme de reseau. Une prise s’enregistre, se televerse, se monte. Le decalage n’existe pas puisque personne n’ecoute personne en temps reel.

Le troisieme change de nature. Dans une salle, le son voyage a environ 343 metres par seconde a 20 degres, soit 34 centimetres par milliseconde. Un metre entre deux choristes represente donc pres de 3 millisecondes de retard. Une chorale etalee sur huit metres de profondeur vit deja avec une vingtaine de millisecondes d’ecart entre le premier et le dernier rang, sans que personne ne s’en plaigne.

Voila la reference : votre reseau doit tenir dans ce budget-la. Il ne s’agit pas de supprimer le retard, mais de le ramener sous le seuil ou l’oreille cesse de le percevoir comme un evenement distinct.

Repetition de chorale amateur en salle, choristes debout sur plusieurs rangs

Ce que la visioconference fait subir a une voix chantee

La reunion a distance est devenue la norme dans une partie des entreprises francaises. Selon l’Insee (Insee Analyses n°105, 2024), 22 % des salaries du prive pratiquent le teletravail au moins une fois par mois au premier semestre 2024, avec une moyenne de 1,9 jour hebdomadaire a distance. Le reflexe consiste donc a ouvrir l’outil deja installe pour tenter un moment musical collectif. Il echoue, et pour des raisons de conception.

Un logiciel de visioconference optimise une conversation, c’est-a-dire une alternance de prises de parole. Quatre traitements travaillent en permanence contre le chant :

  • La suppression d’echo part du principe qu’un seul flux compte a la fois et attenue tout ce qui se superpose.
  • La reduction de bruit interprete un souffle tenu, un vibrato ou une nappe de reverberation comme un parasite a effacer.
  • La normalisation automatique ecrase les nuances : un pianissimo remonte, un forte s’aplatit.
  • La selection du locuteur actif coupe purement les voix jugees secondaires.

Zoom a fini par proposer un mode Son d’origine pour les musiciens, qui desactive ces traitements et laisse passer un signal plus fidele. Le gain est reel pour un cours individuel ou pour une demonstration. Il ne resout pas le probleme du chant collectif, parce que le delai global reste bien au-dessus de ce que l’oreille tolere quand deux personnes attaquent la meme note.

Le vrai frein n’est donc pas la qualite du micro. C’est le temps que met le son a faire l’aller-retour, additionne au temps que le logiciel passe a le transformer.

Le seuil des 25 millisecondes, mesure et discute

Nathan Schuett a mesure a Stanford, en 2002, une limite proche de 25 millisecondes sur des taches de frappe rythmique : au-dela, les participants perdent la synchronisation. La litterature sur la performance musicale en reseau a repris ce chiffre sous le nom d’Ensemble Performance Threshold, generalement situe entre 25 et 30 millisecondes de delai bout en bout.

Chris Chafe et Michael Gurevich, au CCRMA de Stanford, ont nuance ce seuil en 2004. Leur experience ne montre aucune falaise : sous 11,5 millisecondes, les duos accelerent legerement le tempo ; au-dela, le tempo ralentit de facon progressive et reguliere, sans point de rupture brutal. La degradation est continue, ce qui laisse une marge de manoeuvre plus large que ne le suggere un seuil unique.

Ou passent les millisecondes

Le trajet reseau n’est qu’un poste parmi cinq. Le budget se consomme sur toute la chaine :

  1. La conversion analogique-numerique et la memoire tampon d’entree de la carte son.
  2. L’encodage du flux par le logiciel.
  3. Le trajet physique jusqu’au serveur, puis du serveur vers les autres participants.
  4. La memoire tampon de reception, qui absorbe les irregularites du reseau.
  5. La conversion numerique-analogique et la restitution dans le casque.

La lumiere circule dans une fibre optique a environ 200 000 kilometres par seconde, soit les deux tiers de sa vitesse dans le vide. Mille kilometres de fibre coutent donc a peu pres 5 millisecondes a l’aller. Un Paris-Marseille tient largement dans l’enveloppe ; un Paris-Montreal la consomme entierement avant meme d’avoir traverse le moindre routeur.

La gigue compte plus que le delai moyen

Un delai stable se compense : le cerveau s’y adapte en quelques minutes, exactement comme il s’adapte a la distance dans une salle. Une variation de delai, elle, ne s’apprend pas. Cette instabilite porte un nom, la gigue, et se mesure a l’ecart entre les paquets qui arrivent en avance et ceux qui arrivent en retard.

Les logiciels la compensent avec une memoire tampon : plus la connexion est irreguliere, plus le tampon doit grandir, et plus la latence totale augmente. Une ligne qui oscille entre 8 et 40 millisecondes force le logiciel a se caler sur le pire cas. Resultat : une connexion moyenne mais reguliere bat une connexion rapide mais capricieuse. Une fibre partagee avec un foyer en pleine soiree video vaut parfois moins qu’un debit modeste sur une ligne calme.

Regle pratique : gardez vos participants dans un rayon geographique restreint et choisissez un serveur situe entre eux, pas a l’autre bout du monde.

Baie de brassage reseau avec cables fibre optique colores

Les outils concus pour le chant synchrone

Deux logiciels libres dominent la pratique amateur et pedagogique.

Jamulus, publie sous licence GPL et developpe par Volker Fischer, compresse l’audio et fonctionne sur une connexion haut debit ordinaire. Des chorales, des groupes et des ecoles de musique l’utilisent pour repeter a distance. Le principe : chacun se connecte a un serveur commun qui melange les flux et renvoie le mixage.

JackTrip, ne au CCRMA de Stanford et diffuse en 2010, transmet de l’audio non compresse. La qualite est superieure, le besoin en bande passante aussi, et la configuration reclame davantage de patience. C’est l’outil des conservatoires et des projets exigeants.

Le casque n’est pas une option

Trois conditions materielles conditionnent le resultat, avant meme le choix du logiciel :

  • Connexion filaire : le Wi-Fi introduit des variations de delai imprevisibles, plus destructrices qu’un delai stable et eleve.
  • Casque ferme : sans lui, le micro reprend les autres voix, le serveur les renvoie, et la boucle s’installe en quelques secondes.
  • Carte son externe : la latence des cartes integrees d’ordinateur portable mange souvent a elle seule une part importante du budget total.

Mesurez avant d’investir. Une commande ping vers le serveur envisage donne le temps d’aller-retour du reseau seul, sans la carte son ni les tampons : divisez ce resultat par deux pour obtenir le trajet aller. Si ce poste depasse deja 20 millisecondes, aucun reglage logiciel ne sauvera la session. Faites ensuite un essai a deux sur un morceau que les deux personnes connaissent par coeur, en comptant quatre temps a voix haute avant de partir. Le decalage s’entend immediatement, bien mieux qu’il ne se lit sur un compteur. Ce test de cinq minutes evite d’acheter du materiel pour un probleme qui vient de la ligne.

Un groupe de quatre a huit chanteurs reste gerable dans ce mode. Au-dela, les ecarts de qualite entre les connexions se cumulent et le maillon le plus faible impose son rythme a tout le monde. Travailler d’abord sa justesse en solo evite de confondre un probleme technique avec un probleme vocal.

Monter une session asynchrone qui sonne juste

Le mode asynchrone supprime la contrainte de latence et ouvre la porte a des effectifs sans commune mesure. Le projet Virtual Choir 6, intitule Sing Gently et diffuse en juillet 2020, a reuni 17 572 voix venues de 129 pays. Chaque participant s’est enregistre seul, chez lui, sur une piste de reference commune.

La methode se resume a six etapes :

  1. Produire une piste de reference unique : un clic de tempo, un accompagnement au piano et une video de direction que tout le monde suit.
  2. Distribuer les pupitres selon la tessiture vocale reelle de chacun, pas selon les preferences declarees.
  3. Imposer le casque a l’enregistrement, sans quoi la piste de reference se retrouve dans le micro et rend le montage impossible.
  4. Demander une seule prise complete par personne, sans montage individuel : les micro-corrections locales desynchronisent l’ensemble.
  5. Faire commencer chaque fichier par trois secondes de silence et un repere sonore de calage, qui servent de point d’alignement.
  6. Monter voix par voix, en verifiant les attaques et les fins de phrases avant d’ajouter le pupitre suivant.

Signal d’alerte au montage : si plusieurs voix flottent au meme endroit, le probleme vient presque toujours de la piste de reference, trop rapide ou mal marquee, pas des chanteurs.

Cette approche a un avantage inattendu pour un collectif de travail : elle absorbe les fuseaux horaires. Une equipe repartie sur trois continents produit le meme livrable qu’une equipe reunie dans une salle, sans imposer a personne une session a trois heures du matin.

Micro de studio sur pied et casque ferme pose sur un bureau en bois

Chanter ensemble quand l’equipe travaille a distance

L’interet du sujet pour un dirigeant tient a un constat simple : le travail hybride s’est installe, et les moments de cohesion informels ont disparu avec les couloirs. La Dares, dans une etude publiee en novembre 2024, situe a 26 % la part des salaries pratiquant le teletravail au moins occasionnellement en 2023, contre 9 % en 2019. La question du lien collectif se pose donc dans des entreprises qui ne se la posaient pas.

Le chant collectif possede une particularite documentee. Kreutz et ses coauteurs, dans le Journal of Behavioral Medicine en 2004, ont suivi 31 choristes amateurs ages de 29 a 74 ans lors de deux repetitions : chanter augmentait l’affect positif et les immunoglobulines A salivaires, tandis que l’affect negatif diminuait. Ecouter la meme musique ne produisait pas le meme effet.

Bjorn Vickhoff et son equipe de l’universite de Goteborg ont publie en 2013, dans Frontiers in Psychology, un resultat complementaire : la variabilite de la frequence cardiaque des choristes se synchronise, pilotee par la structure musicale a travers la respiration. Le mecanisme se nomme arythmie sinusale respiratoire. Chanter ensemble impose litteralement un rythme respiratoire commun.

Trois conditions font la difference entre un rituel qui tient et une corvee de plus dans l’agenda :

  • Volontariat strict : une participation imposee produit l’inverse de l’effet recherche.
  • Format court et fixe : vingt minutes, meme creneau chaque semaine, pas de rallonge.
  • Zero evaluation : personne ne commente la voix de personne, jamais.

Trois formats tiennent dans un agenda charge, du plus leger au plus engageant :

  • Le rituel de cloture : cinq minutes de chant a l’unisson en fin de reunion mensuelle, sans preparation, sur un morceau que tout le monde connait.
  • Le karaoke asynchrone : chacun envoie sa prise sur le meme titre dans la semaine, le montage circule le vendredi. Aucun creneau commun a trouver.
  • La chorale trimestrielle : un projet de six a huit semaines aboutissant a une video montee, avec repartition par pupitre et piste de reference.

Le premier format ne coute presque rien et sert de test grandeur nature. Les deux autres reclament un porteur identifie, faute de quoi ils s’eteignent au deuxieme episode.

Un dirigeant qui inspire confiance accepte de chanter faux devant son equipe avant de le demander a quiconque. Ce type d’initiative se delegue rapidement a un volontaire motive, qui la portera mieux qu’une direction.

Collegues en cercle dans un espace de bureau lumineux, ambiance detendue

Les erreurs qui font echouer une session

Six pieges reviennent systematiquement chez les groupes qui abandonnent apres deux essais :

  • Tester le dispositif le jour J, devant tout le monde, plutot que la veille en petit comite.
  • Melanger dans une meme session synchrone des participants en fibre et des participants en 4G.
  • Confondre le mode synchrone et le mode asynchrone dans la communication, ce qui fait arriver la moitie du groupe avec le mauvais materiel.
  • Choisir un repertoire trop exigeant : un morceau lent, a l’unisson, pardonne les decalages residuels bien mieux qu’une polyphonie rapide.
  • Negliger le serveur : un serveur mal place ajoute des dizaines de millisecondes et fait mecaniquement sortir le groupe du seuil de 25 millisecondes.
  • Enchainer sans temps de parole : cinq minutes d’echange informel apres la session produisent la moitie du benefice collectif.

Un premier essai rate ne signifie pas que le format ne fonctionne pas. Il signifie presque toujours qu’un maillon de la chaine technique n’a pas ete verifie. Ceux qui veulent progresser vocalement en parallele trouveront dans les cours de chant en ligne un complement utile a la pratique de groupe.

Prochaine etape

Testez le mode asynchrone avant tout autre chose : il ne demande aucune installation, aucun serveur et aucun reglage reseau. Choisissez un morceau court a l’unisson, enregistrez une piste de reference au clic, laissez une semaine a chacun pour envoyer son fichier. Vous saurez en dix jours si le format prend dans votre groupe, et vous n’aurez rien depense pour le decouvrir.