Qu'est-ce que le Gaussian splatting ?

par Pierre
Qu'est-ce que le Gaussian splatting ?

Le Gaussian splatting — ou 3D Gaussian Splatting, souvent abrégé 3DGS — est une technique qui représente une scène en trois dimensions par des centaines de milliers, parfois des millions, de petites taches floues en forme d'ellipsoïdes : des gaussiennes. Chacune a une position, une forme, une couleur et une transparence ; ensemble, elles reproduisent une scène photographiée avec un réalisme quasi photographique, et s'affichent en temps réel.

La méthode a été présentée à SIGGRAPH 2023 par une équipe de l'Inria : Bernhard Kerbl, Georgios Kopanas et George Drettakis, de l'équipe GRAPHDECO de l'Inria et de l'Université Côte d'Azur, avec Thomas Leimkühler, de l'institut Max-Planck d'informatique. En trois ans, elle est passée du laboratoire aux moteurs de jeu, aux navigateurs web et à un standard international.

Le mot splatting vient de l'anglais splat, l'éclaboussure : chaque gaussienne est projetée sur l'écran comme une tache de peinture, dense en son centre et qui s'estompe vers les bords selon une courbe en cloche — la courbe de Gauss, qui lui donne son nom.

Une vraie scène, à faire tourner

Un cactus en pot, hérissé d’épines, posé sur un socle noir, en Gaussian splatting

2,2 Mo à télécharger

Faites glisser pour tourner · pincez, ou Ctrl (⌘) + molette, pour zoomer · au clavier : flèches, + et −

Scène : Steam Studio (steam-studio.jp), licence CC0 — 427 photos, entraînée avec Postshot.

Une scène en Gaussian splatting affichée en direct : un cactus en pot sur un socle, reconstruit à partir de 427 photos. On peut la faire tourner, zoomer, et rétrécir toutes les taches jusqu’à ce que la scène se défasse en milliers d’ellipses colorées.

Faites tourner la scène, puis faites glisser « Taille des taches » vers la gauche : chaque gaussienne rétrécit sans bouger, et l’objet se défait en milliers de taches colorées — les épines se révèlent être de longues ellipses très fines. En dessous d’environ 10 %, les taches deviennent plus petites qu’un pixel ; le moteur leur garde alors une taille minimale, comme la méthode de référence, et elles restent visibles comme des points. Le mode « Ellipsoïdes opaques » dessine chaque gaussienne suffisamment opaque comme une forme pleine, sans fondu : c’est la structure de la scène. Pour rester léger, ce rendu n’utilise que la couleur de base de chaque gaussienne (le degré 0 présenté plus bas), sans les reflets qui changent avec l’angle. Le moteur a été écrit pour cet article, en WebGL 2, sans bibliothèque.

Qu'est-ce que le Splatting Gaussien 3D ?

Une scène en Gaussian splatting n'a ni surface ni triangles. C'est un nuage de gaussiennes superposées et semi-transparentes, que l'on dessine de l'arrière vers l'avant. Là où elles sont nombreuses et opaques, on voit un objet ; là où elles sont rares, on voit au travers. C'est justement cette absence de surface qui lui permet de rendre ce que les maillages 3D classiques rendent mal : le feuillage, les cheveux, la fumée, les reflets, les objets très fins comme des épines ou des câbles.

Une gaussienne, qu'est-ce que c'est ?

Une gaussienne 3D est une tache floue en forme d'ellipsoïde, dont la densité décroît du centre vers les bords. Elle est entièrement décrite par une poignée de nombres :

  • une position dans l'espace (3 nombres) ;
  • un étirement le long de ses trois axes (3 nombres) et une rotation (4 nombres, sous forme de quaternion) — ensemble, ils forment ce que les chercheurs appellent la covariance, c'est-à-dire la forme et l'orientation de la tache ;
  • une opacité (1 nombre) ;
  • une couleur qui varie selon l'angle de vue (48 nombres ; on y revient plus bas).

Soit 59 nombres par gaussienne. Les scènes de l'article original en comptent entre un et cinq millions.

Une gaussienne, à la main

Coupe le long du premier axe : la courbe en cloche de Gauss

Faites glisser les poignées. Au clavier : flèches pour ajuster, Maj pour aller dix fois plus vite.

Couleur

Une tache floue en forme d’ellipse, que l’on peut déplacer, étirer dans deux directions, faire pivoter et rendre plus ou moins opaque. En dessous, sa coupe le long du premier axe : une courbe en cloche.

Faites glisser les poignées ou utilisez les curseurs. La courbe du dessous est une coupe de la tache le long de son premier axe : c'est la courbe en cloche qui donne son nom à la méthode. En 3D s'ajoute un troisième axe, mais le principe ne change pas.

Pourquoi des taches plutôt que des triangles ?

Depuis des décennies, l'image de synthèse repose sur des triangles : une surface est découpée en facettes, et chaque facette est coloriée. C'est redoutablement efficace pour des objets aux contours nets, mais cela suppose une géométrie exacte, et tout ce qui n'a pas de surface bien définie — une chevelure, un nuage, une vitre sale — devient un casse-tête.

Une gaussienne ne prétend pas décrire une surface. Elle dit seulement : « il y a un peu de cette couleur, à peu près ici ». Parce qu'elle est floue, deux gaussiennes voisines se fondent l'une dans l'autre sans couture ; parce qu'elle peut s'étirer et pivoter, une seule gaussienne allongée suffit à dessiner un brin, une arête ou une épine. Et surtout, une tache floue varie en douceur : on sait calculer comment l'image change quand on la déplace un tout petit peu, ce qui permet de l'ajuster automatiquement. C'est tout l'intérêt de la méthode, comme on le verra avec l'entraînement.

Même budget, trois briques

Nombre de primitives
La photo en 49 pixels carrés
Pixels PSNR 18,0 dB · 147 valeurs
La photo en 50 triangles dégradés
Triangles PSNR 16,8 dB · 140 valeurs
La photo en 50 gaussiennes
Gaussiennes PSNR 20,8 dB · 450 valeurs
La photo en 196 pixels carrés
Pixels PSNR 19,4 dB · 588 valeurs
La photo en 200 triangles dégradés
Triangles PSNR 17,7 dB · 515 valeurs
La photo en 200 gaussiennes
Gaussiennes PSNR 24,4 dB · 1 800 valeurs
La photo en 1 024 pixels carrés
Pixels PSNR 21,9 dB · 3 072 valeurs
La photo en 1 000 triangles dégradés
Triangles PSNR 20,6 dB · 2 515 valeurs
La photo en 1 000 gaussiennes
Gaussiennes PSNR 28,9 dB · 9 000 valeurs
La photo en 5 041 pixels carrés
Pixels PSNR 24,8 dB · 15 123 valeurs
La photo en 5 000 triangles dégradés
Triangles PSNR 26,0 dB · 12 515 valeurs
La photo en 4 988 gaussiennes
Gaussiennes PSNR 38,6 dB · 44 892 valeurs

La même photo reconstruite avec le même nombre de primitives : des pixels carrés, des triangles dégradés, des gaussiennes. Choisissez le budget ; sous chaque image, sa qualité mesurée (PSNR) et le nombre de valeurs qu’elle stocke.

À nombre égal, les gaussiennes restituent le plus de la photo, parce que chacune peut s’étirer, pivoter et se fondre dans ses voisines. Mais même nombre ne veut pas dire même poids : un pixel stocke 3 valeurs (sa couleur), un sommet de triangle 5 (sa position et sa couleur, partagées par les triangles voisins), une gaussienne en 2D 9 (position, deux étirements, rotation, couleur, opacité). Même à nombre de valeurs égal, les gaussiennes gardent l’avantage : 200 gaussiennes (1 800 valeurs) font mieux que 1 024 pixels (3 072 valeurs). Les triangles sont placés par l’algorithme glouton de Garland et Heckbert, qui ajoute à chaque tour le point le plus mal rendu, avec des couleurs de sommets ajustées au mieux ; les gaussiennes sortent du même ajustement que la figure sur l’entraînement, plus bas. PSNR : plus haut, c’est mieux.

D'où vient la couleur

Sur les 59 nombres d'une gaussienne, 48 servent à sa couleur. Ce n'est pas une couleur fixe, mais une fonction de la direction d'où on la regarde, codée par des harmoniques sphériques — une manière compacte de décrire une valeur qui varie tout autour d'une sphère. Une même gaussienne peut ainsi paraître claire vue de face et sombre vue de biais.

C'est ce mécanisme qui reproduit les reflets et les brillances. Une nuance compte : une gaussienne isolée n'affiche qu'une seule couleur à la fois, qui change avec l'angle. Le reflet qui glisse sur une surface naît de l'accord de milliers de gaussiennes voisines, dont chacune change de couleur à sa manière.

Une couleur qui dépend de l’angle

Une seule gaussienne affiche une seule couleur à la fois : celle de la direction d’où on la regarde.

  • Anneau extérieur : la couleur réelle vue de chaque direction
  • Anneau intérieur : ce que la gaussienne en garde
lumière caméra

Le reflet n’existe que par l’accord de plusieurs gaussiennes voisines.

Précision de la couleur (degré des harmoniques sphériques)
48 nombres pour la couleur, 59 au total

À gauche, une gaussienne et l’anneau de toutes les directions d’où on peut la regarder : l’anneau extérieur montre la couleur qu’aurait une surface brillante, l’anneau intérieur ce que la gaussienne sait en garder au degré choisi. À droite, seize gaussiennes le long d’une surface courbe éclairée : quand la caméra bouge, le reflet glisse de l’une à l’autre. Au degré 0, la couleur ne dépend plus de l’angle et le reflet disparaît.

Faites glisser sur les dessins ou utilisez les curseurs, puis changez de degré. Au degré 0, 3 nombres suffisent, mais la couleur est la même de partout : plus de reflet. Au degré 3, celui de la méthode de référence, 48 nombres dessinent un reflet net — avec, autour, de légères ondulations, la limite de ce que 16 fonctions par canal peuvent représenter. Figure en 2D : les directions de vue sont prises dans un plan.

Comparaison avec d'autres approches

Photogrammétrie

La photogrammétrie est la méthode historique pour numériser un objet ou un lieu à partir de photos. On retrouve la position des appareils, on calcule un nuage de points, puis on en tire un maillage de triangles recouvert d'une texture. Le résultat est une vraie surface, mesurable, que tous les logiciels 3D savent manipuler.

Ses faiblesses sont bien connues. Ce qui n'a pas de surface nette (ciel, feuillage, cheveux), ce qui est très fin (câbles, grillages, épines), ce qui reflète ou laisse passer la lumière (vitres, eau, métal poli) ressort troué, fondu ou déformé.

On oppose souvent photogrammétrie et Gaussian splatting. C'est en partie un faux débat : les deux partent de la même étape, qui consiste à retrouver la position des caméras et un nuage de points à partir des photos. Ce qui change, c'est ce que l'on construit ensuite — une surface dans un cas, un nuage de gaussiennes dans l'autre. Le splat gagne en réalisme visuel ; le maillage reste plus exploitable, puisqu'on peut le mesurer, le modifier, l'imprimer en 3D.

Mêmes photos, deux reconstructions

Le cactus en Gaussian splatting : les épines ressortent une à une, fines et translucides Le cactus en maillage de triangles texturé : les épines sont peintes sur une surface à facettes, sans relief sur le contour

À observer

  1. De face, les épines du maillage paraissent nettes : elles sont peintes dans une texture de 8 192 pixels de côté, sur une surface lisse — comme une photo collée sur un ballon. Le splat, un peu plus doux, les dessine une à une, en relief, avec leur transparence.
  2. Sur le contour, l’illusion cesse : le maillage découpe le cactus en facettes, comme du papier plié, et perd le bout des épines ; le splat garde les épines qui dépassent — la vraie silhouette de la plante.
  3. Le bord du pot : les deux se superposent au pixel près, parce qu’ils viennent des mêmes photos et des mêmes positions de caméra.

Données : Steam Studio (steam-studio.jp), licence CC0 — maillage RealityCapture de 100 000 triangles, splat Postshot de 139 000 gaussiennes.

Le même cactus reconstruit à partir des mêmes 427 photos : à gauche en maillage texturé (photogrammétrie), à droite en Gaussian splatting, vus exactement du même point de vue. Un curseur déplace la séparation entre les deux.

Faites glisser la séparation. Le maillage compte 100 000 triangles et une texture de 8 192 × 8 192 pixels ; le splat, 139 000 gaussiennes. Ni l’un ni l’autre n’est « meilleur » : le maillage est une vraie surface, que l’on peut mesurer, modifier ou imprimer ; le splat restitue mieux ce qui n’a pas de surface nette. Pour cette comparaison, nous avons recalé le maillage sur le splat, puis rendu les deux images avec la même caméra.

NeRF

En 2020, les Neural Radiance Fields (NeRF) ont montré qu'un réseau de neurones pouvait apprendre une scène à partir de photos et en produire des vues nouvelles d'un réalisme alors inédit, reflets compris. La scène y est implicite : pour connaître la couleur d'un point, on interroge le réseau. Pour dessiner une seule image, il faut l'interroger des millions de fois, le long du rayon de chaque pixel. D'où une qualité remarquable, mais un rendu lent et un entraînement long.

Le Gaussian splatting garde l'idée d'apprendre la scène à partir des photos, mais remplace le réseau par un ensemble explicite de gaussiennes que l'on peut dessiner directement, comme on dessine des triangles. C'est ce qui le rend si rapide.

Ce que disent les chiffres de l'article original

L'article de 2023 compare les méthodes sur le jeu de données Mip-NeRF360, des scènes réelles photographiées à 360°. Le meilleur NeRF de l'époque, Mip-NeRF360, gardait un léger avantage sur l'une des trois mesures de qualité (27,69 dB de PSNR contre 27,21) et était devancé sur les deux autres. Mais il demandait 48 heures d'entraînement et s'affichait à 0,06 image par seconde. Le Gaussian splatting atteignait une qualité comparable en 41 minutes et s'affichait à 134 images par seconde, soit plus de 2 000 fois plus vite.

Ce que mesurait l’article original

Mesure affichée

Images par seconde (échelle logarithmique) · plus haut, c’est mieux

  • Plenoxels 6,79
  • Instant-NGP (base) 11,7
  • Instant-NGP (grand) 9,43
  • Mip-NeRF360 † 0,06
  • Gaussian splatting (7 000 it.) 160
  • Gaussian splatting (30 000 it.) 134

Durée d’entraînement (échelle logarithmique) · plus bas, c’est mieux

  • Plenoxels 25 min 49 s
  • Instant-NGP (base) 5 min 37 s
  • Instant-NGP (grand) 7 min 30 s
  • Mip-NeRF360 † 48 h
  • Gaussian splatting (7 000 it.) 6 min 25 s
  • Gaussian splatting (30 000 it.) 41 min 33 s

PSNR en décibels (axe tronqué entre 22 et 28 dB) · plus haut, c’est mieux

  • Plenoxels 23,08
  • Instant-NGP (base) 25,30
  • Instant-NGP (grand) 25,59
  • Mip-NeRF360 † 27,69
  • Gaussian splatting (7 000 it.) 25,60
  • Gaussian splatting (30 000 it.) 27,21
Voir le tableau complet
Tableau 1 de Kerbl et al. (2023), jeu de données Mip-NeRF360
MéthodePSNR (dB)SSIMEntraînementImages/sMémoire
Plenoxels 23,08 0,626 25 min 49 s 6,79 2,1 Go
Instant-NGP (base) 25,30 0,671 5 min 37 s 11,7 13 Mo
Instant-NGP (grand) 25,59 0,699 7 min 30 s 9,43 48 Mo
Mip-NeRF360 † 27,69 0,792 48 h 0,06 8,6 Mo
Gaussian splatting (7 000 it.) 25,60 0,770 6 min 25 s 160 523 Mo
Gaussian splatting (30 000 it.) 27,21 0,815 41 min 33 s 134 734 Mo

Source : Kerbl et al., 2023, tableau 1, mesures sur une carte RTX A6000. † Valeurs de qualité reprises par les auteurs de l’article Mip-NeRF360.

Six méthodes comparées sur le jeu de données Mip-NeRF360 : vitesse d’affichage, temps d’entraînement et qualité d’image, d’après le tableau 1 de l’article de 2023.

La vitesse et le temps d'entraînement sont sur des échelles logarithmiques : sans elles, toutes les méthodes sauf une seraient écrasées contre zéro. Le prix de cette vitesse, c'est la mémoire — 734 Mo par scène pour le Gaussian splatting, contre 8,6 Mo pour Mip-NeRF360.

Comment ça fonctionne dans le détail

Structure à partir du mouvement

Tout commence par des photos de la scène, prises sous de nombreux angles. Un logiciel de structure from motion — historiquement COLMAP — repère dans ces photos des points communs, en déduit la position et l'orientation de chaque prise de vue, et reconstruit au passage un nuage de points clairsemé. Cette étape relève de la géométrie classique, pas de l'apprentissage automatique, et c'est souvent la plus longue et la plus fragile : de quelques minutes à plusieurs heures selon le nombre de photos, et parfois un échec pur et simple si la scène manque de texture ou si les photos se recouvrent mal.

Cette étape est en train de changer. Des modèles comme VGGT, meilleur article de la conférence CVPR 2025, estiment désormais caméras et géométrie en moins d'une seconde, et remplacent COLMAP dans un nombre croissant d'outils.

Des points aux gaussiennes

Chaque point du nuage devient une gaussienne. Sa position et sa couleur sont connues ; sa taille est fixée d'après la distance à ses plus proches voisins ; son opacité de départ est faible. À ce stade, la scène n'est qu'une ébauche grossière. Tout le travail qui suit consiste à l'affiner.

Entraînement : peindre par essais-erreurs

L'entraînement fonctionne comme un peintre qui corrige sa toile en la comparant sans cesse au modèle. À chaque itération, on prend une des photos, on dessine les gaussiennes depuis le même point de vue, et on mesure l'écart entre l'image obtenue et la photo. Puis on ajuste légèrement chaque paramètre de chaque gaussienne — position, forme, opacité, couleur — dans la direction qui réduit cet écart.

C'est de la descente de gradient, comme pour un réseau de neurones, mais sans réseau : ce sont les gaussiennes elles-mêmes que l'on optimise. L'écart mesuré combine une différence pixel à pixel (pour 80 %) et une mesure de ressemblance structurelle (pour 20 %). La méthode de référence enchaîne 30 000 itérations, soit une quarantaine de minutes sur une carte graphique professionnelle.

L’entraînement, itération par itération

La photo

Un cactus en pot hérissé de fines épines, sur fond noir

Les gaussiennes

La même photo repeinte par 1 600 gaussiennes floues

Itération 6 000 · 1 600 gaussiennes · PSNR 31,4 dB

Photo : Steam Studio (steam-studio.jp), licence CC0.

À gauche, une photo de cactus. À droite, la même photo repeinte par des gaussiennes en deux dimensions, avec la boucle d’entraînement du Gaussian splatting : 256 taches posées au hasard sont comparées à la photo, corrigées, clonées, divisées et supprimées, itération après itération. Deux courbes suivent la qualité de l’image et le nombre de gaussiennes.

Faites défiler les itérations ou lancez la lecture. Au départ, 256 taches posées au hasard ; en quelques dizaines d’itérations, les couleurs s’installent. La densification clone et divise ensuite les gaussiennes là où l’écart reste fort — les épines, le bord du pot — jusqu’au plafond fixé ici à 1 600. À l’itération 1 500, l’opacité de toutes les gaussiennes est ramenée presque à zéro : l’image s’efface, puis se reconstruit en quelques centaines d’itérations. La méthode de référence le fait toutes les 3 000 itérations, pour purger les taches inutiles. L’affichage « Écart avec la photo » montre où l’image diffère encore du modèle : c’est là que l’optimisation pousse. Les règles sont celles de la méthode de référence, transposées en 2D (les seuils y sont exprimés en fraction de l’image) ; l’ajustement a été calculé à l’avance, et vous en voyez la rediffusion.

Densification : cloner, diviser, supprimer

Les points de départ ne suffisent jamais. Certaines zones manquent de gaussiennes ; d'autres n'en ont qu'une seule, trop grosse, là où il faudrait du détail. Toutes les 100 itérations, la méthode fait donc le ménage, en se fiant à un indicateur simple : l'ampleur du gradient, c'est-à-dire l'insistance avec laquelle l'optimisation cherche à déplacer une gaussienne.

Densification : cloner, diviser, supprimer

  1. Étape 1 · Diagnostic

    Là où l’image est fausse

    Trois cas. Une petite gaussienne (bleue) borde un trou : l’optimisation la tire fort vers la zone vide, son gradient dépasse le seuil de 0,0002. Une grosse gaussienne floue (ambre) couvre un détail qu’elle ne peut pas rendre seule. Une troisième (sarcelle) est presque transparente et n’apporte rien.

  2. Étape 2 · Cloner

    Petite et au mauvais endroit : on la duplique

    Une petite gaussienne au gradient élevé est copiée, et la copie est déplacée dans la direction du gradient, vers la zone sous-représentée.

  3. Étape 3 · Diviser

    Grande et floue : on la coupe en deux

    Une grande gaussienne au gradient élevé est remplacée par deux gaussiennes placées au hasard à l’intérieur de l’ancienne, avec une taille divisée par 1,6.

  4. Étape 4 · Supprimer

    Presque transparente : on l’élimine

    Une gaussienne dont l’opacité tombe sous 0,005 ne contribue plus à l’image. Elle est supprimée.

  5. Étape 5 · Remettre à zéro

    Toutes les 3 000 itérations, on recommence à douter

    L’opacité de toutes les gaussiennes est ramenée presque à zéro. L’optimisation fait remonter celles qui comptent ; celles qui restent transparentes seront supprimées à leur tour.

Le détail à reproduire

Cinq étapes montrant comment la méthode ajoute des gaussiennes là où le détail manque et retire celles qui ne servent à rien.

Les règles et les seuils sont ceux de la méthode de référence ; les positions sont illustratives.

Ce mécanisme multiplie le nombre de gaussiennes au fil de l'entraînement, jusqu'à plusieurs millions pour une scène complète, tout en éliminant celles qui ne servent à rien.

Rasterisation gaussienne différentiable

Pour afficher la scène, il faut transformer ces millions d'ellipsoïdes en pixels, à chaque image. Le procédé tient en trois étapes :

  1. Projeter chaque gaussienne sur l'écran : un ellipsoïde en 3D devient une ellipse floue en 2D, dont la forme dépend de l'angle de vue et de la distance.
  2. Trier les gaussiennes de la plus proche à la plus lointaine. L'écran est découpé en tuiles de 16 × 16 pixels, et le tri se fait tuile par tuile, en parallèle sur la carte graphique.
  3. Fusionner, pour chaque pixel, de l'avant vers l'arrière : chaque gaussienne ajoute sa couleur en proportion de son opacité et de la lumière qui reste, jusqu'à ce que le pixel soit « plein ».

Trier, puis fusionner

A B C D E caméra

Ce que voit la caméra, réduit à une ligne de pixels

Pour ce pixel : part de chaque gaussienne dans la couleur, puis la lumière qui reste

Avec tri : les gaussiennes sont fusionnées de la plus proche à la plus lointaine.

Vue de dessus de cinq gaussiennes lettrées de A à E et d’une caméra que l’on fait tourner autour. En dessous, l’image vue par la caméra, réduite à une ligne de pixels, puis la part de couleur apportée par chaque gaussienne à un pixel choisi.

Un monde réduit à deux dimensions et vu de dessus, pour que tout tienne dans une figure : l'image de la caméra n'est plus qu'une ligne de pixels. La projection, le tri et la fusion sont en revanche les vrais calculs du Gaussian splatting.

Ce rendu est dit différentiable : on sait calculer, pour chaque pixel, comment il changerait si l'on bougeait telle ou telle gaussienne. C'est précisément ce qui rend l'entraînement possible — le même moteur sert à afficher la scène et à l'apprendre.

Ce qui a changé depuis 2023

L'article original décrivait une technique prometteuse mais contraignante : des scènes figées, des fichiers de plusieurs centaines de mégaoctets, une carte graphique dédiée et un format que presque rien ne savait lire. Trois ans plus tard, presque chacune de ces limites a été levée.

Trois ans de Gaussian splatting

  1. La méthode est publiée

    L’équipe de l’Inria présente le 3D Gaussian Splatting à SIGGRAPH : qualité d’un NeRF, affichage à 134 images par seconde.

  2. Des scènes qui bougent

    4DGS ajoute le temps aux gaussiennes et affiche des scènes dynamiques à 82 images par seconde.

  3. Deux photos suffisent

    pixelSplat prédit directement des gaussiennes à partir de deux images, sans entraînement propre à la scène.

  4. L’entraînement tient dans la poche

    Scaniverse entraîne les splats directement sur le téléphone.

  5. Dix fois plus léger

    Niantic publie en open source le format SPZ : 64 octets par gaussienne au lieu de 236.

  6. Des caméras en une seconde

    VGGT estime caméras et géométrie en moins d’une seconde et commence à remplacer COLMAP.

  7. Au-delà de la caméra idéale

    La méthode 3DGUT de NVIDIA, intégrée à la bibliothèque gsplat, gère objectifs fisheye et rayons secondaires.

  8. Des mondes générés

    World Labs rend Marble accessible à tous : des mondes créés à partir d’un texte ou d’une image, exportables en splats.

  9. OpenUSD les adopte

    La version 26.03 d’OpenUSD ajoute un schéma natif pour les Gaussian splats.

  10. Cent millions dans un navigateur

    Spark 2.0 diffuse en streaming des mondes de plus de 100 millions de gaussiennes sur le web.

  11. Un standard glTF

    L’extension KHR_gaussian_splatting est ratifiée par le Khronos Group.

Les étapes marquantes entre la publication de la méthode en 2023 et sa standardisation en 2026, chacune liée à sa source.

Chaque étape renvoie à sa source primaire.

Des scènes qui bougent

Dès l'automne 2023, des variantes dites « 4D » ont ajouté le temps : des gaussiennes qui se déplacent et se déforment d'une image à l'autre. 4DGS affichait déjà des scènes dynamiques à 82 images par seconde. En 2026, ces splats animés servent à diffuser de la vidéo volumétrique — une performance musicale filmée en splats 4D a ainsi été diffusée au printemps, visible dans un navigateur comme dans un casque.

Des fichiers dix fois plus légers

Une scène de l'article original pesait en moyenne 734 Mo. Les formats compressés ont changé la donne. SPZ, publié en open source par Niantic en 2024, fait passer une gaussienne de 236 octets à 64. SOG, le format ouvert de PlayCanvas, fait tenir une scène de 4 millions de gaussiennes en 42 Mo, au lieu d'environ 1 Go.

Un format standard

Début septembre 2026, l'extension glTF KHR_gaussian_splatting est passée au statut « ratifiée » auprès du Khronos Group, l'organisme qui gère glTF, souvent présenté comme le « JPEG de la 3D ». Cesium, Niantic, Esri, NVIDIA et Autodesk figurent parmi ses contributeurs. OpenUSD, le format de description de scènes né chez Pixar, a de son côté ajouté un schéma natif pour les splats en mars 2026. Une nuance : la compression n'est pas incluse dans l'extension ratifiée ; elle relève d'extensions séparées, encore à l'état de projet.

Sans entraînement

L'entraînement scène par scène n'est plus le seul chemin. Des modèles prédisent directement les gaussiennes à partir de quelques photos, en une fraction de seconde : pixelSplat dès 2023 avec deux images, AnySplat en 2025 à partir de photos dont on ignore la position, ou SHARP, d'Apple, à partir d'une seule image. Plus loin encore, des modèles génératifs de « mondes » comme Marble ou Atlas, de World Labs, produisent des scènes entières exportables en splats, sans aucune captation.

Sur un téléphone, dans un navigateur

En 2023, la visionneuse de référence réclamait une carte graphique dédiée. En 2026, un téléphone suffit. Sur un iPhone 13 Pro Max, dans un navigateur, le moteur WebGPU de PlayCanvas affiche 4 millions de gaussiennes à 42 images par seconde (en 642 × 1126 pixels). Spark 2.0 diffuse en streaming des mondes de plus de 100 millions de gaussiennes, et visionOS 27 les affiche nativement sur le casque d'Apple. Une nuance, là encore : sur le casque Quest de Meta, Hyperscape calcule le rendu sur les serveurs de Meta et le diffuse en streaming. Ce n'est pas du rendu local.

Avantages et inconvénients en 2026

Avantages

  • Réalisme : un rendu quasi photographique, y compris pour le feuillage, les cheveux, les reflets et les objets fins.
  • Vitesse : un affichage en temps réel, jusque sur un téléphone, dans un navigateur.
  • Captation accessible : pour beaucoup de sujets, quelques minutes de vidéo au smartphone suffisent.
  • Écosystème mûr : formats compressés, standard glTF ratifié, prise en charge par les principaux outils 3D.

Inconvénients

  • Pas de surface exploitable : un splat se mesure mal, se modifie difficilement, et ne se convertit en maillage qu'au prix de méthodes dédiées.
  • Pas de garantie métrique : l'échelle et la précision dépendent entièrement de la captation. C'est l'objet de notre article sur ce que garantit une captation iPhone, 360 ou LiDAR.
  • Éclairage figé : la lumière est « cuite » dans les couleurs. Changer l'éclairage d'une scène reste un sujet de recherche.
  • Artefacts : des gaussiennes flottantes (les floaters) dans les zones peu photographiées, et du flou dès qu'on s'éloigne trop des points de vue de la captation.
  • Poids brut : sans compression, une grande scène dépasse encore facilement le gigaoctet.

On lit souvent qu'il faut « 12 Go de mémoire graphique » ou « 1 Go par scène ». Les chiffres de l'article original sont différents : 734 Mo en moyenne par scène, et un pic de plus de 20 Go pendant l'entraînement avec le code de recherche. Les deux ont fondu depuis, grâce aux formats compressés et aux implémentations optimisées.

Créer et afficher un Gaussian splat

Pour capter une scène, un smartphone suffit souvent : on tourne lentement autour du sujet en le filmant ou en le photographiant, avec beaucoup de recouvrement entre les vues. Des applications comme Scaniverse entraînent même le splat directement sur le téléphone ; Polycam le fait dans le cloud. Pour un contrôle plus fin, des logiciels comme Postshot, LichtFeld Studio ou Brush entraînent sur un ordinateur, et SuperSplat permet de nettoyer et de retoucher le résultat dans un navigateur. Pour un panorama plus complet, voir notre article sur l'écosystème du Gaussian splatting. Chaque étape — captation, poses des caméras, entraînement, nettoyage, compression, publication — est détaillée, avec des poids de fichiers mesurés, dans le workflow de production du Gaussian splatting.

Côté formats, le PLY reste la sortie brute universelle ; SPZ et SOG sont les formats compressés les plus répandus ; et glTF, avec l'extension KHR_gaussian_splatting, devient le format d'échange standard.

C'est à ce stade que commence notre propre travail. Tout ce que construit ARGO tourne dans le navigateur, sans application à installer — et un splat bien compressé s'y prête désormais parfaitement : il s'ouvre sur le téléphone du visiteur, depuis un QR code ou un lien, avec le réalisme d'une photographie et la liberté de mouvement de la 3D.

FAQ

Questions fréquentes

Quelle est la différence entre le Gaussian splatting et la photogrammétrie ?

Les deux partent de photos et commencent par la même étape. La photogrammétrie en tire une surface, un maillage de triangles mesurable et modifiable, mais qui rend mal les détails fins et les reflets. Le Gaussian splatting en tire un nuage de gaussiennes, bien plus réaliste à l'œil, mais sans surface exploitable.

NeRF ou Gaussian splatting : lequel choisir ?

Pour afficher une scène en temps réel, le Gaussian splatting s'est imposé : dans l'article original, il s'affiche plus de 2 000 fois plus vite que le meilleur NeRF, pour une qualité comparable. Les NeRF restent utilisés en recherche et pour certains rendus hors ligne.

Peut-on créer un Gaussian splat avec un smartphone ?

Oui. Des applications comme Scaniverse ou Polycam produisent un splat à partir de photos ou d'une vidéo prises au téléphone. La qualité dépend surtout de la captation : une lumière stable, beaucoup de recouvrement entre les vues, et rien qui bouge dans la scène.

Quel format de fichier utiliser ?

Le PLY pour la sortie brute, SPZ ou SOG pour diffuser un fichier léger, et glTF avec KHR_gaussian_splatting pour échanger entre logiciels depuis sa ratification en 2026.

Peut-on prendre des mesures dans un Gaussian splat ?

Avec prudence. Un splat n'a pas de surface, et son échelle n'est juste que si la captation l'a fixée, par exemple avec un LiDAR ou des repères mesurés. Pour des mesures fiables, un maillage ou un nuage de points LiDAR reste préférable.

Peut-on convertir un Gaussian splat en maillage 3D ?

Oui, mais pas directement. Des méthodes spécialisées comme 2D Gaussian Splatting ou Gaussian Opacity Fields en extraient une surface, au prix d'une partie du réalisme qui faisait l'intérêt du splat.

Faut-il une carte graphique puissante ?

Pour regarder un splat, non : un téléphone récent suffit, y compris dans un navigateur. Pour l'entraîner, une carte graphique reste préférable, même si certaines applications le font désormais sur le téléphone.

Peut-on afficher un Gaussian splat sur un site web ou en réalité augmentée ?

Oui. Des moteurs WebGL et WebGPU affichent des splats de plusieurs millions de gaussiennes directement dans le navigateur, sans application, et le format glTF standardisé facilite leur intégration dans des expériences de réalité augmentée.


Sources et lectures complémentaires

Chiffres et statuts vérifiés en septembre 2026.

À lire aussi sur le Gaussian splatting