Qu'est-ce que le Gaussian splatting ?
Le Gaussian splatting — ou 3D Gaussian Splatting, souvent abrégé 3DGS — est une technique qui représente une scène en trois dimensions par des centaines de milliers, parfois des millions, de petites taches floues en forme d'ellipsoïdes : des gaussiennes. Chacune a une position, une forme, une couleur et une transparence ; ensemble, elles reproduisent une scène photographiée avec un réalisme quasi photographique, et s'affichent en temps réel.
La méthode a été présentée à SIGGRAPH 2023 par une équipe de l'Inria : Bernhard Kerbl, Georgios Kopanas et George Drettakis, de l'équipe GRAPHDECO de l'Inria et de l'Université Côte d'Azur, avec Thomas Leimkühler, de l'institut Max-Planck d'informatique. En trois ans, elle est passée du laboratoire aux moteurs de jeu, aux navigateurs web et à un standard international.
Le mot splatting vient de l'anglais splat, l'éclaboussure : chaque gaussienne est projetée sur l'écran comme une tache de peinture, dense en son centre et qui s'estompe vers les bords selon une courbe en cloche — la courbe de Gauss, qui lui donne son nom.
Une vraie scène, à faire tourner
2,2 Mo à télécharger
Faites glisser pour tourner · pincez, ou Ctrl (⌘) + molette, pour zoomer · au clavier : flèches, + et −
Scène : Steam Studio (steam-studio.jp), licence CC0 — 427 photos, entraînée avec Postshot.
Une scène en Gaussian splatting affichée en direct : un cactus en pot sur un socle, reconstruit à partir de 427 photos. On peut la faire tourner, zoomer, et rétrécir toutes les taches jusqu’à ce que la scène se défasse en milliers d’ellipses colorées.
Faites tourner la scène, puis faites glisser « Taille des taches » vers la gauche : chaque gaussienne rétrécit sans bouger, et l’objet se défait en milliers de taches colorées — les épines se révèlent être de longues ellipses très fines. En dessous d’environ 10 %, les taches deviennent plus petites qu’un pixel ; le moteur leur garde alors une taille minimale, comme la méthode de référence, et elles restent visibles comme des points. Le mode « Ellipsoïdes opaques » dessine chaque gaussienne suffisamment opaque comme une forme pleine, sans fondu : c’est la structure de la scène. Pour rester léger, ce rendu n’utilise que la couleur de base de chaque gaussienne (le degré 0 présenté plus bas), sans les reflets qui changent avec l’angle. Le moteur a été écrit pour cet article, en WebGL 2, sans bibliothèque.
Qu'est-ce que le Splatting Gaussien 3D ?
Une scène en Gaussian splatting n'a ni surface ni triangles. C'est un nuage de gaussiennes superposées et semi-transparentes, que l'on dessine de l'arrière vers l'avant. Là où elles sont nombreuses et opaques, on voit un objet ; là où elles sont rares, on voit au travers. C'est justement cette absence de surface qui lui permet de rendre ce que les maillages 3D classiques rendent mal : le feuillage, les cheveux, la fumée, les reflets, les objets très fins comme des épines ou des câbles.
Une gaussienne, qu'est-ce que c'est ?
Une gaussienne 3D est une tache floue en forme d'ellipsoïde, dont la densité décroît du centre vers les bords. Elle est entièrement décrite par une poignée de nombres :
- une position dans l'espace (3 nombres) ;
- un étirement le long de ses trois axes (3 nombres) et une rotation (4 nombres, sous forme de quaternion) — ensemble, ils forment ce que les chercheurs appellent la covariance, c'est-à-dire la forme et l'orientation de la tache ;
- une opacité (1 nombre) ;
- une couleur qui varie selon l'angle de vue (48 nombres ; on y revient plus bas).
Soit 59 nombres par gaussienne. Les scènes de l'article original en comptent entre un et cinq millions.
Une gaussienne, à la main
Coupe le long du premier axe : la courbe en cloche de Gauss
Faites glisser les poignées. Au clavier : flèches pour ajuster, Maj pour aller dix fois plus vite.
Une tache floue en forme d’ellipse, que l’on peut déplacer, étirer dans deux directions, faire pivoter et rendre plus ou moins opaque. En dessous, sa coupe le long du premier axe : une courbe en cloche.
Faites glisser les poignées ou utilisez les curseurs. La courbe du dessous est une coupe de la tache le long de son premier axe : c'est la courbe en cloche qui donne son nom à la méthode. En 3D s'ajoute un troisième axe, mais le principe ne change pas.
Pourquoi des taches plutôt que des triangles ?
Depuis des décennies, l'image de synthèse repose sur des triangles : une surface est découpée en facettes, et chaque facette est coloriée. C'est redoutablement efficace pour des objets aux contours nets, mais cela suppose une géométrie exacte, et tout ce qui n'a pas de surface bien définie — une chevelure, un nuage, une vitre sale — devient un casse-tête.
Une gaussienne ne prétend pas décrire une surface. Elle dit seulement : « il y a un peu de cette couleur, à peu près ici ». Parce qu'elle est floue, deux gaussiennes voisines se fondent l'une dans l'autre sans couture ; parce qu'elle peut s'étirer et pivoter, une seule gaussienne allongée suffit à dessiner un brin, une arête ou une épine. Et surtout, une tache floue varie en douceur : on sait calculer comment l'image change quand on la déplace un tout petit peu, ce qui permet de l'ajuster automatiquement. C'est tout l'intérêt de la méthode, comme on le verra avec l'entraînement.
Même budget, trois briques
La même photo reconstruite avec le même nombre de primitives : des pixels carrés, des triangles dégradés, des gaussiennes. Choisissez le budget ; sous chaque image, sa qualité mesurée (PSNR) et le nombre de valeurs qu’elle stocke.
À nombre égal, les gaussiennes restituent le plus de la photo, parce que chacune peut s’étirer, pivoter et se fondre dans ses voisines. Mais même nombre ne veut pas dire même poids : un pixel stocke 3 valeurs (sa couleur), un sommet de triangle 5 (sa position et sa couleur, partagées par les triangles voisins), une gaussienne en 2D 9 (position, deux étirements, rotation, couleur, opacité). Même à nombre de valeurs égal, les gaussiennes gardent l’avantage : 200 gaussiennes (1 800 valeurs) font mieux que 1 024 pixels (3 072 valeurs). Les triangles sont placés par l’algorithme glouton de Garland et Heckbert, qui ajoute à chaque tour le point le plus mal rendu, avec des couleurs de sommets ajustées au mieux ; les gaussiennes sortent du même ajustement que la figure sur l’entraînement, plus bas. PSNR : plus haut, c’est mieux.
D'où vient la couleur
Sur les 59 nombres d'une gaussienne, 48 servent à sa couleur. Ce n'est pas une couleur fixe, mais une fonction de la direction d'où on la regarde, codée par des harmoniques sphériques — une manière compacte de décrire une valeur qui varie tout autour d'une sphère. Une même gaussienne peut ainsi paraître claire vue de face et sombre vue de biais.
C'est ce mécanisme qui reproduit les reflets et les brillances. Une nuance compte : une gaussienne isolée n'affiche qu'une seule couleur à la fois, qui change avec l'angle. Le reflet qui glisse sur une surface naît de l'accord de milliers de gaussiennes voisines, dont chacune change de couleur à sa manière.
Une couleur qui dépend de l’angle
Une seule gaussienne affiche une seule couleur à la fois : celle de la direction d’où on la regarde.
- Anneau extérieur : la couleur réelle vue de chaque direction
- Anneau intérieur : ce que la gaussienne en garde
Le reflet n’existe que par l’accord de plusieurs gaussiennes voisines.
À gauche, une gaussienne et l’anneau de toutes les directions d’où on peut la regarder : l’anneau extérieur montre la couleur qu’aurait une surface brillante, l’anneau intérieur ce que la gaussienne sait en garder au degré choisi. À droite, seize gaussiennes le long d’une surface courbe éclairée : quand la caméra bouge, le reflet glisse de l’une à l’autre. Au degré 0, la couleur ne dépend plus de l’angle et le reflet disparaît.
Faites glisser sur les dessins ou utilisez les curseurs, puis changez de degré. Au degré 0, 3 nombres suffisent, mais la couleur est la même de partout : plus de reflet. Au degré 3, celui de la méthode de référence, 48 nombres dessinent un reflet net — avec, autour, de légères ondulations, la limite de ce que 16 fonctions par canal peuvent représenter. Figure en 2D : les directions de vue sont prises dans un plan.
Comparaison avec d'autres approches
Photogrammétrie
La photogrammétrie est la méthode historique pour numériser un objet ou un lieu à partir de photos. On retrouve la position des appareils, on calcule un nuage de points, puis on en tire un maillage de triangles recouvert d'une texture. Le résultat est une vraie surface, mesurable, que tous les logiciels 3D savent manipuler.
Ses faiblesses sont bien connues. Ce qui n'a pas de surface nette (ciel, feuillage, cheveux), ce qui est très fin (câbles, grillages, épines), ce qui reflète ou laisse passer la lumière (vitres, eau, métal poli) ressort troué, fondu ou déformé.
On oppose souvent photogrammétrie et Gaussian splatting. C'est en partie un faux débat : les deux partent de la même étape, qui consiste à retrouver la position des caméras et un nuage de points à partir des photos. Ce qui change, c'est ce que l'on construit ensuite — une surface dans un cas, un nuage de gaussiennes dans l'autre. Le splat gagne en réalisme visuel ; le maillage reste plus exploitable, puisqu'on peut le mesurer, le modifier, l'imprimer en 3D.
Mêmes photos, deux reconstructions
À observer
- De face, les épines du maillage paraissent nettes : elles sont peintes dans une texture de 8 192 pixels de côté, sur une surface lisse — comme une photo collée sur un ballon. Le splat, un peu plus doux, les dessine une à une, en relief, avec leur transparence.
- Sur le contour, l’illusion cesse : le maillage découpe le cactus en facettes, comme du papier plié, et perd le bout des épines ; le splat garde les épines qui dépassent — la vraie silhouette de la plante.
- Le bord du pot : les deux se superposent au pixel près, parce qu’ils viennent des mêmes photos et des mêmes positions de caméra.
Données : Steam Studio (steam-studio.jp), licence CC0 — maillage RealityCapture de 100 000 triangles, splat Postshot de 139 000 gaussiennes.
Le même cactus reconstruit à partir des mêmes 427 photos : à gauche en maillage texturé (photogrammétrie), à droite en Gaussian splatting, vus exactement du même point de vue. Un curseur déplace la séparation entre les deux.
Faites glisser la séparation. Le maillage compte 100 000 triangles et une texture de 8 192 × 8 192 pixels ; le splat, 139 000 gaussiennes. Ni l’un ni l’autre n’est « meilleur » : le maillage est une vraie surface, que l’on peut mesurer, modifier ou imprimer ; le splat restitue mieux ce qui n’a pas de surface nette. Pour cette comparaison, nous avons recalé le maillage sur le splat, puis rendu les deux images avec la même caméra.
NeRF
En 2020, les Neural Radiance Fields (NeRF) ont montré qu'un réseau de neurones pouvait apprendre une scène à partir de photos et en produire des vues nouvelles d'un réalisme alors inédit, reflets compris. La scène y est implicite : pour connaître la couleur d'un point, on interroge le réseau. Pour dessiner une seule image, il faut l'interroger des millions de fois, le long du rayon de chaque pixel. D'où une qualité remarquable, mais un rendu lent et un entraînement long.
Le Gaussian splatting garde l'idée d'apprendre la scène à partir des photos, mais remplace le réseau par un ensemble explicite de gaussiennes que l'on peut dessiner directement, comme on dessine des triangles. C'est ce qui le rend si rapide.
Ce que disent les chiffres de l'article original
L'article de 2023 compare les méthodes sur le jeu de données Mip-NeRF360, des scènes réelles photographiées à 360°. Le meilleur NeRF de l'époque, Mip-NeRF360, gardait un léger avantage sur l'une des trois mesures de qualité (27,69 dB de PSNR contre 27,21) et était devancé sur les deux autres. Mais il demandait 48 heures d'entraînement et s'affichait à 0,06 image par seconde. Le Gaussian splatting atteignait une qualité comparable en 41 minutes et s'affichait à 134 images par seconde, soit plus de 2 000 fois plus vite.
Ce que mesurait l’article original
Images par seconde (échelle logarithmique) · plus haut, c’est mieux
- Plenoxels 6,79
- Instant-NGP (base) 11,7
- Instant-NGP (grand) 9,43
- Mip-NeRF360 † 0,06
- Gaussian splatting (7 000 it.) 160
- Gaussian splatting (30 000 it.) 134
Durée d’entraînement (échelle logarithmique) · plus bas, c’est mieux
- Plenoxels 25 min 49 s
- Instant-NGP (base) 5 min 37 s
- Instant-NGP (grand) 7 min 30 s
- Mip-NeRF360 † 48 h
- Gaussian splatting (7 000 it.) 6 min 25 s
- Gaussian splatting (30 000 it.) 41 min 33 s
PSNR en décibels (axe tronqué entre 22 et 28 dB) · plus haut, c’est mieux
- Plenoxels 23,08
- Instant-NGP (base) 25,30
- Instant-NGP (grand) 25,59
- Mip-NeRF360 † 27,69
- Gaussian splatting (7 000 it.) 25,60
- Gaussian splatting (30 000 it.) 27,21
Voir le tableau complet
| Méthode | PSNR (dB) | SSIM | Entraînement | Images/s | Mémoire |
|---|---|---|---|---|---|
| Plenoxels | 23,08 | 0,626 | 25 min 49 s | 6,79 | 2,1 Go |
| Instant-NGP (base) | 25,30 | 0,671 | 5 min 37 s | 11,7 | 13 Mo |
| Instant-NGP (grand) | 25,59 | 0,699 | 7 min 30 s | 9,43 | 48 Mo |
| Mip-NeRF360 † | 27,69 | 0,792 | 48 h | 0,06 | 8,6 Mo |
| Gaussian splatting (7 000 it.) | 25,60 | 0,770 | 6 min 25 s | 160 | 523 Mo |
| Gaussian splatting (30 000 it.) | 27,21 | 0,815 | 41 min 33 s | 134 | 734 Mo |
Source : Kerbl et al., 2023, tableau 1, mesures sur une carte RTX A6000. † Valeurs de qualité reprises par les auteurs de l’article Mip-NeRF360.
Six méthodes comparées sur le jeu de données Mip-NeRF360 : vitesse d’affichage, temps d’entraînement et qualité d’image, d’après le tableau 1 de l’article de 2023.
La vitesse et le temps d'entraînement sont sur des échelles logarithmiques : sans elles, toutes les méthodes sauf une seraient écrasées contre zéro. Le prix de cette vitesse, c'est la mémoire — 734 Mo par scène pour le Gaussian splatting, contre 8,6 Mo pour Mip-NeRF360.
Comment ça fonctionne dans le détail
Structure à partir du mouvement
Tout commence par des photos de la scène, prises sous de nombreux angles. Un logiciel de structure from motion — historiquement COLMAP — repère dans ces photos des points communs, en déduit la position et l'orientation de chaque prise de vue, et reconstruit au passage un nuage de points clairsemé. Cette étape relève de la géométrie classique, pas de l'apprentissage automatique, et c'est souvent la plus longue et la plus fragile : de quelques minutes à plusieurs heures selon le nombre de photos, et parfois un échec pur et simple si la scène manque de texture ou si les photos se recouvrent mal.
Cette étape est en train de changer. Des modèles comme VGGT, meilleur article de la conférence CVPR 2025, estiment désormais caméras et géométrie en moins d'une seconde, et remplacent COLMAP dans un nombre croissant d'outils.
Des points aux gaussiennes
Chaque point du nuage devient une gaussienne. Sa position et sa couleur sont connues ; sa taille est fixée d'après la distance à ses plus proches voisins ; son opacité de départ est faible. À ce stade, la scène n'est qu'une ébauche grossière. Tout le travail qui suit consiste à l'affiner.
Entraînement : peindre par essais-erreurs
L'entraînement fonctionne comme un peintre qui corrige sa toile en la comparant sans cesse au modèle. À chaque itération, on prend une des photos, on dessine les gaussiennes depuis le même point de vue, et on mesure l'écart entre l'image obtenue et la photo. Puis on ajuste légèrement chaque paramètre de chaque gaussienne — position, forme, opacité, couleur — dans la direction qui réduit cet écart.
C'est de la descente de gradient, comme pour un réseau de neurones, mais sans réseau : ce sont les gaussiennes elles-mêmes que l'on optimise. L'écart mesuré combine une différence pixel à pixel (pour 80 %) et une mesure de ressemblance structurelle (pour 20 %). La méthode de référence enchaîne 30 000 itérations, soit une quarantaine de minutes sur une carte graphique professionnelle.
L’entraînement, itération par itération
La photo
Les gaussiennes
Chargement de l’entraînement…
Itération 6 000 · 1 600 gaussiennes · PSNR 31,4 dB
Photo : Steam Studio (steam-studio.jp), licence CC0.
À gauche, une photo de cactus. À droite, la même photo repeinte par des gaussiennes en deux dimensions, avec la boucle d’entraînement du Gaussian splatting : 256 taches posées au hasard sont comparées à la photo, corrigées, clonées, divisées et supprimées, itération après itération. Deux courbes suivent la qualité de l’image et le nombre de gaussiennes.
Faites défiler les itérations ou lancez la lecture. Au départ, 256 taches posées au hasard ; en quelques dizaines d’itérations, les couleurs s’installent. La densification clone et divise ensuite les gaussiennes là où l’écart reste fort — les épines, le bord du pot — jusqu’au plafond fixé ici à 1 600. À l’itération 1 500, l’opacité de toutes les gaussiennes est ramenée presque à zéro : l’image s’efface, puis se reconstruit en quelques centaines d’itérations. La méthode de référence le fait toutes les 3 000 itérations, pour purger les taches inutiles. L’affichage « Écart avec la photo » montre où l’image diffère encore du modèle : c’est là que l’optimisation pousse. Les règles sont celles de la méthode de référence, transposées en 2D (les seuils y sont exprimés en fraction de l’image) ; l’ajustement a été calculé à l’avance, et vous en voyez la rediffusion.
Densification : cloner, diviser, supprimer
Les points de départ ne suffisent jamais. Certaines zones manquent de gaussiennes ; d'autres n'en ont qu'une seule, trop grosse, là où il faudrait du détail. Toutes les 100 itérations, la méthode fait donc le ménage, en se fiant à un indicateur simple : l'ampleur du gradient, c'est-à-dire l'insistance avec laquelle l'optimisation cherche à déplacer une gaussienne.
Densification : cloner, diviser, supprimer
-
Étape 1 · Diagnostic
Là où l’image est fausse
Trois cas. Une petite gaussienne (bleue) borde un trou : l’optimisation la tire fort vers la zone vide, son gradient dépasse le seuil de 0,0002. Une grosse gaussienne floue (ambre) couvre un détail qu’elle ne peut pas rendre seule. Une troisième (sarcelle) est presque transparente et n’apporte rien.
-
Étape 2 · Cloner
Petite et au mauvais endroit : on la duplique
Une petite gaussienne au gradient élevé est copiée, et la copie est déplacée dans la direction du gradient, vers la zone sous-représentée.
-
Étape 3 · Diviser
Grande et floue : on la coupe en deux
Une grande gaussienne au gradient élevé est remplacée par deux gaussiennes placées au hasard à l’intérieur de l’ancienne, avec une taille divisée par 1,6.
-
Étape 4 · Supprimer
Presque transparente : on l’élimine
Une gaussienne dont l’opacité tombe sous 0,005 ne contribue plus à l’image. Elle est supprimée.
-
Étape 5 · Remettre à zéro
Toutes les 3 000 itérations, on recommence à douter
L’opacité de toutes les gaussiennes est ramenée presque à zéro. L’optimisation fait remonter celles qui comptent ; celles qui restent transparentes seront supprimées à leur tour.
Le détail à reproduire
Cinq étapes montrant comment la méthode ajoute des gaussiennes là où le détail manque et retire celles qui ne servent à rien.
Les règles et les seuils sont ceux de la méthode de référence ; les positions sont illustratives.
Ce mécanisme multiplie le nombre de gaussiennes au fil de l'entraînement, jusqu'à plusieurs millions pour une scène complète, tout en éliminant celles qui ne servent à rien.
Rasterisation gaussienne différentiable
Pour afficher la scène, il faut transformer ces millions d'ellipsoïdes en pixels, à chaque image. Le procédé tient en trois étapes :
- Projeter chaque gaussienne sur l'écran : un ellipsoïde en 3D devient une ellipse floue en 2D, dont la forme dépend de l'angle de vue et de la distance.
- Trier les gaussiennes de la plus proche à la plus lointaine. L'écran est découpé en tuiles de 16 × 16 pixels, et le tri se fait tuile par tuile, en parallèle sur la carte graphique.
- Fusionner, pour chaque pixel, de l'avant vers l'arrière : chaque gaussienne ajoute sa couleur en proportion de son opacité et de la lumière qui reste, jusqu'à ce que le pixel soit « plein ».
Trier, puis fusionner
Ce que voit la caméra, réduit à une ligne de pixels
Pour ce pixel : part de chaque gaussienne dans la couleur, puis la lumière qui reste
Avec tri : les gaussiennes sont fusionnées de la plus proche à la plus lointaine.
Vue de dessus de cinq gaussiennes lettrées de A à E et d’une caméra que l’on fait tourner autour. En dessous, l’image vue par la caméra, réduite à une ligne de pixels, puis la part de couleur apportée par chaque gaussienne à un pixel choisi.
Un monde réduit à deux dimensions et vu de dessus, pour que tout tienne dans une figure : l'image de la caméra n'est plus qu'une ligne de pixels. La projection, le tri et la fusion sont en revanche les vrais calculs du Gaussian splatting.
Ce rendu est dit différentiable : on sait calculer, pour chaque pixel, comment il changerait si l'on bougeait telle ou telle gaussienne. C'est précisément ce qui rend l'entraînement possible — le même moteur sert à afficher la scène et à l'apprendre.
Ce qui a changé depuis 2023
L'article original décrivait une technique prometteuse mais contraignante : des scènes figées, des fichiers de plusieurs centaines de mégaoctets, une carte graphique dédiée et un format que presque rien ne savait lire. Trois ans plus tard, presque chacune de ces limites a été levée.
Trois ans de Gaussian splatting
-
L’équipe de l’Inria présente le 3D Gaussian Splatting à SIGGRAPH : qualité d’un NeRF, affichage à 134 images par seconde.
-
4DGS ajoute le temps aux gaussiennes et affiche des scènes dynamiques à 82 images par seconde.
-
pixelSplat prédit directement des gaussiennes à partir de deux images, sans entraînement propre à la scène.
-
L’entraînement tient dans la poche
Scaniverse entraîne les splats directement sur le téléphone.
-
Niantic publie en open source le format SPZ : 64 octets par gaussienne au lieu de 236.
-
VGGT estime caméras et géométrie en moins d’une seconde et commence à remplacer COLMAP.
-
La méthode 3DGUT de NVIDIA, intégrée à la bibliothèque gsplat, gère objectifs fisheye et rayons secondaires.
-
World Labs rend Marble accessible à tous : des mondes créés à partir d’un texte ou d’une image, exportables en splats.
-
La version 26.03 d’OpenUSD ajoute un schéma natif pour les Gaussian splats.
-
Cent millions dans un navigateur
Spark 2.0 diffuse en streaming des mondes de plus de 100 millions de gaussiennes sur le web.
-
L’extension KHR_gaussian_splatting est ratifiée par le Khronos Group.
Les étapes marquantes entre la publication de la méthode en 2023 et sa standardisation en 2026, chacune liée à sa source.
Chaque étape renvoie à sa source primaire.
Des scènes qui bougent
Dès l'automne 2023, des variantes dites « 4D » ont ajouté le temps : des gaussiennes qui se déplacent et se déforment d'une image à l'autre. 4DGS affichait déjà des scènes dynamiques à 82 images par seconde. En 2026, ces splats animés servent à diffuser de la vidéo volumétrique — une performance musicale filmée en splats 4D a ainsi été diffusée au printemps, visible dans un navigateur comme dans un casque.
Des fichiers dix fois plus légers
Une scène de l'article original pesait en moyenne 734 Mo. Les formats compressés ont changé la donne. SPZ, publié en open source par Niantic en 2024, fait passer une gaussienne de 236 octets à 64. SOG, le format ouvert de PlayCanvas, fait tenir une scène de 4 millions de gaussiennes en 42 Mo, au lieu d'environ 1 Go.
Un format standard
Début septembre 2026, l'extension glTF KHR_gaussian_splatting est passée au statut « ratifiée » auprès du Khronos Group, l'organisme qui gère glTF, souvent présenté comme le « JPEG de la 3D ». Cesium, Niantic, Esri, NVIDIA et Autodesk figurent parmi ses contributeurs. OpenUSD, le format de description de scènes né chez Pixar, a de son côté ajouté un schéma natif pour les splats en mars 2026. Une nuance : la compression n'est pas incluse dans l'extension ratifiée ; elle relève d'extensions séparées, encore à l'état de projet.
Sans entraînement
L'entraînement scène par scène n'est plus le seul chemin. Des modèles prédisent directement les gaussiennes à partir de quelques photos, en une fraction de seconde : pixelSplat dès 2023 avec deux images, AnySplat en 2025 à partir de photos dont on ignore la position, ou SHARP, d'Apple, à partir d'une seule image. Plus loin encore, des modèles génératifs de « mondes » comme Marble ou Atlas, de World Labs, produisent des scènes entières exportables en splats, sans aucune captation.
Sur un téléphone, dans un navigateur
En 2023, la visionneuse de référence réclamait une carte graphique dédiée. En 2026, un téléphone suffit. Sur un iPhone 13 Pro Max, dans un navigateur, le moteur WebGPU de PlayCanvas affiche 4 millions de gaussiennes à 42 images par seconde (en 642 × 1126 pixels). Spark 2.0 diffuse en streaming des mondes de plus de 100 millions de gaussiennes, et visionOS 27 les affiche nativement sur le casque d'Apple. Une nuance, là encore : sur le casque Quest de Meta, Hyperscape calcule le rendu sur les serveurs de Meta et le diffuse en streaming. Ce n'est pas du rendu local.
Avantages et inconvénients en 2026
Avantages
- Réalisme : un rendu quasi photographique, y compris pour le feuillage, les cheveux, les reflets et les objets fins.
- Vitesse : un affichage en temps réel, jusque sur un téléphone, dans un navigateur.
- Captation accessible : pour beaucoup de sujets, quelques minutes de vidéo au smartphone suffisent.
- Écosystème mûr : formats compressés, standard glTF ratifié, prise en charge par les principaux outils 3D.
Inconvénients
- Pas de surface exploitable : un splat se mesure mal, se modifie difficilement, et ne se convertit en maillage qu'au prix de méthodes dédiées.
- Pas de garantie métrique : l'échelle et la précision dépendent entièrement de la captation. C'est l'objet de notre article sur ce que garantit une captation iPhone, 360 ou LiDAR.
- Éclairage figé : la lumière est « cuite » dans les couleurs. Changer l'éclairage d'une scène reste un sujet de recherche.
- Artefacts : des gaussiennes flottantes (les floaters) dans les zones peu photographiées, et du flou dès qu'on s'éloigne trop des points de vue de la captation.
- Poids brut : sans compression, une grande scène dépasse encore facilement le gigaoctet.
On lit souvent qu'il faut « 12 Go de mémoire graphique » ou « 1 Go par scène ». Les chiffres de l'article original sont différents : 734 Mo en moyenne par scène, et un pic de plus de 20 Go pendant l'entraînement avec le code de recherche. Les deux ont fondu depuis, grâce aux formats compressés et aux implémentations optimisées.
Créer et afficher un Gaussian splat
Pour capter une scène, un smartphone suffit souvent : on tourne lentement autour du sujet en le filmant ou en le photographiant, avec beaucoup de recouvrement entre les vues. Des applications comme Scaniverse entraînent même le splat directement sur le téléphone ; Polycam le fait dans le cloud. Pour un contrôle plus fin, des logiciels comme Postshot, LichtFeld Studio ou Brush entraînent sur un ordinateur, et SuperSplat permet de nettoyer et de retoucher le résultat dans un navigateur. Pour un panorama plus complet, voir notre article sur l'écosystème du Gaussian splatting. Chaque étape — captation, poses des caméras, entraînement, nettoyage, compression, publication — est détaillée, avec des poids de fichiers mesurés, dans le workflow de production du Gaussian splatting.
Côté formats, le PLY reste la sortie brute universelle ; SPZ et SOG sont les formats compressés les plus répandus ; et glTF, avec l'extension KHR_gaussian_splatting, devient le format d'échange standard.
C'est à ce stade que commence notre propre travail. Tout ce que construit ARGO tourne dans le navigateur, sans application à installer — et un splat bien compressé s'y prête désormais parfaitement : il s'ouvre sur le téléphone du visiteur, depuis un QR code ou un lien, avec le réalisme d'une photographie et la liberté de mouvement de la 3D.
FAQ
Questions fréquentes
Sources et lectures complémentaires
- Kerbl, Kopanas, Leimkühler, Drettakis, 3D Gaussian Splatting for Real-Time Radiance Field Rendering, ACM Transactions on Graphics 42(4), SIGGRAPH 2023 — arXiv:2308.04079 · page du projet, Inria
- Dylan Ebert, Introduction to 3D Gaussian Splatting, Hugging Face, 2023 — huggingface.co
- Aras Pranckevičius, Gaussian Splatting is pretty cool!, 2023 — aras-p.info
- Trois synthèses de la recherche : Chen et Wang, arXiv:2401.03890 · Fei et al., arXiv:2402.07181 · Wu et al., arXiv:2403.11134
- Khronos Group, spécification KHR_gaussian_splatting
- Niantic, format SPZ · PlayCanvas, format SOG et mesures WebGPU sur mobile · World Labs, Spark 2.0
Chiffres et statuts vérifiés en septembre 2026.