Annotation de boîtes englobantes LiDAR 3D pour la conduite autonome
Comment Shaip a fourni une annotation précise de boîtes englobantes cuboïdes 3D sur 14 classes d'objets avec environ 53 boîtes par image sur des données de nuage de points à image unique — calibrées par rapport à l'imagerie 2D pour la perception des véhicules autonomes à l'échelle de la production.
Résumé du projet
À mesure que la perception de la conduite autonome se dirige vers un déploiement en production, le client avait besoin d'un pipeline d'annotation LiDAR 3D hautement spécialisé, capable de placer des boîtes englobantes cuboïdes précises à la densité requise pour les données d'entraînement réelles des véhicules autonomes, avec un étiquetage multi-attributs et un étalonnage d'image 2D.
Shaip a construit le pipeline d'annotation de bout en bout couvrant le placement de cuboïdes 3D, l'application de la taille par défaut, l'étiquetage multi-attributs, la gestion des cas limites environnementaux et la validation d'images de référence, fournissant des ensembles de données de perception AV prêts pour le modèle à travers 14 classes d'objets.
État clé
Classes d'objets
14
Boîtes par cadre
~ 53
Couches d'attributs
5
Niveaux d'occlusion
4
Défis
- Système de ~53 boîtes cuboïdes 3D par image avec un ajustement précis aux bords du nuage de points
- Manipulation 14 classes d'objets à travers les véhicules, les piétons, les animaux et les objets mobiles
- Working : un espace de travail commun simultanément avec des images d'étalonnage 2D et un nuage de points 3D données,
- Gérant nuages de points fantômes, reflets au sol, brouillard, brume et éclaboussures d'eau
- Faire respecter dimensions par défaut par classe pour une cohérence inter-cadres
Solution
Flux de travail de placement de cuboïdes 3D
Des annotateurs ont placé des boîtes englobantes 3D précises (cuboïdes) sur les données de nuages de points d'une seule image, simultanément à une image de référence d'étalonnage 2D. Chaque classe était associée à des dimensions de boîte englobante par défaut définies afin de garantir une cohérence de taille entre les images : voitures de 3.4 à 5.1 m, camions de 3.4 à 14 m et piétons de 0.4 à 1.2 m de large.
Étiquetage multi-attributs
Au-delà du placement de la boîte englobante, chaque objet annoté a reçu des étiquettes d'attributs couvrant l'état du véhicule (en marche/stationné), l'état du véhicule à deux roues (avec/sans conducteur), l'état du piéton (debout/assis/couché), l'état d'occlusion (4 niveaux : aucune, partielle, la plupart, totale) et l'état des extrémités (objets saillants, portes ouvertes, équipements attachés).
Gestion des cas limites environnementaux
Des règles strictes encadraient l'annotation des objets fortement occultés ou éloignés, des nuages de points fantômes dus à un mauvais étalonnage des deux LiDAR, des réflexions au sol et du bruit ambiant provenant des éclaboussures d'eau, du brouillard et de la brume. Les rétroviseurs latéraux, les portes ouvertes, les bras de grue, les barres de toit et les bagages des piétons étaient explicitement exclus ; les sirènes d'urgence et les conteneurs de benne de camion étaient inclus.
Validation de l'ajustement serré
Les boîtes devaient épouser parfaitement les contours du nuage de points, avec des espaces visibles minimaux. L'orientation a été vérifiée à l'aide de données d'étalonnage et du contexte de la voie lorsque les nuages de points étaient ambigus. Les scènes nocturnes et pluvieuses ont été traitées de la même manière que les scènes diurnes afin d'assurer la cohérence des annotations.
QA intermodale
Toutes les annotations ont été validées par rapport à des images 2D de référence afin de vérifier leur dimensionnement et leur orientation. Ce contrôle qualité intermodal a permis de détecter des défauts d'alignement invisibles à partir du seul nuage de points, garantissant ainsi une précision optimale pour l'entraînement du modèle de perception des véhicules autonomes.
Description du projet
| Type de jeu de données | Cours | Boîtes/Cadre | Attributs | Niveaux d'occlusion | Validation |
|---|---|---|---|---|---|
| Perception 3D LiDAR AV | 14 | moyenne d'environ 53 | 5 couches d'attributs | 4 (0–100%) | Vérification croisée d'images 2D |
Les résultats
- Établi un pipeline d'annotation LiDAR 3D dense avec environ 53 boîtes par cadre à la précision de production
- Normalisé Ontologie d'objets à 14 classes avec application de la taille par défaut par classe
- Livré 5 couches d'attributs y compris la classification des occlusions à 4 niveaux
- Mis en œuvre QA intermodale validation de boîtes 3D par rapport à des images d'étalonnage 2D
- Activé le client perception des véhicules autonomes, ADAS et conduite autonome formation modèle
Globalement, Shaip a contribué à transformer une exigence complexe de perception LiDAR 3D en un pipeline d'annotation structuré et prêt pour la production, capable de prendre en charge le développement de la conduite autonome, des systèmes ADAS, des robotaxis et des camions autonomes avec une précision de niveau étalonnage dans des conditions réelles difficiles.
Shaip a géré les cas limites des systèmes de vision artificielle qui mettent à mal la plupart des chaînes de traitement d'annotation : brouillard, nuages de points fantômes, occlusion dense et environ 53 boîtes par image. Leur validation croisée 2D-3D nous a fourni des données d'entraînement perceptives fiables.
— Ingénieur en chef, Perception Stack