Segmentation sémantique de la scène complète
Comment Shaip a réalisé une segmentation sémantique au niveau du pixel sur des scènes de rue complètes — étiquetant chaque objet et surface, des routes et du ciel aux marquages routiers et aux poteaux fins — constituant ainsi un ensemble de données de qualité professionnelle pour la conduite autonome, les villes intelligentes et l'IA environnementale.
Résumé du projet
Alors que la compréhension des scènes devient le fondement de la conduite autonome, de la planification des villes intelligentes et de l'IA de surveillance environnementale, le client avait besoin d'un pipeline de segmentation complet capable d'étiqueter chaque pixel de l'image, et pas seulement les cadres de délimitation ou les objets principaux.
Shaip a construit le pipeline d'annotation de bout en bout au niveau du pixel, couvrant les outils de masques polygonaux et sémantiques, une couverture de classe complète, une gestion des limites de précision des bords et une assurance qualité à deux niveaux, produisant des ensembles de données prêts pour le modèle pour une IA de compréhension de scène complète.
Principales statistiques
Précision des pixels
99 %
Niveaux d'assurance qualité
2-Tier
Territoire desservi
Chaque pixel
Ensemble de classes
Base de connaissances complète
Défis
- Étiquetage chaque pixel Dans l'image, aucune zone non étiquetée n'est autorisée.
- Traçant limites irrégulières des couverts végétaux, des surfaces d'eau et des fissures de la chaussée
- Distinguer Marquages routiers provenant de la surface de la chaussée en état usé ou décoloré
- Séparer ciel à travers le brouillard ou des arrière-plans couverts avec précision
- Maintenir frontières de classe nettes aux transitions route-trottoir, végétation-sol, eau-terre
Solution
Ensemble de classes complet
L'annotation couvrait l'ensemble des catégories de scènes : chaussées, ciel, végétation, sols et reliefs, plans d'eau, poteaux et panneaux de signalisation, marquages routiers (lignes de voie, flèches, passages piétons), véhicules (voitures, camions, bus, motos, vélos), bâtiments et constructions humaines. Chaque pixel était associé à l'une des classes définies.
Outils de masquage polygonal et sémantique
Les annotateurs ont utilisé des outils polygonaux spécialisés et des pinceaux de masquage sémantique pour traiter avec une précision au pixel près les contours des objets courbes, irréguliers et denses. Le choix de l'outil était adapté à la complexité de la forme de l'objet : des masques pour les formes organiques comme la végétation, des polygones pour les objets structurés comme les véhicules.
Directives de précision des bords
Des définitions de classes strictes et des directives précises concernant la précision des contours ont été appliquées afin de garantir des limites nettes entre les classes adjacentes, notamment dans les zones de transition telles que les limites entre la route et le trottoir, entre la végétation et le sol, et entre l'eau et la surface. C'est cette précision qui assure la fiabilité des modèles de détection de la chaussée et des obstacles utilisés en aval.
Manipulation de la structure fine
Les éléments fins tels que les poteaux, les panneaux de signalisation et les indicateurs n'occupent que quelques pixels sur les images grand angle, mais sont essentiels pour l'intelligence artificielle en aval. Les annotateurs ont suivi des directives précises afin de capturer ces détails fins sans compromettre la précision des contours de la scène dans son ensemble.
Contrôle qualité à deux niveaux et précision des pixels à 99 %
Chaque image segmentée a été soumise à un processus d'assurance qualité rigoureux en deux étapes : vérification de la cohérence entre les annotateurs, contrôle de la précision des contours et validation des limites de classe. Un seuil de précision minimal de 99 % au niveau du pixel a été imposé pour chaque jeu de données avant sa livraison.
Description du projet
| Type de jeu de données | Territoire desservi | Outils d'annotation | Ensemble de classes | QA | Exactitude |
|---|---|---|---|---|---|
| Segmentation sémantique de la scène complète | Chaque pixel étiqueté | Polygones + masques sémantiques | classes de scène complètes | Contrôle qualité à 2 niveaux | 99 % au niveau du pixel |
Les résultats
- Établi un pipeline de compréhension de scène au niveau pixel pour les véhicules autonomes et l'IA des villes intelligentes
- Normalisé couverture complète des cours avec chaque pixel étiqueté
- Livré transitions nettes entre les limites de classe dans les zones complexes
- facile Précision de 99 % au niveau du pixel via une assurance qualité à deux niveaux
- Activé le client zone carrossable, planification urbaine, surveillance environnementale et suivi des travaux de construction AI
Globalement, Shaip a contribué à transformer une exigence de compréhension de scène au niveau du pixel en un pipeline de segmentation structuré et prêt pour la production, capable de prendre en charge la conduite autonome, l'analyse des villes intelligentes, la surveillance environnementale et l'IA de suivi de l'avancement des chantiers de construction avec une précision d'étiquetage de scène complète.
Shaip nous a aidés à transformer notre évaluation subjective de la qualité audio en un programme d'amélioration mesurable. Son cadre d'évaluation nous a clairement indiqué les points à corriger, les axes d'amélioration et la manière d'aborder la production avec confiance.
— Responsable produit IA vocale