Pipeline data & LLM
50 000 œuvres agrégées, nettoyées et publiées pour 5,51 $.
- Client
- Place de marché d'enchères d'art
- Secteur
- E-commerce · marché de l'art
- Durée
- mai – juin 2026
Le problème
Une place de marché spécialisée dans les ventes aux enchères d'art voulait agréger le catalogue de plusieurs sources externes. Chacune avait sa structure, ses doublons, ses champs manquants, et des protections anti-robot différentes. Un nettoyage manuel à cette échelle était impensable — et un nettoyage par IA au tarif catalogue aurait coûté plus cher que la valeur ajoutée.
L'architecture
- 01
Collecte
sources protégées, reprise sur incident
- 02
GPT-4o-mini
nettoyage idempotent
- 03
Pipeline images
8 formats par œuvre
- 04
GPT-4o vision
alt texts + biographies
- 05
EC2 + RDS
stockage et monitoring
Collecte sur des sources protégées
Les sources n'étaient pas ouvertes : systèmes d'abonnement, protections anti-robot de niveau entreprise, et pour certaines un cycle de vie de vente à suivre dans le temps plutôt qu'un simple instantané. Chaque collecteur gère ses propres points de reprise : une exécution interrompue redémarre au dernier lot validé, elle ne repart jamais de zéro.
- Suivi du cycle de vie des ventes, d'un état en attente jusqu'à l'état finalisé
- Points de reprise à chaque lot, monitoring et journalisation des échecs
- Aucune source n'est nommée publiquement, par respect du cadre contractuel
Le nettoyage par LLM, rendu économiquement viable
Nettoyer les titres, classer les médiums, analyser les dimensions et les signatures : le travail est simple unitairement et ingérable à 64 602 exemplaires. Le pipeline découpe les fiches en lots, applique des prompts spécialisés par tâche, et bascule sur le modèle le plus léger capable de tenir la qualité attendue. Résultat : 5,51 $ de tokens au total, avec un marqueur d'idempotence qui empêche toute reconsommation de budget.
Un pipeline d'images pensé pour le SEO
Migration du stockage vers un hébergement mutualisé, puis génération de huit formats par œuvre en AVIF et WebP — 400 px, 800 px, 1 200 px, vignette et original — avec un nommage dynamique orienté référencement du type artiste-titre_800w.avif. Un bug de préfixe de taxonomie a été corrigé au passage : le préfixe n'est appliqué que sur la bonne catégorie de nomenclature, pas sur l'ensemble du catalogue.
Enrichissement éditorial à grande échelle
253 000 textes alternatifs générés par un modèle de vision, à raison d'environ 3 000 par nuit sur un créneau planifié à 2 h UTC pour ne jamais concurrencer le trafic réel. 11 301 biographies d'artistes réécrites pour le référencement en cinq langues : français, anglais, allemand, italien, espagnol. Structures JSON-LD Person et Artist, HTML5 sémantique, accordéons sur mobile.
Une livraison qu'on peut reprendre sans moi
Tout est parti sur GitHub avec un README, un runbook d'exploitation et le schéma de base de données. Six bugs ont été identifiés et corrigés avant le push final. C'est la partie du travail qu'on ne voit pas dans une démo mais qui décide si le client est autonome ou dépendant.
Stack
- Python
- AWS EC2
- AWS RDS MySQL
- GPT-4o-mini
- GPT-4o vision
- ScrapFly
- Playwright
- BeautifulSoup
- JSON-LD
Le résultat
50 000
œuvres agrégées et publiées
64 602
fiches nettoyées par IA pour 5,51 $ au total
253 000
textes alternatifs générés, environ 3 000 par nuit
11 301
biographies réécrites en SEO sur cinq langues
Un projet similaire ?
Je lis chaque message moi-même et je réponds sous 24 h. Pas de devis automatique, pas de formulaire qui part dans le vide.
Démarrer un projetAutres projets
Tableau de bord de direction
Le dirigeant pilotait 4,5 M€ depuis des fichiers Excel.
Lire l'étude de casProspection commerciale autonome
Un pipeline commercial qui tourne sans personne dedans.
Lire l'étude de casAutomatisation n8n
Des SMS d'anniversaire qui partent sans que personne y pense.
Lire l'étude de cas