Périmètre sûr : ce guide s'applique uniquement à vos propres applications, à vos environnements de QA ou de préproduction, et aux sources pour lesquelles vous disposez d'une autorisation écrite. Il ne décrit ni l'automatisation de sites tiers, ni aucune technique destinée à échapper aux protections anti-automatisation.
La question n'est pas « lequel des deux est supérieur » mais « lequel remplace quelle partie de votre pipeline ». ScrapingBee remplace votre client HTTP, vos proxys et votre rendu navigateur ; CaptchaAI ne remplace qu'une brique, la résolution du défi CAPTCHA. Sans équipe pour gérer une infrastructure de collecte, le service managé est le raccourci. Si votre collecteur existe déjà et bute uniquement sur un reCAPTCHA v2 ou un Cloudflare Turnstile, une API de résolution suffit.
Ce que chaque outil couvre réellement
| Élément du pipeline | ScrapingBee | CaptchaAI |
|---|---|---|
| Client HTTP, retries, proxys | Gérés par le service | À votre charge |
| Rendu JavaScript | Inclus | Selenium, Playwright ou Puppeteer chez vous |
| reCAPTCHA v2 / v3 | Limité selon la page | Pris en charge |
| Turnstile, Cloudflare Challenge | Non documenté | Pris en charge |
| GeeTest v3, CAPTCHA image, grilles | Non documenté ou limité | Pris en charge |
| hCaptcha, FunCaptcha (Arkose Labs) | Non documenté | ❌ Pas encore pris en charge |
| Facturation | Par requête, en crédits | Par thread simultané, résolutions illimitées |
La colonne ScrapingBee reprend sa documentation publique ; revérifiez-la avant de trancher. Côté CaptchaAI, la ligne hCaptcha et FunCaptcha est volontairement honnête : ces types ne sont pas pris en charge, et GeeTest v4 est annoncé comme à venir. CaptchaFox (bêta), Friendly Captcha (bêta) et Lemin (bêta) restent en bêta, sans chiffres publiés.
Choisir ScrapingBee : quand le managé fait gagner du temps
Trois situations justifient l'outil tout-en-un : la collecte est marginale et le coût par requête reste indolore ; vous prototypez et voulez du HTML en une requête, sans flotte de navigateurs ; votre contrainte est le rendu JavaScript, pas le défi CAPTCHA.
Le corollaire est net : dès que le volume monte, la facturation à la requête domine le budget, et vous perdez la main sur les réglages fins — en-têtes, cookies de session, ordre des appels.
Choisir CaptchaAI : quand le défi CAPTCHA est le seul point bloquant
C'est le cas le plus fréquent là où un collecteur tourne déjà en production. Le crawler fonctionne, les proxys sont contractualisés, le parsing est écrit — seule la page de connexion affiche un défi. Remplacer toute la chaîne pour ce seul obstacle n'a pas de sens. Vous gardez le contrôle du navigateur, de la session et des délais, et vous payez une capacité plutôt qu'un volume :
import os
import requests
API_KEY = os.environ['CAPTCHAAI_KEY']
def submit_recaptcha_v2(sitekey: str, page_url: str) -> str:
payload = {
'clientKey': API_KEY,
'task': {
'type': 'NoCaptchaTaskProxyless',
'websiteURL': page_url,
'websiteKey': sitekey,
},
}
resp = requests.post('https://api.captchaai.com/createTask', json=payload, timeout=30)
resp.raise_for_status()
return resp.json()['taskId']
Ensuite, interrogez le résultat toutes les 5 secondes, injectez le token dans le champ g-recaptcha-response, puis soumettez le formulaire — voir le guide reCAPTCHA v2 via l'API et le guide Cloudflare Turnstile.
Le montage hybride, illustré par un cas réel
Une équipe QA basée à Lyon supervise le portail client d'un assureur, avec une préproduction hébergée chez OVHcloud. Le service managé lui suffit pour les pages publiques de son propre site — tarifs, mentions légales, fiches produit — puisqu'aucune session n'est nécessaire. Pour le parcours authentifié, qui affiche un Turnstile à la connexion, elle pilote Playwright depuis un worker dans la même région OVHcloud et appelle CaptchaAI seulement quand le défi apparaît.
Deux réflexes utiles ici. Si la collecte touche des données personnelles, appliquez la minimisation RGPD dès le collecteur. Et si vos workers tournent en Europe alors que la cible est ailleurs, mesurez la latence réseau avant d'accuser le temps de résolution.
Deux modèles de facturation qui ne se comparent pas ligne à ligne
ScrapingBee facture des crédits par requête, avec une consommation plus élevée quand le rendu JavaScript est activé. CaptchaAI facture des threads simultanés : un thread est un défi en cours de résolution, et chaque plan inclut des résolutions illimitées pour le mois.
La grille démarre à BASIC ($15/mois, 5 threads) et monte par paliers : STANDARD ($30/mois, 15 threads), ADVANCE ($90/mois, 50 threads), PREMIUM ($170/mois, 100 threads), jusqu'aux paliers VIP-1 à VIP-3 pour les volumes industriels. La facturation est en dollars US.
Le bon calcul n'est pas « combien coûte une résolution » mais « combien de défis simultanés absorber à l'heure de pointe ». Un pipeline nocturne de 20 000 pages avec 4 % de défis ne réclame pas le même dimensionnement qu'un test de charge concentré sur dix minutes.
Observabilité : ce qu'il faut tracer dès le premier jour
Instrumentez chaque appel de résolution : durée d'obtention du token, code retour HTTP, identifiant de tâche, taille de la file d'attente. Sans ces quatre signaux, un incident se diagnostique à l'aveugle. Corrélez les identifiants de tâche avec votre traçage distribué, par exemple OpenTelemetry, et alertez sur la dérive du temps de résolution médian : elle signale un changement côté cible avant que le taux de réussite ne se dégrade.
Liste de contrôle avant mise en production
-
Périmètre limité à vos propres applications ou à des sources autorisées par écrit.
-
Clé API CaptchaAI dans un secret CI ou un coffre, jamais dans le dépôt.
-
Durées d'appel et codes retour tracés à chaque exécution.
-
Retry idempotent avec backoff exponentiel borné, et threads dimensionnés sur le pic.
FAQ
Peut-on utiliser ScrapingBee et CaptchaAI dans le même pipeline ?
Oui, et c'est souvent le montage le plus économique. Routez les pages simples vers le service managé et réservez votre propre navigateur, plus l'API de résolution, aux parcours qui affichent un défi.
CaptchaAI prend-il en charge hCaptcha ou FunCaptcha ?
Non — ces deux types ne sont pas pris en charge, et GeeTest v4 est annoncé comme à venir. En revanche reCAPTCHA v2 et v3, Cloudflare Turnstile, Cloudflare Challenge, GeeTest v3 et les CAPTCHA image le sont : voir le démarrage rapide.
Combien de threads prévoir pour un crawl quotidien ?
Comptez les défis attendus pendant votre fenêtre la plus chargée et divisez par le débit unitaire du type concerné — Cloudflare Turnstile se résout en moins de 10 s, reCAPTCHA v2 en moins de 60 s. Mieux vaut démarrer sur un plan modeste et monter après une semaine de mesures réelles.
Le RGPD change-t-il selon l'outil retenu ?
Non : le responsable de traitement reste vous, quel que soit le prestataire. Minimisez les données collectées et vérifiez où sont hébergés vos logs.
Comment trancher avant de s'engager ?
Rejouez une semaine de trafic réel sur les deux montages en environnement de test, puis comparez coût projeté, temps de résolution médian et échecs à retenter. Les tests d'endpoint sur vos formulaires donnent une base stable.
Guides connexes
- Démarrage rapide CaptchaAI
- QA CAPTCHA en environnements autorisés
- Tester l'endpoint API sur vos formulaires
- Intégration CAPTCHA en CI
- Résoudre reCAPTCHA v2 via API
- Résoudre Cloudflare Turnstile via API
Mesurez vos propres temps de résolution avant d'arbitrer entre les deux approches. – Obtenez votre clé CaptchaAI.