Web scraping · Open source

Aspirez n'importe quel site web.

Capturez le code source, l'arborescence complète et les assets d'un site — en contournant les protections anti-bot — puis exportez le tout en Markdown, JSON ou snapshot LLM.

Open-source Anti-détection intégrée Export Markdown · JSON · LLM
run_8f3k2a · terminé il y a 2 min
exemple.com/
  assets/
    style.css
    app.js
  pages/
    index.html
    contact.html
  index.html
index.mdMarkdown
llm-snapshot.txtSnapshot LLM
elements.jsonÉléments interactifs
Comment ça marche

Du site web au dossier exploitable en trois étapes.

Aucune configuration complexe. Un résultat propre et réutilisable en quelques minutes.

01

Configurer

Saisissez l'URL du site cible et le dossier de destination. Définissez éventuellement une limite de pages.

02

Aspirer & contourner

Le moteur Playwright + Crawlee parcourt le site en contournant les détections : stealth, bannières de cookies, stratégies d'attente.

03

Exporter

Téléchargez index.md, llm-snapshot.txt et elements.json — ou enregistrez l'arborescence complète dans le dossier de votre choix.

Capacités

Un moteur complet, un seul outil.

Quatre briques : aspiration, bouclier, extraction et API. Le tout, sans proxy ni script à maintenir.

LIVE

Aspiration complète

Arborescence, assets, réécriture des URLs : une copie fidèle et navigable du site.

exemple.com/ · 42 pages · 3,2 Mo
LIVE

Bouclier Stealth

Évasions de détection, rejet des bannières de cookies et stratégies d'attente pour passer sous les radars.

applyStealth(context) · cookie-dismisser · wait-strategies
LIVE

Extraction IA

Purification du DOM, tagging des éléments interactifs, sérialisation prête pour les modèles de langage.

index.md · llm-snapshot.txt · elements.json
LIVE

API REST

Lancez des aspirations en arrière-plan et suivez leur état via une API simple et robuste.

POST /api/scrape · GET /api/jobs · GET /api/health
Développeurs & IA

Pensé pour les développeurs et les agents IA.

Automatisez vos aspirations via l'API REST, ou nourrissez vos LLM avec les artefacts d'extraction.

API REST

Lancez un scraping asynchrone et suivez son état. Un seul endpoint, des artefacts JSON, une file bornée et un anti-SSRF intégré.

POST /api/scrape
curl -X POST http://localhost:2027/api/scrape \
  -H "Content-Type: application/json" \
  -d '{
    "url": "https://exemple.com",
    "folderName": "mon-site",
    "maxPages": 50
  }'
Réponse 202 · jobId + pollUrl Anti-SSRF · anti path-traversal

Artefacts LLM

Chaque aspiration produit des fichiers prêts à être consommés par un agent IA ou un pipeline de données.

artefacts générés
mon-site/
├── index.md          # contenu en Markdown
├── llm-snapshot.txt  # snapshot pour LLM
├── elements.json     # éléments interactifs
└── assets/           # fichiers statiques
Markdown propre JSON structuré Snapshot LLM
Tarifs

Payez pour ce que vous scrapez.

Commencez par un essai gratuit, puis montez en volume, en vitesse et en support.

Gratuit

Essai découverte.

€0/ mois

100 tokens/mois · 1 site · sans carte.

  • 1 site, une seule aspiration d'essai
  • 100 tokens offerts chaque mois (25 pages max par site)
  • Extraction Markdown · JSON · LLM
  • Résultats conservés 7 jours
  • Documentation en ligne (pas de support)
Essayer gratuitement

Scale

Pour les équipes.

€79/ mois

6 000 tokens/mois · 3 utilisateurs.

  • 6 000 tokens / mois
  • Sites illimités · 3 utilisateurs
  • Extraction accélérée
  • Résultats conservés 1 an
  • Support prioritaire (réponse < 24 h)
Choisir Scale

Essai gratuit sans carte · volume, API et support dès Starter — voir la tarification complète. — Voir la tarification.

FAQ

Questions, réponses.

Qu'est-ce que ScraperFlow ?

ScraperFlow aspire un site web entier — code source, arborescence et assets — tout en contournant les protections anti-bot. Il produit des artefacts réutilisables : Markdown, snapshot LLM et éléments interactifs en JSON.

Faut-il des compétences techniques ?

Non. L'interface web suffit : saisissez une URL et un dossier de destination, puis cliquez sur « Télécharger ». L'API REST est là si vous voulez automatiser.

Quels artefacts sont générés ?

Trois fichiers : index.md (contenu en Markdown), llm-snapshot.txt (snapshot optimisé pour les LLM) et elements.json (éléments interactifs structurés). L'arborescence et les assets sont conservés.

Comment le bouclier anti-détection fonctionne-t-il ?

Il combine stealth Playwright, rejet automatique des bannières de cookies et stratégies d'attente adaptées au framework du site pour réduire le risque de blocage.

Est-ce légal ?

Le scraping de contenu public est généralement légal, mais respectez toujours les conditions d'utilisation du site cible et les réglementations en vigueur (RGPD, droits d'auteur).

Est-ce gratuit ?

L'offre Gratuit est un essai découverte : 1 site, 3 pages, sans carte bancaire. Au-delà, les offres payantes débloquent le volume mensuel, l'API, une rétention plus longue et le support.

Le web a les données.
Vous avez le code source.

Lancez votre première aspiration en quelques secondes.