Des flux de données publiques, maintenus en vie.
Quand Apify, Octoparse ou un script écrit par ChatGPT se fait bloquer et renvoie des pages vides, je reprends l'extraction et je la maintiens en vie.
Deux minutes. Envoyez l'URL publique et les champs qu'il vous faut. Je réponds avec ce qui est extractible, comment, et à quel prix.
Offres
Commencez par un audit. Passez à un flux maintenu.
Quatre portes d'entrée, d'une vérification sans risque à un flux que je maintiens en vie.
Audit d'API cachée
Voir le détail →J'examine un site public, j'identifie la voie d'accès la plus propre et je vous envoie une cinquantaine de lignes d'échantillon réelles. Le point de départ sans risque.
Scraper ponctuel
Voir le détail →Un scraper robuste pour une source publique, livré en code testé qui vous appartient. Sortie propre CSV, JSON ou API.
Flux de données géré
Voir le détail →Scraper, livraison planifiée et monitoring. La source change, ça casse, je répare, souvent avant que vous le remarquiez.
Bot Discord
Voir le détail →Un bot sur mesure pour votre communauté : automatisations, requêtes de données publiques, posts planifiés. Construit et hébergé.
D'un scraper bloqué à un flux sur lequel compter.
Audit
J'examine la source publique et j'identifie la voie d'extraction la plus fiable, une API cachée quand elle existe.
Construction
Un scraper testé qui gère les pages publiques riches en JavaScript ou protégées par Cloudflare, avec une sortie propre.
Planification & monitoring
Livraison à votre cadence, avec surveillance. Quand la source change et que ça casse, je répare.
Vous exploitez & possédez
Vous faites tourner l'outil et possédez les données. Je le construis et je le maintiens : un outil, pas un service d'exploitation.
Le livrable
Un jeu de données vérifiable, pas une promesse.
Une sortie réelle du starter open source qui équipe l'offre Flux de données géré, exécuté sur un catalogue public de test. Exactement la forme de ce qui arrive dans votre boîte mail ou votre base.
| title | price | availability | rating | source |
|---|---|---|---|---|
| A Light in the Attic | £51.77 | In stock | Three | books.toscrape.com |
| Tipping the Velvet | £53.74 | In stock | One | books.toscrape.com |
| Soumission | £50.10 | In stock | One | books.toscrape.com |
| Sharp Objects | £47.82 | In stock | Four | books.toscrape.com |
| Sapiens: A Brief History of Humankind | £54.23 | In stock | Five | books.toscrape.com |
Votre flux porte vos champs et rien d'autre : les colonnes demandées, dans le format demandé.
Périmètre
De la fiabilité, pas du contournement.
- Pages publiques, hors connexion uniquement. Données factuelles et business : prix, specs, stocks, annonces, données de marché, horaires. Pas de comptes, pas de paywalls.
- Aucune donnée personnelle. Strictement non-PII. Pas de noms avec contacts, de profils ou de photos. Données B2B et factuelles uniquement.
- robots.txt et limites de débit respectés. Les pages sont lues comme le ferait un visiteur normal, à un rythme respectueux. La sortie est structurée et transformée.
- Vous exploitez et possédez les données. Je construis et maintiens l'outil, vous l'exploitez et contrôlez les données. Une passation propre et documentée, à chaque fois.
Typiquement dans le périmètre
Preuves
Open source, testé, exécutable.
Pas un slide deck. Du vrai code à lire, cloner et lancer : les 20 % difficiles du scraping où les outils no-code échouent.
id: books-demo source: books.toscrape.com fields: [title, price, availability, rating] rate_limit_seconds: 1.5 urls: ["https://books.toscrape.com/catalogue/page-1.html"] schedule: interval_seconds: 30 output: kind: csv path: data/books-demo.csv
managed-data-feed-starter
L'offre Flux de données géré, en code : fetch résilient, politique no-PII, planification, monitoring auto-réparant, sortie CSV / JSON / webhook.
Voir sur GitHub →hidden-api-extraction-template
Lire directement l'API JSON interne d'un site au lieu de parser un HTML fragile : plus rapide, et bien plus stable.
Voir sur GitHub →tls-fingerprint-scraper-demo
Pourquoi une page publique revient vide : un contrôle d'empreinte TLS avant le rendu. Comment la lire comme un navigateur normal, en conformité.
Voir sur GitHub →Le pourquoi derrière le travail.
Pourquoi votre scraper no-code casse en boucle
Changements de layout, données rendues en JS, contrôles d'empreinte, et ce qui les corrige vraiment.
Lire le guide →Qu'est-ce qu'une API cachée
Les endpoints JSON internes derrière une page, et pourquoi les appeler bat le parsing HTML.
Lire le guide →Sites publics protégés par Cloudflare
Une page vide est le plus souvent un contrôle d'empreinte TLS plutôt qu'un CAPTCHA, et il existe une façon conforme de la lire.
Lire le guide →Demandez une étude de faisabilité gratuite
Indiquez-moi le site public et les données dont vous avez besoin. Je vous dis si c'est faisable, comment, et dans quelle langue.
Ou par e-mail : hello@feedsmith.net · Basé en Suisse · FR / DE / IT / EN.