Des flux de données publiques, maintenus en vie.

Quand Apify, Octoparse ou un script écrit par ChatGPT se fait bloquer et renvoie des pages vides, je reprends l'extraction et je la maintiens en vie.

Deux minutes. Envoyez l'URL publique et les champs qu'il vous faut. Je réponds avec ce qui est extractible, comment, et à quel prix.

web public brut → flux structuré en direct
title price availability rating source fetched_at 0000 lignes livrées

Offres

Commencez par un audit. Passez à un flux maintenu.

Quatre portes d'entrée, d'une vérification sans risque à un flux que je maintiens en vie.

Audit d'API cachée

Voir le détail

J'examine un site public, j'identifie la voie d'accès la plus propre et je vous envoie une cinquantaine de lignes d'échantillon réelles. Le point de départ sans risque.

150 €forfait

Scraper ponctuel

Voir le détail

Un scraper robuste pour une source publique, livré en code testé qui vous appartient. Sortie propre CSV, JSON ou API.

600 ۈ 1 500, une fois

Flux de données géré

Voir le détail

Scraper, livraison planifiée et monitoring. La source change, ça casse, je répare, souvent avant que vous le remarquiez.

500 €installation, puis 150 à 500 € / mois

Bot Discord

Voir le détail

Un bot sur mesure pour votre communauté : automatisations, requêtes de données publiques, posts planifiés. Construit et hébergé.

500 €à 2 500, plus hébergement

D'un scraper bloqué à un flux sur lequel compter.

1

Audit

J'examine la source publique et j'identifie la voie d'extraction la plus fiable, une API cachée quand elle existe.

2

Construction

Un scraper testé qui gère les pages publiques riches en JavaScript ou protégées par Cloudflare, avec une sortie propre.

3

Planification & monitoring

Livraison à votre cadence, avec surveillance. Quand la source change et que ça casse, je répare.

4

Vous exploitez & possédez

Vous faites tourner l'outil et possédez les données. Je le construis et je le maintiens : un outil, pas un service d'exploitation.

Le livrable

Un jeu de données vérifiable, pas une promesse.

Une sortie réelle du starter open source qui équipe l'offre Flux de données géré, exécuté sur un catalogue public de test. Exactement la forme de ce qui arrive dans votre boîte mail ou votre base.

books-demo.csv · run 2026-06-17 21:05 UTCCSV
title price availability rating source
A Light in the Attic£51.77In stockThreebooks.toscrape.com
Tipping the Velvet£53.74In stockOnebooks.toscrape.com
Soumission£50.10In stockOnebooks.toscrape.com
Sharp Objects£47.82In stockFourbooks.toscrape.com
Sapiens: A Brief History of Humankind£54.23In stockFivebooks.toscrape.com
Source publique de test. Champs factuels, non personnels. Une ligne par produit, une colonne par champ, avec l'horodatage de collecte conservé.

Votre flux porte vos champs et rien d'autre : les colonnes demandées, dans le format demandé.

Périmètre

De la fiabilité, pas du contournement.

  • Pages publiques, hors connexion uniquement. Données factuelles et business : prix, specs, stocks, annonces, données de marché, horaires. Pas de comptes, pas de paywalls.
  • Aucune donnée personnelle. Strictement non-PII. Pas de noms avec contacts, de profils ou de photos. Données B2B et factuelles uniquement.
  • robots.txt et limites de débit respectés. Les pages sont lues comme le ferait un visiteur normal, à un rythme respectueux. La sortie est structurée et transformée.
  • Vous exploitez et possédez les données. Je construis et maintiens l'outil, vous l'exploitez et contrôlez les données. Une passation propre et documentée, à chaque fois.

Typiquement dans le périmètre

Prix produits, specs, stockse-commerce
Annonces (prix, surface, localisation)immobilier
Données catalogue et marketplacemarketplace
Données de marché, horaires, prixvoyage · finance
Feedsmith construit un outil de lecture de données publiques et factuelles. Il ne sert pas à accéder à des comptes, des paywalls ou des données personnelles. Vous restez l'exploitant et le propriétaire des données, et confirmez votre droit d'accès à la source.

Preuves

Open source, testé, exécutable.

Pas un slide deck. Du vrai code à lire, cloner et lancer : les 20 % difficiles du scraping où les outils no-code échouent.

feeds/books_demo.yamlconfig
id: books-demo
source: books.toscrape.com
fields: [title, price, availability, rating]
rate_limit_seconds: 1.5
urls: ["https://books.toscrape.com/catalogue/page-1.html"]
schedule:
  interval_seconds: 30
output:
  kind: csv
  path: data/books-demo.csv
Un flux, un fichier. C'est toute la configuration derrière l'échantillon ci-dessus.
starter

managed-data-feed-starter

L'offre Flux de données géré, en code : fetch résilient, politique no-PII, planification, monitoring auto-réparant, sortie CSV / JSON / webhook.

Voir sur GitHub
template

hidden-api-extraction-template

Lire directement l'API JSON interne d'un site au lieu de parser un HTML fragile : plus rapide, et bien plus stable.

Voir sur GitHub
demo

tls-fingerprint-scraper-demo

Pourquoi une page publique revient vide : un contrôle d'empreinte TLS avant le rendu. Comment la lire comme un navigateur normal, en conformité.

Voir sur GitHub

Demandez une étude de faisabilité gratuite

Indiquez-moi le site public et les données dont vous avez besoin. Je vous dis si c'est faisable, comment, et dans quelle langue.

Ou par e-mail : hello@feedsmith.net · Basé en Suisse · FR / DE / IT / EN.