Feed di dati da fonti pubbliche, tenuti in vita.
Quando Apify, Octoparse o uno script scritto da ChatGPT viene bloccato e restituisce pagine vuote, prendo in mano l'estrazione e la tengo viva.
Due minuti. Mandami l'URL pubblico e i campi che ti servono. Rispondo con ciò che è estraibile, come, e a che prezzo.
Servizi
Inizia con un audit. Passa a un feed mantenuto.
Quattro modi di iniziare, dal controllo a basso rischio al feed che tengo in vita.
Audit di API nascosta
Vedi i dettagli →Esamino un sito pubblico, trovo la via d'accesso più pulita e ti invio una cinquantina di righe di esempio reali. Il punto di partenza a basso rischio.
Scraper una tantum
Vedi i dettagli →Uno scraper robusto per una fonte pubblica, consegnato come codice testato di tua proprietà. Output pulito CSV, JSON o API.
Feed di dati gestito
Vedi i dettagli →Scraper, consegna pianificata e monitoraggio. La fonte cambia, qualcosa si rompe, io riparo, spesso prima che tu te ne accorga.
Bot Discord
Vedi i dettagli →Un bot su misura per la tua community: automazioni, ricerche su dati pubblici, post programmati. Costruito e ospitato.
Da uno scraper bloccato a un feed su cui contare.
Audit
Esamino la fonte pubblica e individuo la via di estrazione più affidabile, un'API nascosta quando esiste.
Costruzione
Uno scraper testato che gestisce pagine pubbliche piene di JavaScript o protette da Cloudflare, con output pulito.
Pianifica & monitora
Consegna alla cadenza che vuoi, con monitoraggio. Quando la fonte cambia e qualcosa si rompe, riparo.
Tu gestisci & possiedi
Tu fai girare lo strumento e possiedi i dati. Io lo costruisco e lo mantengo: uno strumento, non un servizio di gestione.
Il risultato
Un dataset che puoi verificare, non una promessa.
Output reale dello starter open source dietro l'offerta Feed di dati gestito, eseguito su un catalogo pubblico di prova. La stessa forma di ciò che arriva nella tua casella o nel tuo database.
| title | price | availability | rating | source |
|---|---|---|---|---|
| A Light in the Attic | £51.77 | In stock | Three | books.toscrape.com |
| Tipping the Velvet | £53.74 | In stock | One | books.toscrape.com |
| Soumission | £50.10 | In stock | One | books.toscrape.com |
| Sharp Objects | £47.82 | In stock | Four | books.toscrape.com |
| Sapiens: A Brief History of Humankind | £54.23 | In stock | Five | books.toscrape.com |
Il tuo feed porta i tuoi campi e nient'altro: le colonne che hai chiesto, nel formato che hai chiesto.
Perimetro
Affidabilità, non aggiramento.
- Solo pagine pubbliche, senza login. Dati fattuali e business: prezzi, specifiche, disponibilità, annunci, dati di mercato, orari. Niente login, niente paywall, niente account.
- Nessun dato personale. Rigorosamente senza PII. Niente nomi con contatti, profili o foto. Solo dati B2B e fattuali.
- robots.txt e limiti di frequenza rispettati. Le pagine vengono lette come farebbe un normale visitatore, a un ritmo rispettoso. L'output è strutturato e trasformato.
- Tu gestisci e possiedi i dati. Io costruisco e mantengo lo strumento, tu lo gestisci e controlli i dati. Una consegna pulita e documentata, ogni volta.
Tipicamente nel perimetro
Prove
Open source, testato, eseguibile.
Niente slide. Codice vero da leggere, clonare ed eseguire: il 20 % difficile dello scraping dove i tool no-code falliscono.
id: books-demo source: books.toscrape.com fields: [title, price, availability, rating] rate_limit_seconds: 1.5 urls: ["https://books.toscrape.com/catalogue/page-1.html"] schedule: interval_seconds: 30 output: kind: csv path: data/books-demo.csv
managed-data-feed-starter
L'offerta Feed di dati gestito, in codice: fetch resiliente, policy no-PII, pianificazione, monitoraggio auto-riparante, output CSV / JSON / webhook.
Vedi su GitHub →hidden-api-extraction-template
Leggere direttamente l'API JSON interna di un sito invece di fare parsing di HTML fragile: più veloce, e molto più stabile.
Vedi su GitHub →tls-fingerprint-scraper-demo
Perché una pagina pubblica torna vuota: un controllo dell'impronta TLS prima del rendering. Come leggerla come un browser normale, in modo conforme.
Vedi su GitHub →Il perché dietro il lavoro.
Perché il tuo scraper no-code continua a rompersi
Cambi di layout, dati renderizzati in JS, controlli di fingerprint, e cosa li risolve davvero.
Leggi la guida →Che cos'è una API nascosta
Gli endpoint JSON interni dietro una pagina, e perché chiamarli batte il parsing dell'HTML.
Leggi la guida →Siti pubblici protetti da Cloudflare
Le pagine vuote di solito sono un controllo dell'impronta TLS più che un CAPTCHA, e c'è un modo conforme di leggerle.
Leggi la guida →Richiedi uno studio di fattibilità gratuito
Indicami il sito pubblico e i dati che ti servono. Ti dico se è fattibile, come, e in quale lingua.
Oppure via e-mail: hello@feedsmith.net · Con base in Svizzera · IT / FR / DE / EN.