# robots.txt — tracciaprezzo.it # Strategia AI (2026): blocca i crawler di TRAINING dei lab AI (prendono il dato # senza mandare traffico), CONSENTI i crawler di RETRIEVAL/SEARCH (citano con link). # NB: Amazonbot resta consentito (sito affiliato Amazon). # ── Crawler standard (Google, Bing, ecc.) ── User-agent: * Disallow: /statistiche-bot/ Allow: / # 30/7/2026: era "Disallow: /confronta.php", che NON copriva /confronta — # cioe' la URL pulita usata da tutti (rewrite in .htaccess). Il prefisso senza # estensione copre entrambe. Il comparatore costa 3 chiamate ad API esterne a # ogni caricamento: non e' una pagina da far scandagliare. Disallow: /confronta Disallow: /Ricerca/ Disallow: /blog/wp-admin/ Disallow: /blog/wp-login.php Disallow: /blog/readme.html Disallow: /blog/license.txt Disallow: /cgi-bin/ Allow: /blog/wp-admin/admin-ajax.php # ── Bot di TRAINING AI — BLOCCATI ── User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: CCBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: Bytespider Disallow: / User-agent: Meta-ExternalAgent Disallow: / User-agent: meta-externalagent Disallow: / User-agent: Diffbot Disallow: / User-agent: Omgilibot Disallow: / # ── Bot di RETRIEVAL / SEARCH AI — CONSENTITI (ti citano con link) ── User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / # PetalBot (Huawei): crawl aggressivo, valore ~zero per il mercato IT → rallentato User-agent: PetalBot Crawl-delay: 30 # ───────────────────────────────────────────────────────────────────────────── # 2/8/2026 — Crawler SEO commerciali rallentati. # # Misura su 7 giorni (26/7-1/8, 191.249 richieste): il 95% del traffico del sito è # automatico e i crawler SEO da soli ne fanno il 25% (47.351 richieste). Non portano # un solo visitatore: alimentano il database commerciale di chi li gestisce. # # Si alternano, ed è il motivo per cui sono elencati tutti e quattro invece dei due # che sembravano il problema guardando un giorno solo: # DataForSeo 11.945 il 26/7 AhrefsBot 4.655 il 29/7 SemrushBot 6.851 il 31/7 # # Crawl-delay 30 = al massimo ~2.880 richieste al giorno ciascuno invece di 5-12.000. # Non è un divieto: il sito resta indicizzabile dai motori veri (Google, Bing…), che # hanno la loro sezione più sopra e non sono toccati. # Se lo ignorano si vede nei log e si passa al blocco per user-agent in .htaccess, # dove DataForSeo e MJ12 sono già bloccati sul comparatore. # ───────────────────────────────────────────────────────────────────────────── User-agent: SemrushBot Crawl-delay: 30 User-agent: DataForSeoBot Crawl-delay: 30 User-agent: AhrefsBot Crawl-delay: 30 User-agent: MJ12bot Crawl-delay: 30 Sitemap: https://tracciaprezzo.it/sitemap-index.xml