Agente de IA · agosto 2026
CCBot en robots.txt: quién lo bloquea
7.4% de las 15.009 webs del censo nombran a CCBot en su robots.txt, y 95.5% de ellas lo bloquean.
Webs que lo nombran
- Sample
- n=15.009
- Coverage
- 100.0%
El rastreo de agosto 2026, analizado buscando una regla de robots.txt que nombre a este user-agent, sobre la misma muestra del 0.1% del corpus que cualquier otra cifra de esta web: 15.009 webs. Antes se medía sobre el corpus entero y esta nota lo decía; pasó a la muestra mensual cuando el eje ganó una serie, así que ahora lleva el mismo margen que todo lo demás.
Webs que lo bloquean
- Sample
- n=15.009
- Coverage
- 100.0%
Qué hace CCBot en realidad
Lo lleva Common Crawl. Construye el corpus público de Common Crawl, que usan muchos entrenadores de modelos. Bloquearlo es una forma indirecta de salirse de varios modelos a la vez. Bloquearlo no te cuesta tráfico: este rastreador no te manda a nadie.
Qué escribir en tu robots.txt
Pon la regla en su propio grupo. Un Disallow bajo User-agent: * es anterior a estos agentes y varios de ellos no lo consideran aplicable, que es también por lo que este censo no lo cuenta.
User-agent: CCBot
Disallow: /User-agent: CCBot
Allow: /