În ultima perioadă am început să vedem in jurul nostru intregi servere cazute, siteuri care pana acum functionau foarte bine blocate, intrate in erori de tip resurse consumate.
In logurile serverelor am inceput sa vedem un tip de trafic care, până nu demult, aproape că nu conta. Nu sunt oameni. Nu sunt nici boții clasici ai motoarelor de căutare.
Sunt boții companiilor de inteligență artificială.

Claude, ChatGPT și alte platforme AI, pentru a raspunde solicitarilor, au nevoie de acces la informația publicată pe Internet, la siteuri precum al tau. Pentru asta, crawlerere lor, adica niste mici robotei, niste scripturi nesuferite, vizitează site-uri, citesc pagini și colectează sau indexează informații. Si fac atata consum de resurse incat serverele nu mai pot raspunde si se blocheaza.
Servere blocate. Adica siteurile, printre care si al tau nu mai pot raspunde solicitarilor pentru ca au primit atatea solicitari incat au dat cu basca de pamant si s-au oprit. Sau asa ceva…
Am întâlnit recent exact situația aceasta pe serverele noastre.
Un site care devenise inexplicabil de lent, desi totul parea ok
Problema a apărut inițial pe site-ul unui client. Site-ul funcționa normal, apoi începea să răspundă greu. Uneori foarte greu. Într-o asemenea situație, primul suspect este aproape întotdeauna site-ul:
WordPress. Pluginurile. PHP. MySQL. Un query prost. Un modul care consumă resurse. Un cache configurat incorect. Ceva, acolo…
Doar că investigația ne-a dus în altă direcție.
În logurile serverului apăreau foarte multe accesări automate. Printre ele, trafic generat de ClaudeBot, crawlerul companiei Anthropic, dezvoltatorul Claude AI.
Botul solicita pagini în mod repetat și genera suficient trafic încât să contribuie la încărcarea serverului.
Trebuie făcută o distincție importantă:
Crawling-ul nu este, în sine, un atac informatic.
ClaudeBot este un crawler legitim, iar Anthropic documentează public existența lui și modul în care poate fi controlat de administratorii site-urilor.
Din punctul de vedere al serverului însă, intenția contează mai puțin, pentru ca el vede request-uri si dacă primește suficient de multe request-uri într-un interval scurt, trebuie să le proceseze.
Totusi, de ce scanează Claude site-urile?
Pai…pentru că AI-ul are nevoie de informație.
Anthropic, de exemplu, folosește în prezent mai multe tipuri de crawlere, cu scopuri diferite.
- ClaudeBot colectează conținut public care poate contribui la dezvoltarea și antrenarea modelelor AI.
- Claude-SearchBot navighează și indexează conținut pentru a îmbunătăți rezultatele funcțiilor de căutare ale Claude.
- Claude-User este folosit atunci când un utilizator Claude solicită informații care determină sistemul să acceseze un site.
Anthropic explică explicit aceste diferențe în documentația sa.
Cu alte cuvinte, faptul că vezi trafic „Claude” în log nu înseamnă automat că cineva îți antrenează un AI pe site în acel moment. Poate fi crawling pentru dezvoltarea modelelor, pentru search sau acces declanșat de o solicitare a unui utilizator.
ClaudeBot este însă crawlerul pe care Anthropic spune că îl utilizează pentru colectarea datelor publice care pot contribui la training. Chiar documentația tehnică Anthropic pentru modelele sale precizează că datele de antrenament includ informații public disponibile pe Internet și că ClaudeBot este crawlerul general folosit pentru obținerea unor asemenea date.
Si de ce, mai exact, poate deveni crawling-ul o problemă?
Pentru că un bot nu navighează ca un om.
Un om intră pe site, deschide homepage-ul, citește, mai bea o cafea, apasă eventual pe Servicii.
Mai citește. Mai bea o gura de cafea, poate intră pe Contact.
Un crawler poate solicita într-un timp relativ scurt zeci, sute sau mii de URL-uri.
Si o astfel de solicitare inseamn aun request(o cerere catre server).
Apoi încă unul.
Apoi încă 50….
Dacă ai mai multe site-uri pe același server, lucrurile devin și mai interesante. Botul nu trebuie să „spargă” nimic ca să îți creeze o problemă. Trebuie doar să ceară suficiente pagini.
Si serverul da cu basca de pamant…
Un crawler legitim poate produce efecte asemănătoare unui atac de tip DoS (Denial of Service)
În securitate există astfel de atacuri de tip DoS sau DDoS, în care foarte multe request-uri sunt trimise către un server pentru a-i consuma resursele.
ClaudeBot nu este un DDoS, evident ca nu acesta este scopul lui.
Dar, în anumite condiții, efectul resimțit de un server poate semăna cu unul:
- crește numărul de request-uri;
- crește consumul PHP;
- crește numărul proceselor PHP-FPM ocupate;
- crește activitatea bazei de date;
- crește I/O-ul;
- crește load-ul serverului;
Si consuma astfel resursele serverului si il blocheaza. Si gata…
Si totusi care este rezolvarea?
Primul pas a fost sa blocam ClaudeBot pe site-ul clientului. Am decis să limităm accesul crawlerului la siteul clientului si, pentru ca ne-am gandit ca sigur sunt atacate si alte siteuri, am blocat la nivel de server.
Daca esti pe o gazduire partajata, esti ca pe scara de la bloc si nu poti decat sa blochezi accesul botului la siteul tau, mai mult de atat nu ai control si daca alte siteuri de pe acelasi server sunt citite in acest fel, serverul tot merge greu si, cu toata blocarea la nivelul siteului, tot greu va merge. Asa ca va trebui sa discuti cu firma de gazduire sa ia masuri in directia aceasta.
Ar trebui să blocăm toți boții AI?
Nu, nu, ar fi o reacție simplistă si nu neaparat utila.
Boții AI încep să devină o nouă categorie de trafic pe Internet și probabil vor deveni din ce în ce mai importanți.
Așa cum timp de 20 de ani ne-am întrebat: „Mă vede Google?”, vom începe tot mai des să ne întrebăm: „Mă vede AI-ul?”
Pe noi ne-a sunat de curand un client si ne-a spus ca a intrebat pe ChatGPT de un serviciu specific si Aiul ne-a recomandat. Bun, sa ii dam o bere, zic!
Claude are deja funcții de search care folosesc web-ul pentru documentare și răspunsuri, iar blocarea anumitor crawlere poate reduce vizibilitatea conținutului în asemenea sisteme. Anthropic spune explicit acest lucru pentru Claude-SearchBot și Claude-User.
Pentru un business, asta creează o problemă nouă. Vrei să fii găsit, dar nu vrei ca un crawler să îți consume necontrolat infrastructura.
De aceea soluția corectă nu va fi întotdeauna sa incui usa pentru toata lumea, ci poate sa permiti cu control accesul acelor boti care te pot ajuta.
Ce sa spun mai mult decat ca traficul AI devine o problema reala, ca sa nu mai vorbim de virusi creati cu AI si de atacuri orchestrate cu AI.
Citeam astazi despre faptul ca Microsoft se confrunta cu situatii in care AIul folosit pentru a identifica buguri, gauri in softurile Microsoft a dus la rezultate neasteptate, Microsoft fiind nevoit sa repare cateva sute de buguri intr-o singura luna, ceea ce e deosebit de neplacut. Nu pentru ca Microsoft are buguri, ca toate softurile au, dar AI ne pune in situatia de a face fata unei noi lumi, mult mai eficiente in care noi va trebui, poate, sa ne gasim locul.
De aceea zic, sa ne pregatim si sa incuiem un pic mai bine portile, sa nu mai patrunda oricine la noi in …server.