Na jednotlivých měřítcích lze dodatečné zatížení považovat za zanedbatelné, ale při úrovních masového scrapingu se sčítá a dělá scraping výrazně nákladnějším. Toto je dočasné řešení, které má umožnit více času na fingerprinting a identifikaci headless prohlížečů (např. prostřednictvím toho, jak provádějí renderování písma), aby stránka s ověřením obtížnosti proof of work nemusela být zobrazována uživatelům, kteří jsou pravděpodobně legitimní. Upozorňujeme, že Anubis vyžaduje použití moderních JavaScriptových funkcí, které mohou pluginy jako JShelter zakázat.
Co znamená klaster sha olin derial v kontextu ochrany proti scrapingu
V kontextu ochrany proti scrapingu se klaster sha olin derial vztahuje na rozdělení zátěže a identifikaci nákladných operací na více uzlů. Distribuovaná zátěž pomáhá rozložit nároky na systém a ztížit masový scraping, protože každý jednotlivý požadavek má nižší dopad, avšak souhrnně se efekt zvyšuje.
Hlavním cílem je vytvořit prostředí, ve kterém se procesy těžší na výpočet a ověřování neprojevují jako výrazné pro jednotlivé uživatele, ale mají významný efekt při celkovém měřítku skripovaného stahování dat. Tím se zvyšují náklady na scraping a snižuje se jeho ekonomická atraktivita.
Fingerprinting a identifikace headless prohlížečů
Hlavní myšlenkou je věnovat více času na fingerprinting a identifikaci headless prohlížečů, zejména prostřednictvím analýzy renderování fontů a dalších moderních JavaScriptových prvků. Tímto způsobem lze rozlišovat legitimní prohlížeče od headless nástrojů bez nutnosti, aby byla uživatelům zobrazována složitá stránka s ověřováním.
V praxi to znamená, že systém využívá dynamické techniky, které reagují na charakteristiky prohlížeče a jeho prostředí. Headless prohlížeče často vykazují odlišnosti ve vykreslování, měření času vykreslení či v reálném chování font renderingu, což lze využít pro identifikaci a případně přizpůsobení mechanismů ochrany.
Role moderních JavaScriptových funkcí a omezení pluginů
Anubis vyžaduje moderní JavaScriptové funkce, které mohou být blokovány pluginy jako JShelter. To znamená, že zabezpečení musí počítat s různorodostí prostředí uživatelů a s tím, že někteří uživatelé mohou mít omezení, která ovlivní spolehlivost fingerprintingu.
Podle koncepce je cílem vyhnout se nadměrnému zatížení a současně zvyšovat obtížnost scrapingu na masové úrovni. Tím se vytváří rámec, ve kterém je možné vnímat jednotlivé požadavky jako méně významné samotnými uživateli a jako významné pouze při souhrnu.
Praktické implikace pro implementaci ochranných mechanismů
- Rozdělení zátěže na více uzlů vedoucí k lepší odolnosti proti masovému scrapingu.
- Využití fingerprintingu a identifikace headless prohlížečů pro selektivní ověřování.
- Integrace testů font renderování a dalších moderních JS funkcí do mechanismů ochrany.
- Vědomí, že některé pluginy mohou blokovat přístupnost moderních funkcí a vyžadovat alternativní metody.
Možné vizuální podpory pro pochopení tématu
Infografika: Rozdíl mezi jednotlivým a masovým zatížením systémů při scrapingu.

Mapa: Rozložení zátěže a identifikace headless prohlížečů napříč servery a uzly.

Tabulka shrnující klíčové body
| Aspekt | Popis |
|---|---|
| Jednotlivé měřítko | Dodatečné zatížení považováno za zanedbatelné |
| Masové měřítko | Zatížení se sčítá a zvyšuje náklady na scraping |
| Hlavní cíl | Více času na fingerprinting a identifikaci headless prohlížečů |
| Ochranný mechanismus | Proof of work stránka nemusí být zobrazována legitimním uživatelům |
| Omezení | Moderní JS funkce mohou být blokovány pluginy jako JShelter |