Na naszych portach mobile proxy PL widać jeden powtarzalny wzorzec: firmy nie scrapują "internetu w ogóle", tylko konkretne polskie serwisy rejestrowe i urzędowe. Największy wolumen idzie w wyszukiwarkę REGON GUS (wyszukiwarkaregon.stat.gov.pl). Zaraz za nią: Przeglądarka Dokumentów Finansowych / RDF, SUDOP UOKiK, EKW, Portal Rejestrów Sądowych / e-KRS, CEIDG, orzeczenia NSA i Eureka MF.
Dane publiczne - limity, blokady ASN datacenter i wymaganie geo PL są jak najbardziej realne. Ten tekst jest mapą tych ośmiu źródeł i praktyką zbierania ich przez mobile proxy z polskich operatorów, bez obchodzenia prawa: rate limity, cache, normalna identyfikacja sesji.
- Które serwisy realnie generują ruch (kolejność wg wolumenu klientów)
- Dlaczego datacenter IP pada na stat.gov.pl, ms.gov.pl i uokik.gov.pl
- Jak układać limity, sticky sesje i cache pod każdy typ źródła
- Kiedy mobile proxy PL obniża liczbę 429 i banów ASN
Co scrapują klienci na proxy PL (kolejność ważności)
To nie jest lista "teoretycznie ciekawych API". To serwisy, które w praktyce widać w ruchu firmowym: windykacja, KYC/AML, due diligence, monitoring kontrahentów, kancelarie, fintech, analytics. Pipeline zwykle zaczyna się od identyfikatora (NIP, REGON, KRS, numer KW), potem dokłada dokumenty finansowe, pomoc publiczną, księgę wieczystą, wpis sądowy, CEIDG, orzecznictwo i interpretacje MF.
Publiczny charakter danych nie oznacza nieskończonej pojemności po stronie GUS, MS, UOKiK czy MF. Po kilkuset szybkich hitach z IP Hetznera/AWS dostajesz 429, captchę albo cichy drop. Mobile IP z Play/Plus/Orange/T-Mobile w PL wygląda jak abonent komórkowy w kraju - i przy rozsądnym tempie żyje znacznie dłużej.
Wyszukiwarka REGON GUS (wyszukiwarkaregon.stat.gov.pl)
To numer jeden pod względem wolumenu u naszych klientów. Wyszukiwarka REGON na domenie wyszukiwarkaregon.stat.gov.pl to domyślny start: NIP → REGON, status podmiotu, adres, PKD, data powstania/zakończenia. Bulk-check kontrahentów i nocne odświeżanie bazy CRM leci właśnie tutaj.
Technicznie bywa kapryśna przy automatyce: sesje, tokeny formularza, throttling per IP. Typowy błąd to "jak najszybciej 10 rps z jednego VPS w DE". Po krótkiej chwili padają limity. Lepiej: sticky IP na batch (np. 50-200 NIP-ów), 0,3-1,5 rps z jitterem, lokalny cache po NIP/REGON z TTL 24h-7d. REGON podmiotu aktywnego nie zmienia się co minutę - pełny rescan bez TTL tylko pali IP.
Geo PL ma tu znaczenie: ruch z polskiego mobile ASN rzadziej wpada w reguły "hosting spoza PL". Po jobie warto potwierdzić exit przez What Is My IP - typ mobile, kraj PL.
Przeglądarka Dokumentów Finansowych KRS / RDF (rdf-przegladarka.ms.gov.pl)
Drugie źródło pod względem obciążenia: Przeglądarka Dokumentów Finansowych / Repozytorium Dokumentów Finansowych na rdf-przegladarka.ms.gov.pl. Stąd schodzą sprawozdania finansowe, uchwały i załączniki powiązane z KRS. Pliki są ciężkie; scraper, który co noc ściąga te same PDF od zera, wygląda agresywnie i marnuje pasmo.
Praktyka: najpierw metadane / lista dokumentów, potem download tylko brakujących (hash pliku w storage). Sesja sticky na czas pobrania pakietu dla jednej spółki. Nie rotuj IP między "lista" a "pobierz PDF" - gubisz kontekst i generujesz błędy 4xx. Rate limit trzymaj niższy niż przy lekkim REGON: PDF to inna klasa obciążenia serwera MS.

SUDOP UOKiK (api-sudop.uokik.gov.pl)
SUDOP (System Udostępniania Danych o Pomocy Publicznej) UOKiK, w tym endpointy wokół api-sudop.uokik.gov.pl, to źródło o pomocy publicznej: kto dostał wsparcie, na jakich zasadach, w jakiej skali. Compliance, due diligence M&A i risk lubią to dokładać do karty kontrahenta.
Tu często jest warstwa API - zanim postawisz HTML-scraper, sprawdź oficjalny kanał i limity dokumentacji. Przy automatyce trzymaj się budżetu zapytań, loguj 429/5xx i nie maskuj floodu rotacją. Mobile PL nadal pomaga przy UI/WAF wokół domen uokik.gov.pl, ale sensowny klient API + cache po identyfikatorze podmiotu załatwia większość wolumenu bez dramatu.
Elektroniczne Księgi Wieczyste EKW (przegladarka-ekw.ms.gov.pl)
Przeglądarka EKW na przegladarka-ekw.ms.gov.pl to Elektroniczne Księgi Wieczyste: treść KW, działy, wzmianki. Ruch bywa skokowy (due diligence nieruchomości, windykacja, bankowość), a interfejs bywa wrażliwy na sesję i tempo.
Zasada: jeden sticky IP na jedną księgę / krótki batch numerów KW. Nie parallelizuj agresywnie dziesiątek KW z jednego portu. Cache wyników z krótkim TTL (dane KW bywają bardziej "na teraz" niż REGON, ale i tak nie odpytujesz tej samej KW co 10 sekund w pętli produkcyjnej bez powodu). Captcha i limity pojawiają się szybciej przy datacenter spoza PL niż przy polskim mobile.
Portal Rejestrów Sądowych / e-KRS (prs.ms.gov.pl)
Portal Rejestrów Sądowych i wyszukiwarka KRS na prs.ms.gov.pl (e-KRS) to klasyczny wpis sądowy: reprezentacja, kapitał, status, odpisy. Często idzie w tandemie z REGON (najpierw identyfikacja w GUS, potem potwierdzenie w KRS) i z RDF (dokumenty finansowe).
Bulk odpisów pali sesje. Trzymaj cache po numerze KRS, rozdziel lekkie wyszukiwanie od ciężkiego pobierania odpisów, backoff przy 429. Mobile proxy PL + sticky na podmiot ogranicza wpadki "sesja związana z IP, a Ty rotujesz co request".
CEIDG i biznes.gov.pl
CEIDG (i ścieżki przez biznes.gov.pl) - JDG: NIP, REGON, PKD, zawieszenie, adres wykonywania. Nadal istotny wolumen, choć w naszym ruchu poniżej REGON/RDF/SUDOP/EKW/PRS. Formularze i tokeny lubią psuć headless bez zachowania ścieżki kroków.
Krótkie bursty, pauzy, sticky na sesję formularza. Cache dzienny zwykle wystarcza do monitoringu statusu działalności. Oficjalne kanały / API tam gdzie są - HTML tylko na luki.
Orzeczenia NSA (orzeczenia.nsa.gov.pl, CBOSA)
Serwis orzeczenia.nsa.gov.pl (orzecznictwo, w tym kontekst CBOSA) to pełnotekstowe orzeczenia sądów administracyjnych. Kancelarie i działy podatkowe scrapują pod research, nie pod "10 000 NIP/h". Inny profil: dłuższe sesje, wyszukiwanie po frazach, pobieranie treści wyroków.
Tu liczy się stabilna sesja i niski RPS bardziej niż agresywna rotacja. Mobile PL pomaga przy dłuższym researchu z biura/scraperów w chmurze, które inaczej wychodzą z zagranicznego DC. Cache po ID orzeczenia; nie redownloaduj tego, co już masz w korpusie.
Interpretacje podatkowe Eureka MF (eureka.mf.gov.pl)
Eureka MF na eureka.mf.gov.pl - baza interpretacji podatkowych Ministerstwa Finansów. Wolumen mniejszy niż REGON, ale stały u tax/legal. Wyszukiwanie + treść interpretacji; podobnie jak NSA: research, nie hurtowy scoring NIP.
Praktyka jak przy orzeczeniach: spokojne tempo, sticky, cache po sygnaturze/ID, brak rotacji w środku paginacji wyników. Datacenter IP bywa tu wycinany wcześniej przy masowych crawlerach "ściągnij całą bazę w weekend".

Dlaczego datacenter przegrywa, a mobile PL trzyma sesję
Wspólny mianownik REGON, RDF, SUDOP, EKW, PRS, CEIDG, NSA i Eureki:
- ASN hostingowy - AWS, GCP, Azure, OVH, Hetzner lądują na listach "cloud". Masowy ruch taniej uciąć niż analizować każdy request.
- Geo poza PL - zapytanie do stat.gov.pl / ms.gov.pl z Singapuru podnosi score ryzyka.
- Rate limit per IP - 429 po N req/min; jeden VPS kończy job w kwadrans.
- Sesja ↔ IP - rotacja co URL psuje formularze REGON, EKW, CEIDG bardziej niż pomaga.
Mobile proxy 4G/5G ProxyPoland wychodzi z modemów i kart SIM polskich operatorów. ASN komórkowy, CGNAT (wielu abonentów za jednym publicznym IP), geo PL. To nie czary: 50 rps w wyszukiwarkę REGON i tak złapie limit. Przy 0,2-2 rps na sesję, jitterze i cache ten sam port trzyma joby godzinami i dniami.
Dobre praktyki wspólne (bez obchodzenia prawa)
Scrapowanie publicznych rejestrów i baz orzeczeń/interpretacji w celach analitycznych i compliance jest codziennością firm w PL. To nie jest instrukcja ataku ani omijania zakazów. Cel: mniej obciążenia urzędów i mniej banów u Ciebie.
- Kolejność jobów jak w wolumenie - najpierw REGON (identyfikacja), potem RDF/PRS/EKW wg potrzeby, SUDOP/CEIDG/NSA/Eureka jako warstwy dodatkowe - nie wszystko na raz z jednego IP.
- Cache z TTL - NIP/REGON/KRS/KW/ID dokumentu; pole
fetched_at. - Sticky na podmiot lub krótki batch, rotacja między batchami lub po limicie - nie po każdym GECIE CSS.
- Backoff na 429 (30s → 2 min → 10 min), nie natychmiastowa zmiana IP i ten sam młot.
- Oficjalne API tam gdzie jest (m.in. okolice SUDOP) - HTML na luki.
- Nagłówki i cookies jak przeglądarka, realny User-Agent, zachowana ścieżka kroków formularza.
- Metryki - status HTTP, latency, captcha/WAF per host (regon vs rdf vs ekw osobno).
Protokół: HTTP(S) do lekkiego HTML; SOCKS5 gdy pełny Playwright/Puppeteer na ciężkim UI. Skala: jeden port mobile + cache = setki REGON/dzień; tysiące i równoległe PDF z RDF = kilka portów z osobnymi kolejkami (osobny budżet RPS na REGON vs PDF).
Podsumowanie
Jeśli Twój scraper celuje w realny polski stack - wyszukiwarkaregon.stat.gov.pl, rdf-przegladarka.ms.gov.pl, api-sudop.uokik.gov.pl, przegladarka-ekw.ms.gov.pl, prs.ms.gov.pl, CEIDG/biznes.gov.pl, orzeczenia.nsa.gov.pl, eureka.mf.gov.pl - węższym gardłem jest reputacja IP i tempo, nie sam parser. Datacenter spoza PL spala się szybko. Mobile proxy z polskich operatorów daje geo PL, ASN komórkowy i CGNAT, przy których limity i cache działają w skali dni i tygodni.
Ułóż joby w kolejności wolumenu, cache'uj identyfikatory, trzymaj niski RPS na PDF i EKW. ProxyPoland: dedykowane porty 4G/5G na polskich modemach - trial, sprawdzenie exit IP, potem produkcja. Plany i trial · sprawdź IP
