Átláthatósági tájékoztató
Ez a dokumentum azt írja le, hogyan áll elő a találati lista: honnan származnak a találatok, mi dönti el a sorrendjüket, és mit nem veszünk figyelembe. A DSA (2022/2065/EU rendelet) ajánlórendszerekre vonatkozó átláthatósági elvárásait követi, de a részletessége szándékosan túlmegy a kötelezőn.
1. Honnan jönnek a találatok
A találati lista két forrásból áll össze:
1.1 A saját index
Saját bejárónk (CoverSearchBot) magyar nyelvű oldalakat jár be egy
gondozott forráslista alapján, és a bejárt oldalak szövegét saját teljes szöveges
indexben tárolja. A találatok kivonata ebből a tárolt szövegből készül, a keresett
szó környezetéből.
1.2 A metakereső
Amit a saját indexünk nem fed le, azt más keresőmotorok találataival egészítjük ki. A jelenleg használt motorok: Google, Bing, DuckDuckGo, Brave Search, Yandex. A .onion (Tor) keresés külön kapcsolható, alapból kikapcsolt.
A lekérdezéseket a szerverünk adja fel, nem a böngésződ — ezért ezek a motorok nem látják az IP-címedet, és nem tudnak nyomon követni. Részletek az Adatkezelési tájékoztatóban.
2. Hogyan rangsorolunk
A saját indexünk találatai állnak elöl, a metakereső találatai mögöttük. Ez nem finomhangolás, hanem elvi döntés — az alábbi indoklással.
A saját indexbe csak az kerül be, ami átment egy felvételi kapun: a bejáró minden letöltött oldalt besorol, és csak a valódi tartalmat indexeli. A kategórialapokat, címkefelhőket és főoldalakat nem — azokon csak azért megyünk át, hogy a linkjeiken eljussunk a tartalomhoz. A belépési, előfizetési és fiókkezelő oldalakat sem indexeljük, és nem is követjük tovább.
A besorolás legfőbb jele a hosszú bekezdések száma (legalább 25 szavas bekezdések). Mérésünk szerint valódi tartalmi oldalon jellemzően 4–19 ilyen bekezdés van, kategórialapon 1–2, funkcionális oldalon nulla.
A metakereső ezzel szemben a nagy keresők rangsorát hozza, azzal együtt, ami abban keresőoptimalizálás. Ezért kap kitöltő szerepet: ott ad találatot, ahol a saját indexünk még nem elég. Ahogy a saját index nő, a metakereső súlya magától csökken.
2.1 Amit jelként használunk
- a keresett szavak előfordulása a címben és a szövegtörzsben (BM25 relevancia);
- a dokumentum típusa, ha az oldal közzétette (cikk, recept, termék, esemény stb.);
- a felvételi kapu besorolása: tartalom-e egyáltalán az oldal;
- a kereséshez megadott szűrőid (nyelv, időszak, kategória).
2.2 Amit soha nem használunk jelként
Ezek mind megvásárolhatók vagy megjátszhatók, ezért elvi alapon kizártuk őket:
- fizetés — a találati sorrend nem megvásárolható, semmilyen összegért;
- backlinkek száma;
- kulcsszósűrűség és meta kulcsszavak;
- kattintási adatok;
- rólad szóló bármilyen adat — mert ilyet nem tartunk nyilván.
3. Személyre szabás: nincs
Két különböző látogató ugyanarra a keresőkifejezésre ugyanazt a találati listát kapja (azonos szűrőbeállítások mellett). Nincs felhasználói profil, nincs keresési előzmény, nincs helyzet- vagy eszközalapú átrendezés. Nem „buborékmentesnek" hirdetjük magunkat — egyszerűen nincs miből buborékot építeni.
4. Reklámok
A szolgáltatás nem jelenít meg hirdetést, és a találati listában nincs fizetett elhelyezés. Ha ez valaha megváltozna, a hirdetéseket egyértelműen és megkülönböztethetően jelölnénk, és a szabályokat a Reklámozási szabályzat tartalmazná.
5. Mesterséges intelligencia használata
A szolgáltatásban egy helyen dolgozik gépi tanulási modell:
- Képi hasonlóság-keresés. A képek tartalmi hasonlóságát egy képmegértő modell számolja ki. Ez a modell a saját szerverünkön fut, a képek nem hagyják el a rendszert, és nem kerülnek külső AI-szolgáltatóhoz.
A szöveges találatok rangsorolásában nincs nyelvi modell: nincs AI-összefoglaló, nincs generált válasz, és a találatok szövege nem gépi tartalom, hanem a hivatkozott oldalak saját szövege.
6. Szűrés és moderálás
A találatokból kikerülhet tartalom, ha az üzemeltető moderálási szabályt állít be (domain vagy kulcsszó tiltása), vagy ha jogszerű bejelentés érkezik. Bizonyos találatok kiemelt helyre is kerülhetnek — ez szerkesztői döntés, nem fizetett elhelyezés, és a jelölése látszik.
A moderálás menetét, a jogorvoslatot és a bejelentés módját a Tartalom- és eltávolítási szabályzat, illetve a Jogsértő tartalom bejelentése oldal írja le.
7. A bejáró működése
Bejárónk CoverSearchBot/1.0 (+https://coversurface.hu) néven azonosítja
magát, és betartja a robots.txt tiltásait. Ha weboldal-üzemeltetőként
nem szeretnéd, hogy indexeljünk, a robots.txt-ben tilthatsz minket:
User-agent: CoverSearchBot
Disallow: /
Az indexből való eltávolítást közvetlenül is kérheted a Tartalom- és eltávolítási szabályzat szerint.
8. A lefedettség őszintén
A saját indexünk kicsi és növekszik. Elsősorban magyar nyelvű tartalomra épül, tematikusan válogatott forráslistából. Ez azt jelenti, hogy sok kérdésre jelenleg a metakereső adja a választ, és vannak lefedetlen témák — például a hivatalos és jogszabályi források nagy része automatizált hozzáférés elől el van zárva, ezért nem szerepel a saját indexünkben.