Über den Human Job-Daten-Crawler
Wenn du diese Seite in deinen Server-Logs gefunden hast, hat eine Anfrage unseres Job-Daten-Crawlers deine Website erreicht. Diese Seite erklärt, wer wir sind, was der Crawler tut und wie du ihn verlangsamen, stoppen oder eine Stellenanzeige entfernen lassen kannst.
Der Crawler identifiziert sich in jeder Anfrage mit dem User-Agent-Token jobdata-crawler
jobdata-crawler/0.1 (+https://meetthehuman.com/crawler; contact support@meetthehuman.com)Wer ihn betreibt
Der Crawler wird von Human (HumanHQ LLC) betrieben, dem Unternehmen hinter meetthehuman.com. Human ist eine Recruiting-Plattform, die Kandidaten hilft, offene Stellen zu finden, und Arbeitgebern hilft, einzustellen.
Fragen, Beschwerden und Anfragen zum Crawler gehen an support@meetthehuman.com
Was er sammelt
Der Crawler sammelt öffentlich verfügbare Stellenanzeigen, damit Kandidaten auf Human offene Stellen entdecken können, einschließlich Stellen mit Relocation- oder Visa-Unterstützung.
- Er liest nur Stellenanzeigen, die bereits öffentlich im Web stehen, von öffentlichen Job-Boards von Bewerbermanagementsystemen und deren öffentlichen APIs (zum Beispiel Greenhouse, Lever, Ashby, Workable und Recruitee) sowie von lizenzierten Job-Daten-APIs.
- Er sammelt keine personenbezogenen Daten von Kandidaten oder Bewerbern. Er liest niemals Bewerbungsformulare, Bewerberprofile oder Inhalte hinter einem Login.
- Er legt keine Konten an, meldet sich nicht an, sendet keine Formulare ab und führt kein JavaScript aus. Er sendet ausschließlich einfache HTTP-GET-Anfragen.
- Jede Stellenanzeige wird so gespeichert, wie sie veröffentlicht wurde, damit wir erkennen, wann eine Stelle geöffnet und wann sie geschlossen wird. Dieser Verlauf hält unsere Angebote aktuell.
Wie er sich verhält
- Er ruft robots.txt mit seinem eigenen User-Agent ab, speichert sie pro Website 24 Stunden zwischen und hält sich daran. Eine URL, die deine robots.txt für diesen Crawler sperrt, wird nie angefragt.
- Er respektiert Crawl-delay. Wenn deine robots.txt ein langsameres Tempo als unsere Voreinstellung verlangt, gilt der langsamere Wert.
- Er sendet höchstens eine Anfrage alle zwei Sekunden an eine einzelne Domain. Anfragen an dieselbe Website werden zeitlich verteilt und nie in Schüben gesendet.
- Wenn deine robots.txt wegen eines Serverfehlers oder einer Zeitüberschreitung nicht abgerufen werden kann, crawlt er deine Website nicht. Schweigen wird nicht als Zustimmung gewertet.
- Er identifiziert sich immer mit dem oben gezeigten User-Agent und gibt sich nie als Browser oder anderer Crawler aus.
So schließt du ihn aus
Um den Crawler von deiner gesamten Website auszuschließen, füge diese zwei Zeilen zu deiner robots.txt hinzu:
User-agent: jobdata-crawler
Disallow: /Der Crawler liest robots.txt höchstens alle 24 Stunden neu, eine neue Regel greift also spätestens beim nächsten Sammellauf danach.
Um den Crawler zu behalten, ihn aber zu verlangsamen, setze stattdessen einen Crawl-delay in Sekunden. Zum Beispiel eine Anfrage alle zehn Sekunden:
User-agent: jobdata-crawler
Crawl-delay: 10Du kannst auch eine E-Mail an support@meetthehuman.com mit deiner Domain schicken, dann schließen wir sie manuell aus. Nachrichten zum Crawler gehen an einen Engineer, nicht an eine Standardantwort.
Entfernung einer Stellenanzeige beantragen
Um eine bestimmte Stellenanzeige von Human entfernen zu lassen, schicke eine E-Mail an support@meetthehuman.com mit der URL der Anzeige. Wir entfernen sie aus unseren Angeboten und sammeln sie nicht mehr.
Anfragen des Arbeitgebers, der die Anzeige veröffentlicht hat, oder des Betreibers der Website, von der sie gesammelt wurde, werden zuerst bearbeitet. Bitte gib an, welcher von beiden du bist.