它用什麼身分來
一般請求(robots.txt、網站地圖、llms.txt、連結檢查)的 User-Agent:
SHC-Scanner/1.0 (+https://sag3o.com/bot)用瀏覽器渲染頁面時(Playwright),User-Agent 是瀏覽器格式,但仍標明掃描器身分:
Mozilla/5.0 (compatible; SHC-Scanner/1.0; +https://sag3o.com/bot)1. 它是什麼
Sag3o 替網站主人檢查 SEO(搜尋引擎)、GEO(生成式引擎)與 AEO(答案引擎)健康度。每一次掃描都是由使用者輸入一個網址觸發;掃描器只看那一頁和該網站的幾個公開設定檔,不會順著連結爬其他頁面。
2. 只讀公開頁面
掃描器不登入、不送出表單、不帶 cookie,只讀任何人都能用瀏覽器打開的內容。取得的頁面只用來產生那一份報告,不會再拿去訓練模型或轉售。
3. 每次掃描會抓哪些東西
一次掃描大約 20–60 秒,對你的網站發出的請求如下:
- 被檢查的那一頁:用 headless Chromium 渲染一次(含該頁載入的圖片、script、樣式),並對同一頁跑一次 Lighthouse。
- 同一頁的 http:// 版本一次(不跟轉址),只看是否轉到 https。
- /robots.txt、/llms.txt、/llms-full.txt 各一次。
- robots.txt 列出的網站地圖,沒有列就試 /sitemap.xml 與 /sitemap_index.xml;若是總表,最多再抓 5 份子地圖。
- 頁面上最多 20 個連結,各發一次 HEAD 請求確認是否失效;HEAD 被拒(405/403/501)時改用只要求第一個位元組的 GET;回 429 就不再試。
- 真實使用者速度數據來自 Google 公開的 Chrome UX Report API,不會對你的網站多發任何請求。
4. 頻率
只有使用者主動要求時才掃描;匿名使用者每天有次數上限,付費方案的定期監測最多每週一次。每次抓取(robots.txt、網站地圖、llms.txt、連結檢查)10 秒逾時、頁面渲染 30 秒、http:// 探測 5 秒,都不會重試。
5. 如何封鎖
在 robots.txt 加入以下區段,掃描器會尊重它(依 RFC 9309 解析)。封鎖後 Sag3o 的報告會顯示該頁無法檢查。
User-agent: SHC-Scanner
Disallow: /6. 聯絡
有任何疑問或希望我們停止掃描某個網站,請寄 support@sag3o.com。