禁止 ChatGPT 爬蟲 GPTBot 爬取網站內容作為 AI 訓練教學
禁止 ChatGPT 爬蟲 GPTBot 爬取網站內容作為 AI 訓練教學

OpenAI旗下AI對話式機器人ChatGPT今年爆紅之後,有許多人在探討如何阻擋AI機器人利用自己的內容來進行AI語言模型訓練,這部分爭議非常大,其實在OpenAI的官...

OpenAI:ChatGPT将遵守爬虫协议,网站可拒绝白嫖转载

2023年8月8日—根据这一说明,内容拥有者将可以拒绝网站数据被ChatGPT的爬虫抓取。这是继暂停网页访问功能之后,OpenAI在版权和隐私保护方面的又一重大举措。

** 本站引用參考文章部分資訊,基於少量部分引用原則,為了避免造成過多外部連結,保留參考來源資訊而不直接連結,也請見諒 **

OpenAI主動公開自家爬蟲,只為撇清竊取資料之嫌

2023年8月10日 — 沒錯,OpenAI此前就曾被指控抓取資料來訓練ChatGPT,並從網際網路上竊取 ... 如果想禁止GPTBot抓取內容,則可以在robots.txt中寫入指令,爬蟲在檢測到 ...

如何利用robots.txt 與IP 阻擋ChatGPT 的網路爬蟲進入網站 ...

OpenAI 通過「GPTBot」和「ChatGPT-User」爬蟲的設計,確保它們遵守robots.txt 協議,同時公開了這些爬蟲所使用的IP 區段。這樣一來,網站管理者能夠根據自己的需求,自主 ...

ChatGPT来抓你的网页了,你怕不怕?

一文中曾经教过大家-如果你不想要让你的内容作为GPT训练的语料该怎么做。你只需要在网站的robots.txt文件中禁止CCBot即可。 User-agent: CCBot Disallow: /. 但是这并 ...

如何使用 ChatGPT API?(附上 Python 範例程式)

而在三月初,OpenAI 公開了 ChatGPT 的 API,也就是 gpt-3.5-turbo 模型的 API,讓我們不再被限制只能透過官方網頁使用,並且提供更多可調整的參數選項。. 快來跟著文章一起來了解 ChatGPT API,並實際使用 Python 串接 API~~~. <<< OnenAI ChatGPT API 如何使用?. (附上 ...

讓聊天機器人開啟爬蟲技能! - Jason Tsai

Web Crawler 要想讓我們的Line Chatbot開啟爬蟲技能,得先對網路爬蟲 (Web Crawler)有一定的認識,那爬蟲究竟是什麼意思呢? 網路爬蟲 是一種用來自動瀏覽網頁的網路機器人。 其目的一般為編纂網路索引、網路搜尋引擎等站點。 網路爬蟲可以將自己所存取的頁面儲存下,以便搜尋引擎事後生成索引供使用者搜尋 (擷自維基百科)。 寫的有點複雜對吧?...

緊急降低搜索引擎爬蟲抓取網站速度的辦法 -

2022年6月15日 — 上圖:百度資源平台中調整百度蜘蛛對網站爬取的頻次(30天後恢複正常速度抓取)。 辦法二(臨時修改robots.txt):. 也可以使用robots.txt來禁止一些爬蟲 ...

ChatGPT收集的训练数据合法吗?

2023年2月14日 — 据悉,作为大型语言模型,ChatGPT的训练数据集包含TB级别的海量互联网文本 ... 被访问的信息,但从具有禁止第三方爬取数据条款的网站收集海量数据可能 ...

OpenAI 的另一个网络爬虫ChatGPT-User

2023年8月8日 — 要禁止插件访问您的网站,您可以将以下内容添加 ChatGPT-User 到您 ... 爬虫访问站点,因为这样被爬了不会被应用于数据训练, 而是直接作为结果返回。

「ChatGPT」 升級了!關閉和「ChatGPT」 的對話內容,保護你的隱 ...

這個功能可以讓你隨時隨地控制你和「ChatGPT」 的對話內容,確保你的隱私不受侵犯,也不會因為意外而丟失。. 代表我們可以關閉對話紀錄的選項,不讓內容被用於訓練 AI 模型,關閉後每次對話就不會有紀錄,使用者必須自行手動保存對話內容。. 我 ...

OpenAI 更新说明「内容拥有者将可以拒绝网站数据被 ...

据《广告周刊》报道,8月初,《纽约时报》更新了其服务条款(TOS),明确禁止抓取其文章和图片用于人工智能…


禁止 ChatGPT 爬蟲 GPTBot 爬取網站內容作為 AI 訓練教學

禁止 ChatGPT 爬蟲 GPTBot 爬取網站內容作為 AI 訓練教學

OpenAI 旗下 AI 對話式機器人 ChatGPT 今年爆紅之後,有許多人在探討如何阻擋 AI 機器人利用自己的內容來進行 AI 語言模型訓練,這部分爭議非常大,其實在 OpenAI 的官方文件中就有說明 ChatGPT 的網路爬蟲機器人名為 GPTBot,也有公開爬蟲的 IP 可以讓大家阻擋 AI 蒐集網站資料,這篇就來跟大家分享如何禁止 ChatGPT 爬蟲機器人來使用你的資料。

透過設定網站中的 robots.txt 檔案,就可以阻擋 GPTBot 來你的網站爬資料,這是一個專門給各式網路爬蟲看的文件,文件中會告訴爬蟲哪些資料不能取用。

防止 AI 爬蟲

根據 OpenAI 官方文件表示,User-agent 為 GPTBot。User-agent 字串如上圖。下面幫大家列出,可直接複製使用:
User agent token: GPTBot
Full user-agent string: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot)

禁止 GPTBot 爬取網站內容
ChatGPT 爬蟲IP
直接將上圖中的文字,加入網站中的 robots.txt 檔案中儲存即可,加入後 ChatGPT 的爬蟲就不會爬取網站資料。禁止內容如下,可直接複製使用:
User-agent: GPTBot
Disallow: /

開放部分內容爬取
ChatGPT 爬蟲禁止
除了全部禁止之外,也可以自訂允許 GPTBot 爬取的路徑,Allow 跟 Disallow 後面可以自由加上網站目錄路徑名稱。
User-agent: GPTBot
Allow: /directory-1/
Disallow: /directory-2/

IP 方式阻擋

OpenAI 還公布了自家的 GPTBot 使用 IP,因此也可以直接設定 .htaccess 檔案,就可以直接阻擋 GPTBot 爬蟲,以下是 OpenAI 所公布的 IP:
  • 20.15.240.64/28
  • 20.15.240.80/28
  • 20.15.240.96/28
  • 20.15.240.176/28
  • 20.15.241.0/28
  • 20.15.242.128/28
  • 20.15.242.144/28
  • 20.15.242.192/28
  • 40.83.2.64/28

資料來源:OpenAI

如何禁止 ChatGPT 爬蟲?這樣修改 robots 文字檔就解決
9M87
9M87

如何禁止 ChatGPT 爬蟲?這樣修改 robots 文字檔就解決 相關文章