生成式 AI 的崛起創造了一個意想不到的問題,威脅著這些系統學習和改進的根本基礎。隨著越來越多人使用 AI 工具為網站創建內容,一個危險的反饋循環正在出現,可能從根本上破壞驅動現代 AI 系統的技術。
重要時間軸事件:
- 1989年: Tim Berners-Lee 在 CERN 發明全球資訊網
- 1993年: Mosaic 網頁瀏覽器發布
- 1995年:網際網路開始商業化
- 2022年11月: ChatGPT 推出,開啟生成式 AI 革命
- 2024年7月: Nature 發表關於 AI 模型因遞迴訓練而崩潰的研究
網路商業模式面臨威脅
傳統的網路生態系統依賴於一個簡單的交換:用戶造訪網站尋找資訊,廣告商付費接觸這些用戶。 Google 的搜尋引擎數十年來一直在這種模式下蓬勃發展,將人們導向網頁的同時從廣告中賺取收入。然而, AI 聊天機器人正在改變這種動態,透過直接回答用戶問題,完全消除了造訪網站的需要。
這種轉變威脅的不僅僅是廣告收入。當人們停止造訪網站時,內容創作者失去了發布新材料的動機。社群討論揭示了對這個循環的關鍵擔憂——如果網路對用戶和創作者都變得不那麼有價值,整個資訊生態系統可能會崩潰。
網路生態系統威脅:
- 營收模式:當使用者繞過網站時,以廣告為基礎的搜尋變得不再可行
- 內容創作:降低發布商創作原創內容的動機
- 訓練資料:減少 AI 訓練所需的高品質人類生成資源
- 資訊品質:增加 AI 生成錯誤資訊和「幻覺」的風險
模型崩潰:當 AI 訓練 AI 時
隨著 AI 生成內容充斥網際網路,一個更嚴重的技術問題正在出現。 2024 年 7 月發表在 Nature 上的研究顯示,當大型語言模型在其他 AI 系統生成的內容上進行訓練時,它們會遭受模型崩潰——一種 AI 失去理解人類表達和知識全範圍能力的退化現象。
「想像一下 AI 告訴你用水浴罐頭法保存肉類是安全且適當的,以及當你按照這些指示食用罐頭肉類時實際意味著什麼。」
社群已將此識別為關鍵的安全問題。隨著 AI 生成的文本變得比人類寫作更容易產生,網站越來越多地充斥著合成內容。當未來的 AI 系統在這些人工數據上訓練時,它們會失去與真實人類知識的聯繫,並可能提供危險的錯誤資訊。
模型崩潰研究發現:
- 研究標題:「 AI Models Collapse when Trained on Recursively Generated Data 」
- 關鍵發現:「不加選擇地使用模型生成內容進行訓練會導致結果模型出現不可逆轉的缺陷」
- 影響: AI 系統失去表現原始人類內容完整範圍的能力
- 潛在解決方案:將 AI 內容添加到人類內容中,而非完全取代人類內容
![]() |
|---|
| 數位指南針象徵在複雜的 AI 生成內容環境中準確導航的需求 |
資訊品質的消亡
科技社群中的許多人認為,由於搜尋引擎優化策略和廣告驅動內容,網路品質已經顯著下降。 AI 可能只是在加速現有問題,而不是創造新問題。挑戰在於 AI 系統需要高品質、多樣化的人類生成內容才能正常運作,但它們同時正在減少創建此類內容的誘因。
一些專家建議, AI 公司最終需要為訓練數據向內容創作者付費,類似於串流服務為音樂和影片內容付費的方式。然而,目前免費的網路爬蟲模式使這種轉變在經濟上具有挑戰性。
驗證變得至關重要
隨著 AI 生成內容變得與人類寫作難以區分,驗證資訊來源的能力變得比以往任何時候都更重要。社群強調用戶需要存取原始來源以事實查核 AI 回應,但許多人由於便利性而跳過這個驗證步驟。
諷刺的是,雖然 AI 承諾讓資訊更容易取得,但實際上可能讓可靠資訊更難找到。圖書館和權威來源仍然重要,但它們無法匹敵 AI 系統的便利性和可用性——即使這些系統提供不正確的資訊。
網路的未來可能取決於找到新的經濟模式,在維持讓網際網路具有革命性的可及性的同時,獎勵優質內容創作。如果不解決這個難題,我們面臨創造一個資訊生態系統的風險,其中 AI 系統隨著時間變得不那麼可靠,可能導致廣泛的錯誤資訊和數位知識系統的崩潰。
參考資料:Will AI Destroy the World Wide Web?
![]() |
|---|
| 智慧家庭網路代表在 AI 主導的環境中,為尋求可靠數據而連接的資訊來源網絡 |


