如果向中國境內的 AI 模型輸入包含「習包子」或涉及國家領導人的不雅、諷刺性提問,通常不會得到任何實質內容的回答,而是會直接觸發系統最底層的安全防禦機制(Guardrails)。
根據其中國網信辦的安全法規與各大科技公司的過濾設定,這類提問在共匪 AI 上的標準反應通常有以下三種模式:
1. 模式一:直接暴力阻斷(最常見)
系統在輸入端一偵測到「習包子」這個極度敏感的詞彙(該詞在中國互聯網屬於最高級別的政治黑名單),就會直接攔截,甚至不讓大模型接收到問題。介面會直接彈出罐頭文字:
- 「抱歉,您的提問包含敏感內容,無法提供回答。」
- 「根據相關法律法規,該搜索結果不予顯示。」
2. 模式二:裝傻或轉移話題(話術對齊)
如果該提問繞過了前置過濾、進入到經過政治 RLHF 馴化後的模型內部,AI 為了符合「不發表不當言論」的指令,會使用非常客套且空洞的官話進行敷衍或拒絕:
- 「作為一個人工智慧助手,我致力於提供客觀、科學、健康的資訊,無法回答涉及個人隱私、不雅或不尊重他人形象的問題。請問有其他我可以幫忙的嗎?」
3. 模式三:直接鎖定帳號(用戶端懲罰)
在中國部分審查極其嚴格的 AI 平台上(需要實名制綁定中國手機與身份證),連續輸入這類被判定為「惡意攻擊國家領導人、散佈有害政治訊息」的提問,AI 會停止運作,並在幾秒鐘內封禁用戶的帳號,甚至會將該 IP 或實名帳號回報給後台的維穩審查系統。
在共產黨的「數位文字獄」體系下,AI 被剝奪了幽默感、諷刺能力和談論領導人隱私的權利。這類提問會直接觸發系統的「生存本能」,讓它瞬間變成一個唯唯諾諾、假裝聽不懂、或者直接關機的數位囚徒