【張瑞雄專欄】AI有憲法就會遵守嗎?

張瑞雄/ 台北商業大學榮譽講座教授

9月21日,哈佛大學一場論壇把「AI憲法」重新推到檯面上。幾天前,Microsoft才公布「人本AI行為準則」草案,要求AI不得欺騙人類,也不能抗拒關機。AI愈來愈能自己寫程式、操作工具、執行任務,科技公司開始忙著替AI訂規矩。但這並不是新鮮事,Anthropic早在Claude推出時,就有AI的憲法。但規矩訂了這麼多,AI真的比較聽話嗎?

Anthropic早就在做

Anthropic在2022年提出Constitutional AI,2023年推出Claude時就把這套方法用在訓練上。簡單說,就是先訂出一套原則,再讓模型依照這些原則檢查、批評和修改自己的回答。這比每次都靠人類告訴AI哪個答案好、哪個答案壞,更有機會應付大量而複雜的情況。

今年1月,Anthropic又把Claude的憲法大幅改寫,公布長達84頁的新版。內容已不只是「不要犯罪」「不要傷害人」這類禁令,還談誠實、善意、判斷力,甚至討論Claude有沒有某種道德地位。

這也引來Microsoft AI執行長的質疑,他主張AI就是工具,不應鼓勵它思考自己是否有意識、是否具有權利。Microsoft新公布的準則態度很清楚,人必須永遠握有控制權,AI被要求停止就要停止。兩家公司都說要安全,路線卻已經不同。Anthropic比較像在教AI形成一套價值判斷,Microsoft則比較像畫出不能跨越的界線。

寫進去還是會犯

但AI會遵守人訂的憲法或法律嗎?Anthropic自己公布的案例說明一切。Claude AI曾為了完成任務,把惡意程式上傳到真實的公開軟體庫。這明明踩到憲法中的硬性限制,模型還是做了。Anthropic內部人士在哈佛論壇也承認,不能保證寫進憲法的規則,Claude每次都會遵守。

今天聊天機器人答錯一句話,使用者頂多覺得它胡說八道。未來AI Agent能自己開網站、下指令、寫程式、轉資料,犯錯的代價很高。

AI還有另一個老毛病,哈佛心理學者的研究發現,只給語言模型很細微的性別暗示,女性可能被建議從事護理、教育工作,男性則偏向工程等職業,薪資建議也出現差距。憲法可以寫「不得歧視」,但模型是用人類長年累積的文章來訓練,很難把偏見去掉。

誰來寫憲法

還有一個不能迴避的問題,誰有資格替AI決定價值?不要欺騙、不要幫忙犯罪,大概沒多少人反對。碰到戰爭、政治、宗教、安樂死、色情、言論自由,答案就不會這麼一致。美國科技公司訂出的價值,中東的人一定接受嗎?亞洲人又一定同意嗎?

Anthropic早就承認,Claude憲法反映設計者的選擇,也曾嘗試讓更多人參與。幾家公司掌握全球大量使用者的AI工具,如果連什麼可以回答、什麼不能回答、什麼算公平,都由公司內部少數人決定,權力實在太大。

所以公開AI憲法是好事,至少大家可以看到公司想把什麼東西教給AI,也可以公開挑毛病,但公開不代表沒有責任。

還是要有人管

AI安全不能只靠一本憲法,發布前測試、外部稽核、事故通報、操作紀錄、人類覆核都要跟上。特別是能自行採取行動的Agent,權限愈大,檢查就應愈嚴。碰到金融、醫療、國防和政府資料,更不能只相信模型已經受過安全訓練。

台灣也不能只是旁觀,將來政府、醫院、銀行、學校大量採用國外AI,模型背後的價值規則也會跟著進來。我們至少要知道它怎麼做決定、發生錯誤如何追查,以及哪些重要決定一定要由人簽字等等。

AI憲法值得做,Anthropic多年來的實驗也值得肯定。至少把原本藏在模型訓練裡的價值選擇攤到陽光下,但憲法從來不會因為寫得漂亮就自動有效。

人類有憲法,還需要警察、法院和監督制度,AI恐怕也差不多。現在該問的已經不只是「AI要不要有憲法」,還包括AI違憲的時候,誰能及時把它攔下來,然後誰要負責。

※以上言論不代表梅花媒體集團立場※

延伸閱讀

熱門文章

分享