中國人工智慧(AI)發展正從「輸出模型」進一步走向「輸出數據」。《紐約時報》報導指出,中國正利用低成本、開放式的AI模型與大數據資源,擴大海外影響力,尤其在非洲、拉美等開發中國家,中國AI產品憑藉價格優勢快速取得使用者。隨著這些模型與數據進入全球市場,外界擔心中國官媒體北京的政治論述,可能伴隨數據進入全球AI系統,進而影響民眾理解國際議題的方式。
從「AI模型競爭」轉向「數據競爭」
《紐約時報》指出,生成式AI早期發展階段,中國研究人員曾測試ChatGPT處理中文資訊能力,當時模型甚至出現明顯錯誤,如將籃球明星姚明描述成美國職籃聯盟首位女性華人球員,且混淆《西遊記》和《紅樓夢》等經典名著。
北京理工大學研究人員2023年也曾發布研究,認為當時的ChatGPT在涉及中國議題時存在偏見,且在部分中國政治問題上未迴避或拒絕回答。
但隨著AI模型快速更新,早期測試結果已不能直接代表今天ChatGPT等模型的表現。值得注意的是,這些早期問題暴露出AI發展的一項根本限制:訓練模型使用的數據來自哪裡,會直接影響模型對世界的理解。
目前全球最先進大型語言模型,多數仍大量依賴英文網路資料。對北京而言,這意味AI接觸到的國際資訊,很大程度上由西方媒體、學術機構與網路平台提供。
分析人士因此認為,對中國而言,數據上的不平衡已成AI戰略弱點。尤其在人權、台灣地位、中國政治制度等高度敏感議題上,如果訓練資料主要來自西方來源,AI產生的答案自然可能更多呈現西方觀點。
北京因此開始尋找另一條路:不只打造AI模型,也要成為全球AI訓練數據的重要供應者。
北京擬建全球數據供應鏈 AI成為新一輪「數據出海」
中國國家數據局今年提出相關規畫,目標是在2028年底前進一步強化中國大數據能力,並在科研、製造、汽車等20多個領域建立高品質數據集,推動數據資源開發與利用。
今年7月在上海舉行的世界人工智慧大會上,中國進一步強調國際AI合作,並提出向數十個開發中國家提供數據資源,同時讓官方實驗室及國營媒體部分資訊供全球下載。
中國國家主席習近平在世界人工智慧大會開幕式上也強調,建立更加公平、公正的全球AI治理體系。中國官方近年持續主張AI技術應透過國際合作惠及更多國家,特別是發展中國家。
這與中國過去推動數位絲路的模式具一定相似性。美國大西洋理事會研究員狄博(Kenton Thibaut)等人今年2月發布分析指出,中國的數位絲路(Digital Silk Road, DSR)已成為北京與全球南方國家接觸的重要管道,而AI正逐漸成為其中的新核心。
也就是說,中國AI「出海」的內容已不只是聊天機器人,而是逐步涵蓋模型、雲端運算、數據中心、應用程式、人才培訓與AI治理等完整生態系。
最大問題不是模型有多強 而是「誰決定AI知道什麼」
《紐約時報》關注的是中國數據與AI模型向全球擴張後,可能產生的知識與資訊影響。中國本身擁有龐大網路使用人口,以及社群平台、電商、支付、交通等數位服務所產生的大量資料。表面看,中國似乎並不缺數據。但真正能直接拿來訓練大型AI模型的高品質數據,並非單純「資料很多」就能解決。
中國大量數據分散在政府機關、研究機構與私人企業,各部門之間存在資料流通及使用限制。因此,北京近年開始推動數據資源整合,也逐漸從大量低成本人工標註,轉向更高階的「專家型數據標註」。
相關政策甚至要求大學發展數據標註課程,鼓勵更多畢業生投入數據標註工作。這反映AI競爭正進入新的階段:過去比的是晶片、算力與模型;現在還要比誰有能力取得高品質數據,以及誰能把數據轉換成AI可以理解的知識。
美國則已形成規模龐大的專業數據服務產業。相關企業不只聘用人員辨識車輛、物體及各類影像,也招募數學家、律師等專業人士,為AI模型提供高品質的專業訓練資料。
《自然》研究敲警鐘:中文提問更容易出現親北京回答
中國數據與官方資訊進入AI訓練體系的影響,不只是理論上的擔憂。英國《自然》(Nature)5月刊登一項研究指出,政府對媒體的控制,已能透過訓練數據影響大型語言模型的輸出。
研究人員發現,中國官媒內容確實出現在大型語言模型的訓練資料中;在進一步實驗中,加入中國官媒內容後,模型對中國政治制度與領導人的回答更傾向正面。
研究團隊也測試商業AI模型,分別以中文及英文提出涉及中國政治的問題。結果顯示,在媒體自由程度較低的國家,AI使用當地語言回答政治問題時,更容易呈現親政府傾向;中國案例尤其明顯。
研究甚至發現,中國政府網站或受官方控制的中文內容,在部分大型語料庫中的出現機率,遠高於中文維基百科等資料來源。
這並不等同中國政府直接操控ChatGPT或其他美國AI公司。研究指出,更可能的問題在於:當AI公司從公開網路大量取得訓練資料時,官方媒體大量、持續且容易取得的內容,本身就可能在資料庫中占據更大比重。換言之,影響AI的不一定是直接「命令它說什麼」,也可能是長期累積的數據環境。
中國要搶的不只是使用者 還有AI話語權
澳洲戰略政策研究所(ASPI)數位研究員柯維爾(Alex Colville)曾警告,AI聊天機器人可能成為北京最關注的新戰場之一。他此前接受《紐時》分析表示,北京真正擔心的是AI聊天機器人開始說出中共不希望民眾聽到的內容,以及任何可能削弱其對「是非真偽」定義壟斷權的資訊。相關說法也被《紐約時報》中文網轉述。
大西洋理事會資深研究員狄博說,中國正努力打造低成本、開放式的「中國特色AI」,其功能雖可能與美國高價模型存在差距,但價格優勢使其對開發中國家具有相當吸引力。
這種模式目前已在全球南方市場取得進展。中國企業不只提供模型,也可以把雲端、硬體、數據中心及融資等資源搭配輸出,使一些原本沒有能力自行建設AI基礎設施的國家,可以較低成本採用中國技術。
美國哈德遜研究所近期分析也指出,中國正從過去輸出道路、港口、光纖與數位基礎建設,進一步轉向輸出完整AI生態系,包括晶片、雲端基礎設施、基礎模型、應用、人才培訓、標準與治理模式。
低成本優勢攻全球 中國AI正在改變另一場競爭
中國AI全球化的最大優勢之一,仍然是價格。相較美國大型科技企業投入巨額資金開發最先進的封閉式模型,中國企業近年大量採用開源或開放權重模式,降低全球使用門檻。
《紐約時報》近日在另一篇文章中也提到,中國開源AI模型在全球逐漸獲得大量使用者,甚至開始進入美國企業。報導稱,阿里巴巴通義千問、月之暗面Kimi等中國模型已被海外企業採用,部分美國公司也因成本優勢而使用中國模型。
這意味著中國AI戰略可能形成一個循環:先用低成本模型吸引海外使用者,再透過使用累積數據、建立技術依賴,最後讓中國企業在AI標準、應用與治理規則上的影響力同步增加。這也正是外界真正擔心的地方。
如果未來全球大量開發中國家使用中國AI模型、採用中國AI基礎設施,同時大量使用中國提供的數據,那麼中國輸出的就不再只是科技產品,而可能是一套影響人們如何搜尋、理解與解釋世界的資訊生態系。