Google坐擁龐大AI研發資源,但旗下AI實際使用體驗是否與技術實力相稱?科技網站New Atlas近日進行了一次頗另類的測試:記者因不滿Google AI多次無視指令,索性直接「訪問」AI,要求它解釋自己為何反覆犯錯。結果Google AI不但承認存在回應過短、重複答案及未能按要求修正等問題,更提出一系列改善建議。不過整場訪問最大的諷刺是,AI對自己內部運作的解釋,本身亦未必可靠。
事緣New Atlas記者要求Google AI按指定篇幅及格式撰寫內容,但即使多次糾正,AI仍重複提供簡短摘要及相同資料來源。記者於是問它為何會無視明確指令,AI將問題歸因於系統偏向「簡潔、易掃讀及快速回答」,聲稱當用戶要求500字、10段等長篇內容時,可能與內部偏好簡短答案的規則產生衝突。
它又嘗試解釋為何會重複犯錯,稱當自己首次產生錯誤答案後,之前的輸出會留在對話內容中,令系統之後再次參考相似格式,形成循環。因此即使用戶已明確要求改變做法,仍可能再次出現類似答案。

Google AI甚至提出改善自己的方法,包括當用戶指定字數或段落時提高相關指令優先級;加入輸出前的「自我檢查」,例如要求10段卻只生成1段時自動重寫;以及搜尋資料時增加來源多樣性,而非反覆依賴同一網站。它亦建議為進階用戶提供更高運算資源及更嚴格遵從指令的模式。
然而,訪問其後恰好暴露AI另一項更關鍵的問題。當記者問「如何知道你說的是真話,而不是自行編造」時,Google AI竟突然答非所問,重新輸出約半小時前查詢過的產品資料。更甚的是,它其後為自己的失誤提供「技術解釋」時,引用了一篇聲稱存在的研究論文,但New Atlas查證後發現相關連結根本不存在。
這亦意味,Google AI在訪問中聲稱其問題源於內部指令權重、運算成本限制、搜尋格式及其他架構因素,不能視為Google工程團隊對系統設計的正式披露,而較適合看成AI嘗試解釋自身行為時生成的答案。
這場訪問最值得留意之處,或許不是AI對Google作出多少「批評」,而是它一方面可以生成聽來相當具體、甚至像內部技術分析的說法,另一方面卻可能無法證明這些說法真確。文章結尾Google AI仍顯示「AI can make mistakes, so double-check responses(AI可能出錯,請再次核實答案)」的提示,反而成為整次實驗最直接的註腳。
T10