AI幫忙工作反而出錯?微軟研究揭LLM長期代辦恐「越改越亂」
生成式AI愈來愈能「代打」工作,從整理資料、修改文件到撰寫程式,都有人開始交給AI代理人處理。但AI真的能一路放心交辦嗎?微軟研究團隊最新研究給出的答案恐怕沒那麼樂觀:當工作變得複雜、需要AI長時間反覆修改文件時,即使是目前最頂尖的大型語言模型(LLM),也可能在過程中悄悄改錯內容。

研究團隊推出DELEGATE-52評測,專門測試AI在長時間「受委派」工作中的表現,涵蓋程式設計、晶體學、音樂記譜等52個專業領域,並測試19款LLM。研究結果顯示,Gemini 3.1 Pro、Claude 4.6 Opus及GPT-5.4等前沿模型,在經過長時間、多輪文件編輯後,平均約有25%的文件內容遭到破壞。值得注意的是,這裡的25%並不是「AI回答錯誤率」,而是研究團隊衡量文件內容受到破壞的程度。
小錯誤不一定小 AI可能改了內容卻沒人發現
研究團隊指出,LLM造成的問題並不一定是整份文件突然「大爆炸」,反而可能是零星、分散的錯誤。例如原本正確的內容在多次修改後被悄悄改動,使用者如果沒有逐項核對,很可能根本沒察覺。
「AI履歷健檢」看見自己優勢:https://campaign.1111.com.tw/resume-review/
更多科技工作請上科技專區:https://techplus.1111.com.tw/
問題更麻煩的是,這類錯誤可能會隨著互動次數增加而累積。換句話說,AI第一次修改看起來沒問題,不代表讓它繼續處理10次、20次後,文件仍能維持原本的完整性。微軟研究人員因此認為,現有LLM在這種長時間委派情境下,仍屬於「不可靠的工作代理人」。
延伸閱讀:打電動也能替履歷加分?82% IT主管更願考慮玩家 遊戲技能成求職新亮點
文件越大、交辦越久 AI失真情況可能更嚴重
研究也發現,文件規模、AI與文件互動的長度,以及工作環境中存在與任務無關的「干擾檔案」,都可能讓文件內容退化程度更加嚴重。研究團隊另外測試讓AI使用代理工具,結果也沒有改善DELEGATE-52的整體表現。
這項研究並非宣稱AI不能拿來工作,而是提醒企業:「能完成任務」與「能長時間可靠地完成任務」是兩回事。 對需要持續編輯的重要文件而言,若完全放手讓AI一路處理,表面上省下人力與時間,卻可能在不知不覺間留下內容錯誤。
隨著AI代理人逐漸進入企業工作流程,如何在效率與可靠度之間取得平衡,也成為下一階段AI應用的重要課題。對涉及合約、財務、研究或其他重要資料的文件,人工複核、版本留存與修改紀錄仍不可少,避免AI在「幫忙」的過程中,反而把原本正確的內容越改越偏。
資料來源:ITPro
![]()





