Claude浮水印到底怎麼運作?Anthropic揭細節:輕微改字恐無法移除

記者彭夢竺/編譯

Anthropic日前宣布為遵循歐盟《人工智慧法案》(EU AI Act)透明度規範,將在Claude生成的文字中加入使用者肉眼無法察覺的「浮水印」。消息曝光後引發不少使用者疑慮,Anthropic進一步公布技術細節,強調浮水印不會影響Claude輸出品質,單純修改少數文字也未必能完全移除,但若將內容徹底重寫,浮水印則可能消失。

Anthropic將在Claude生成的文字中加入使用者肉眼無法察覺的「浮水印」。(圖/AI生成)
Anthropic將在Claude生成的文字中加入使用者肉眼無法察覺的「浮水印」。(圖/AI生成)

浮水印藏在「用字選擇」 閱讀不會發現

Anthropic表示,Claude的文字浮水印並不是在文章中加入肉眼可見的特殊符號,而是利用模型產生文字時的「低風險選擇」建立特定模式。

例如描述天氣時,「overcast」與「grey」可能都是合理選擇,Claude可以在這類不影響內容品質的用字選擇中形成特定規律,一般讀者無法察覺差異,但持有對應辨識金鑰的系統則能偵測出這些模式。

Anthropic強調,加入浮水印不會影響Claude的輸出品質,對一般讀者而言,有浮水印與沒有浮水印的回答看起來沒有差異。

技術採Google DeepMind SynthID-Text

Claude將採用Google DeepMind團隊2024年公布的SynthID-Text技術,Anthropic未來也計畫推出浮水印偵測API,讓系統能夠判斷文字中是否存在相關標記。

Anthropic也特別區分「浮水印」與一般AI文字偵測工具的不同。部分AI偵測服務會分析文章中的特定語言習慣、句型或寫作特徵,推測內容是否由AI產生;浮水印則是在AI生成階段主動建立特定模式,兩者運作方式並不相同。

改幾個字沒用?徹底重寫才可能消失

不少Claude使用者關心,只要稍微修改AI生成內容,是否就能讓浮水印消失。Anthropic表示,確實可以透過重新編輯內容影響浮水印,但「輕微修改」很可能不足以完全移除。

相較之下,如果整段內容被完整重寫、幾乎每個字詞都遭到替換,原有浮水印就可能消失。不過Anthropic也指出,如果文字已經被徹底重寫,這時是否還能將內容定義為「AI生成」,本身就存在討論空間。

這項設計也意味著,浮水印偵測並非單純的「有或沒有」。文字經過多少修改、保留多少Claude原始生成內容,都可能影響最終能否辨識。

只叫Claude校稿 不一定會被標記

對於使用者只是將自己撰寫的文章交給Claude校稿、潤飾或修改,Anthropic表示,能否偵測到浮水印,主要取決於文字長度以及Claude實際修改的程度。

如果Claude只進行少量編輯,文章絕大多數文字仍由人類作者撰寫,就幾乎沒有足夠的AI生成文字可以附著浮水印,因此未必能被辨識。

反過來說,如果使用者提供一段文字後,要求Claude大幅改寫甚至重新生成內容,AI實際產生的文字比例越高,就越可能留下可供系統辨識的浮水印模式。

寫程式影響更小 註解仍可能留下浮水印

至於程式碼,Anthropic表示,浮水印的影響預期會比一般文字更小。主要原因在於,Claude產生程式碼時首先必須確保程式能正常運作,因此模型可以自由選擇不同詞彙或表達方式的空間較少,能夠植入浮水印模式的位置自然也比較有限。

不過,在不影響程式功能、存在多種合理文字選擇的地方,例如程式碼中的註解,仍可能加入浮水印。Anthropic強調,這項機制對實際產生的程式碼影響將非常有限。

未來更多AI生成文字可能有浮水印

Anthropic此次加入文字浮水印,主要是為了遵循歐盟AI法案的透明度規範,讓AI生成內容能透過技術方式被辨識。

消息公布後也引發Claude使用者討論,部分使用者擔心AI協助撰寫或修改的內容可能因此被辨識,甚至有人宣稱取消Claude訂閱;另一方面,也有使用者認為,標示AI生成內容有助於提升透明度。

Anthropic則指出,Claude不會是唯一導入文字浮水印的AI聊天機器人,其他簽署相同實務準則的主要AI模型開發商,也將陸續建立自己的浮水印機制。

隨著生成式AI越來越深入寫作、程式開發及工作流程,未來AI內容辨識可能不再只依賴「看起來像不像AI寫的」,而是逐漸轉向在內容生成階段就留下可供系統辨識的技術標記。

資料來源:Techcrunch

Loading

發佈留言

Back to top button