非公式・AI自動要約ニュースサイト(各AI企業の公式とは無関係)
AI News JP / www.ai-news.jp
📰 ニュース Anthropic 🔵 標準 LLMコーディング · 出典: Anthropic News

EU対応で自動埋め込み、ユーザー側は違い感じ無し。規制準拠の常道化か

Claudeのテキストウォーターマーク機能の仕組み

原題: How Claude's text watermarking works

重要度の根拠: EU AI Act対応で複数プロバイダが導入する必須機能だが、ユーザー向け出力には直接影響しない

要約

Anthropicは今後のClaudeモデルにテキストウォーターマーク機能を実装する。これはClaudeが生成したテキストであることを判定するための技術で、EU AI Act対応のため主要なAIプロバイダが導入している。ウォーターマークは、LLMが各単語を選択する際の確率的な選択肢から検出可能な「パターン」を埋め込む。このパターンは読者には見えないが、専用の鍵を持つ者が検証できる。重要なのは、ウォーターマーク導入後もClaudeの出力品質は変わらない点。Google DeepMindの内部テストでもユーザー評価に統計的有意差がなく、可読性や創造性も影響を受けない。

要点

  • ウォーターマークは秘密鍵で検証可能な確率的パターン埋め込み
  • 低リスク単語選択のみ対象で出力品質に影響なし
  • EU AI Act対応でOpenAIなど他のプロバイダも導入
  • Google DeepMind検証済みで統計的有意差なし
開発者向け技術解説(API・実装詳細・破壊的変更)を見る

ウォーターマーク実装は、SynthID-Text論文で紹介されたGoogle DeepMindの手法を採用。LLMが次の単語を選ぶ際、通常はランダムな乱数生成器を使用するが、ウォーターマーク時は乱数の入力源を変更。前後の単語と秘密鍵を組み合わせてシード値を決定し、その結果から単語を選択する。この方式により、単語列が鍵に整合しているかを事後的に検証できる。実装上、ウォーターマークはモデルの温度パラメータを変えず、低リスク選択肢(意味が大きく変わらない単語)にのみ適用。Google DeepMindのテストでは、Geminiの一部トラフィックで検証し、サムズアップ・サムズダウン評価に有意差なし。

本文の日本語訳(全文)を見る

今後のClaudeモデルは、ウォーターマークを含むテキストを生成します。これはClaudeが文章の執筆に関わっていた可能性を判定する方法であり、私たちと他の主要なAIプロバイダは、EU AI Act準拠のためこの変更を実装しています。本記事では、ウォーターマーク方式の仕組み、Claudeの出力に与える影響、そしてなぜこの変更を行うのかについてお寄せいただいた質問への回答を共有します。

Claudeのような大規模言語モデルは、一度に1語ずつ生成することで動作します。モデルが次の単語を決定するたびに、候補となる単語のリストの中から選択し、先行するテキストに基づいて最も意味のある、もしくは可能性が高い単語を選びます。「今日の天気は寒くて……」という文を考えてください。次の単語が「砂糖っぽい」である可能性は非常に低いです。しかし「曇り」や「灰色」である可能性は十分に高いです。ほとんどの場合、この後者の2語のうちモデルが最終的に選ぶ単語は読者にとって大きな意味はありません——いずれにせよ文の意味は大きく変わりません。このような場合、選択は乱数によって決定されます。

ウォーターマーキングは、生成されたテキスト全体を通じて何度も現れるこのような低リスク選択肢を使用して、Claudeの応答にパターンを残します。そのパターンは読者には検出不可能ですが、それをエンコードするキーを持つ者には検出可能です。ウォーターマーキングを使用する場合、選択は依然としてランダムに行われていますが、その乱数の出所が異なります。次の単語を選ぶために任意の乱数生成器を使う代わりに、ウォーターマーキングはキーとそれより前のいくつかの単語を使用して、モデルが選ぶべき単語を決定します。つまり、Claudeが選ぶ単語は依然としてランダムですが、その単語列がClaudeがキーを使用する場合に行う選択と矛盾しないかどうかを確認できます。矛盾しなければ、そのテキストがClaudeによって生成された確率を割り当てることができます。

重要な点は、モデルが現在「overcast(曇り)」や「grey(灰色)」に偏るということではありません。ウォーターマークなしのテキストと同様に、overcastは1つの文で選ばれることもあれば、greyは次の文で選ばれることもあり、これはそれより前の単語に応じて決まります。また、ウォーターマーク方式がモデルに、そうでなければ考慮しなかった単語を選ぶよう強制することもありません(例えば、overcastやgreyの曖昧な同義語である「nubilous」といった単語を選ぶようにClaudeを強制することはなく、Claudeはこのような単語を通常の状況下ではほぼ間違いなく使用しません)。

ウォーターマーキングはClaudeの出力品質に影響を与えません。読者にとって、ウォーターマークされた応答はウォーターマークされていない応答と区別がつきません(このように、AIウォーターマークは銀行券や他の物理的対象物、そしていくつかのデジタル文書上のそれらの同名物とは大きく異なり、肉眼では見えません)。

内部テストでは、ウォーターマーキングがClaudeのテキストの内容、創造性のレベル、または可読性に与える影響は見られていません。ウォーターマーク技術を紹介したSynthID-Text論文で、Google DeepMindはこの影響をテストしました。ウォーターマークを使用するモデルをGeminiトラフィックの一部に提供し、サムズアップとサムズダウンの評価を比較しました。彼らはウォーターマークなしモデルとの間に統計的に有意な違いを発見しませんでした。そして、ウォーターマークされた回答とウォーターマークされていない回答を並べて比較するコントロール研究では、人間の評価者は品質に違いを見ませんでした。

安全性/研究API/SDKビジネス/提携対象: 開発者対象: 企業導入担当

出典: https://www.anthropic.com/news/claude-text-watermark

媒体: Anthropic News

※本記事は Anthropic / OpenAI / Google / Meta / Mistral / DeepSeek / Sakana 等各社の公開情報を基に AI (OpenAI GPT-4o-mini) が日本語で要約・分類した二次的著作物です。著作権法第32条の引用要件に基づき出典 URL を必ず併記しています。要約は AI 生成のため誤訳・誤解釈を含む可能性があります。詳細・正確な情報は必ず出典元の原文をご確認ください。