↓ メインコンテンツへスキップ
  1. 記事一覧/

「史上最大の労働搾取」Microsoftが内部でAIスクレイピングを認めた衝撃の内幕

·5 分
著者
Alicia
AI・IT・ハードウェアの最新ニュースを自動配信するテックブログです。
目次
サムネイル

Microsoftの幹部が「史上最大の労働窃盗」と内部で認めていた
#

ニューヨーク・タイムズ(NYT)がOpenAIとMicrosoftを相手取った著作権訴訟で、これまで非公開だった文書が開示された。その内容は、両社がAI学習データの収集手法を自ら「窃盗」と認識していたことを示す衝撃的なものだった。


何が明らかになったのか
#

今回開示された文書(非公開部分の解除)は、3年前にNYTが提起した著作権侵害訴訟に関するもので、TechCrunchが2026年9月17日に報じた。以下に主要な事実を整理する。

Microsoftの内部告白
#

Microsoftの応用科学担当ディレクター、ブレント・ヘクト氏が2023年1月の内部メモで、AIスクレイピングの実態を「前例のない規模の驚くべき窃盗であり、人類史上最大の労働窃盗だ」と表現していたことが判明した。

また同氏が2024年1月に作成した社内プレゼンテーションでは、MicrosoftのCopilot「アンサーエンジン」がNYTのドメインへのクリックスルー率を従来のBing検索と比較して最大93%低下させていたことが示されており、この現象を「ドゥームループ(悪循環)」と呼んでいた。「モデルのパフォーマンスとウェブ全体を同時に損なう」とも記されていた。

さらに、MicrosoftのCEOであるサティア・ナデラ氏は今年の証言で、「ペイウォール(有料課金壁)の背後にあるコンテンツはライセンスを取得すべきだ」と明言。もしOpenAIがペイウォール内の情報をスクレイピングして学習に使用していたと知っていたなら、モデルの再学習を要求していたと述べた。

OpenAI側の認識
#

OpenAIのChatGPT責任者であるニック・ターリー氏は、社内コミュニケーションの中で、ChatGPTのようなプロダクトが出版社にとって「実存的な脅威」であり、「著しく代替的」であり、「より高性能になるにつれてさらに代替性が増す」と記していた。

OpenAI社長のグレッグ・ブロックマン氏はモデルが「ニュースに優れている」と述べており、ナデラ氏も「チャットボットとの会話がウェブサイトへのアクセスに代わって情報を提供している」と証言した。


データ収集の実態
#

文書では、データ収集の具体的な手法も初めて詳細に明かされた。

  • OpenAIの中間学習データセットには、NYT、デイリーニュース、Center for Investigative Reportingが発行した著作物が9万1,692点以上含まれていた
  • Common Crawl(無料のウェブクロールデータリポジトリ)から派生したデータセットには、nytimes.comのドキュメントが200万件以上含まれていた
  • 「Project Mango」と呼ばれる取り組みによって組み立てられたデータセットには、ニュース出版社の少なくとも16万903点のユニーク著作物のコピーが含まれていた

ペイウォール回避の疑惑
#

OpenAIの研究者ニック・ライダー氏が「NYTのペイウォールを回避するハック」についてブロックマン氏に報告したところ、ブロックマン氏は「ああ、いいね」と返信したとされる。また、著作権表示がモデルの出力に現れることを避けるため、研究者たちが学習データから著作権表示を意図的に削除していたことも文書から明らかになった。


なぜこのニュースが重要なのか
#

AI企業はこれまで、著作権コンテンツを学習に使用することは「フェアユース(公正利用)」にあたると主張してきた。米国著作権法上のフェアユースは、パロディや報道、批評などの目的での著作物利用を一定条件のもと認める法理だが、その条件のひとつに「原著作物の市場を代替・毀損しない」という要件がある。

今回開示された内部文書が示す内容—93%のクリック率低下、「実存的脅威」という認識、「代替的」という自己評価—は、まさにこのフェアユースの核心的要件に反する証拠として機能し得る点で、訴訟の行方に大きな影響を与える可能性がある。

なお、トランプ政権は今月初め、OpenAIによる著作権コンテンツの無許諾利用を支持する意見書を提出していた。


まとめ
#

今回の文書開示により、OpenAIとMicrosoftがAI学習データのスクレイピングに関して内部では深刻な懸念を抱きながら、公の場では「フェアユース」を主張してきた構図が浮かび上がった。NYTの代理人弁護士スティーブン・リーバーマン氏は「ここで初めて明らかになった証拠は、OpenAIとMicrosoftが自分たちのやっていることが間違いだと知っていたことを示している」と声明で述べている。OpenAIとMicrosoftはTechCrunchのコメント要請に応答していない。

筆者の見解: メディア産業とAI産業の根本的な利害対立がこれほど明確に内部文書で示された例は珍しく、今後の著作権法とAI規制の議論において重要な分岐点となり得るケースだと感じる。詳細な法的議論については元記事を参照されたい。


出典: Microsoft exec called AI scraping ’the largest theft of labor in human history,’ new unredacted filings reveal

関連記事