
記者が「自分のAIアバター」を作ってみた#
TechCrunchのシニアレポーター、Dominic-Madori Davis氏が、AIアバタースタートアップ「Synthesia」の協力のもと、自分自身のインタラクティブなデジタルアバターを作成した。このアバターはすでに公開されており、特定の記事に関する質問に回答できる状態になっている。ジャーナリストのためにこのようなアバターを作成するのは、Synthesiaとしても初の試みだという。
Synthesiaとはどんな企業か#
Synthesiaはもともとイギリスを拠点とするAIアバター分野のスタートアップで、現在はニューヨークにもオフィスを構えている。競合には D-ID、HeyGen、Colossyan などが名を連ねる。今年初めに評価額40億ドルを達成し、昨年にはARR(年間経常収益)が1億ドルを超えたと報告している。
Synthesiaが提供するサービスは大きく3種類に分類される。
- 動画作成・配信プラットフォーム(クラシックアバター): スクリプトを入力するとアバターがそれを読み上げる形式。
- エージェント型プラットフォーム「Sessions」: アバターとのサーベイやロールプレイ形式のインタラクションが可能。最近ローンチされた「Roleplay Sessions」は、たとえば営業ピッチの練習を社員がAIアバター相手に行い、応答の採点までしてもらえる機能。
- APIプラットフォーム: Synthesiaのビデオおよびボイスモデルをほかのサービスと組み合わせてインタラクティブアバターなどを構築できる。
アバターはどうやって作られたのか:技術構成を解説#
Davis氏はSynthesiaのオフィス内にある小型撮影スタジオで、多数の写真撮影と約2分間の音声録音に応じた。本人の同意を経て、以下の4種類のアバターが生成された。
- パーソナルアバター(眼鏡あり・なし): 与えられたスクリプトをそのまま読み上げるタイプ
- インタラクティブアバター(眼鏡あり・なし): 質問に応答し、聞き返すことができるタイプ
インタラクティブアバターの技術スタックは以下のモデルの組み合わせで動作している。
| ステップ | 担当モデル |
|---|---|
| 音声→テキスト変換 | 音声認識(Voice-to-Text)モデル |
| 意味理解・応答生成 | エージェント型言語モデル |
| テキスト→音声変換 | テキスト読み上げ(Text-to-Voice)モデル |
| アバター映像の生成 | Synthesiaが独自開発したビデオモデル |
Synthesia自社のビデオ・ボイスモデルが基本となっているが、顧客はCartesia、ElevenLabs、Google、OpenAIなど他社のモデルを代替として選択することも可能。また、アバターのホスティング先も任意のクラウドを利用するか、Synthesiaに委託するかを選べる。
アバター製作にかかった時間は数日程度。完成したパーソナルアバターに「ニューヨークの秋について」というスクリプトを読ませたところ、音声の再現精度はかなり高く、録音時の声のかすれが反映されていなかった点はむしろ好印象だったという。
「決定論的」アバターの特徴と限界#
今回公開されたインタラクティブアバターは**決定論的(deterministic)**な設計、つまり学習させた特定の記事の内容にのみ応答し、それ以外の質問には答えない仕様になっている。Davis氏が「TechCrunch入社前にどこで働いていたか」「ニューヨークのどの地区に住んでいるか」と聞いても、アバターは毎回その記事の話題へと誘導したという。
Davis氏の母親や友人らも体験したが、評価は「面白いけど少し不気味」という反応が多かった。インタラクティブアバターはパーソナルアバターより声や見た目の再現度がやや低いとの意見もあった一方、母親からは「すごい」という高評価を得た。
ジャーナリズムとAIアバターの未来#
この体験を通じてDavis氏は、ジャーナリズムの未来についての問いを提起している。ニュースがアバターによって伝えられる未来を人々は受け入れるだろうか。取材した投資家の一人は即座に否定的な回答を示したという。一方、アバターがジャーナリストを補完したり代替したりする可能性について、確信を持てない人もいたとのことだ。
筆者の見解: ソース記事の著者であるDavis氏自身は、ジャーナリズムの根幹は「信頼」にあり、それはAIには代替できないという考えを示している。また、非決定論的(nondeterministic)なアバター、つまり自由に話せるチャットボット型の場合、ユーザーがAIへの過剰没入に陥るリスクもあると指摘している。さらに、自分の世代であるZ世代はデジタルアバターにはなじみにくいと予測しつつも、ヒューマノイドロボットよりはアバターの方が「ログオフできる分、まだましだ」と述べている。
まとめ#
Synthesiaが提供するAIアバター技術は、PR・企業研修・コンテンツ制作など幅広い用途への展開が見えており、評価額40億ドルという数字がその期待値を示している。音声・映像・言語の複数モデルを組み合わせた技術スタックは実用レベルに達しつつあるが、「決定論的か否か」という設計の選択が体験や安全性に大きく影響することも示された。AIアバターが日常のオンライン生活にどう溶け込んでいくか、今後の動向が注目される。
出典: I created an interactive digital avatar of myself — and you can talk to it





