CNNを利用してクイックドローの手描きデータを学習し、学習した絵を認識するアプリです。このアプリは100個の絵を認識できます。
実習で学ぶ人工知能 — 書籍の順番
書籍に載っている実習を掲載順にまとめました。前から順に進めると、認識 → 学習 → ニューラルネット → 生成へと自然につながります。
書籍をお持ちならページ番号を目印に。お持ちでなくても、この順に触っていけば大丈夫です。終了したサービスは除いています。
最初の出会い
コンピュータが自分の絵を言い当てる瞬間から始めます。
コンピュータが人を見る
顔・手・姿勢・物体。ウェブカメラひとつで認識がどこまでできるかを見ます。
MediaPipeの顔認識ソリューションは、顔の有無をすばやく検出し、6つの主要部分を表示します。この機能は簡単で処理速度が非常に高速です。
MediaPipe は顔認識ソリューションを提供します。顔の 468 点を推定し、3D 形式に変換して顔に合わせて表示します。
MediaPipe はポーズ認識ソリューションを提供します。人体全体で 33 の主要部分の位置を推定し、それらを連結してスケルトンのように見せます。
MediaPipeは手と指を追跡するためのソリューションを提供します。1〜4つの手で21の主要部分の動きを追跡できます。
MediaPipe の手、フェイスネット、ポーズの機能を統合して提供します。
MediaPipeとTensorFlowを使ってキャラクターアニメーションを作成することができます。
MediaPipeのFaceMeshを活用して顔を認識し、それに基づいて仮想アバターを作成するアプリです。
TensorFlowを使用して作成した顔認識アプリです。このアプリは、認識された顔から表情や年齢などの情報を推測して表示します。
このアプリケーションは、日常的によく見られるオブジェクトを3Dとして認識することができます。
カメラで撮影された映像に霜が付くのを除去するゲームです。このゲームは手認識モデルを活用して制作されました。
提示された絵文字のようなものを周辺で探すゲームです。CNNを介して画像を予測し、予測と正解(絵文字)の一致を確認します。
撮影した映像でリアルタイムで人のポーズや顔を認識し、これを動かすキャラクターアニメーションにするアプリです。
自分で教えてみる
出来合いのモデルを使う段階から一歩進み、自分の手で学習させます。
誰もが機械学習モデルを簡単かつ迅速に作成できるように設計されたウェブベースの機械学習学習ツールです。画像、オーディオ、ポーズモデルを作成できます。
スクラッチ 3 に機械学習ライブラリを追加したアプリケーションです
CNNを活用した画像認識機能で2048ゲームを進めることができます。
画像認識を通じて方向を操作できるようにしたパックマンゲームです。 事前訓練されたモバイルネットモデルを4方向の動き認識に活用しました。
自分で学ぶAI — 強化学習
正解は教えず、うまくできたら報酬を与える。ゲームの中で独りでに上達していく様子を眺めます。
DQN ベースの自律走行車シミュレータです。このシミュレータは、DQN を活用して車が自分で走行する方法を学習します。
DQN を活用して空避する方法を学習する過程を示すアプリです。 エージェントはセンサーから情報を受け取り、長く生きているほど多くの報酬を受けます。
DQNを活用して敵飛行機を避ける学習過程を示すアプリです。エージェントはセンサーから情報を受け取り、長く生きているほど多くの報酬を受けます。
DQNを活用してスネークゲームを学ぶ過程を見ることができます。壁や自分の体にぶつかるとマイナス報酬を、果物を食べるとプラス報酬を受けるように強化学習が進められました。
ニューラルネットワークと遺伝的アルゴリズムを使用して、フロッピーバードゲームの学習プロセスを見ることができます。
指導学習アルゴリズムを使用してゴリラのゲームプレイ方法を教えました。 TensorFlowで作成した単純なニューラルネットワークを使用しました。
MCTS アルゴリズムを使用して 2048 ゲームを学習する過程を見ることができます。一度の動きに多くのシミュレーション数を提供すると、高い確率で 2048 に達することができます。
CNN — 画像を見分ける仕組み
認識できることは見たので、次は中を開けます。層を通るたびに何が残るのかが見えます。
Kerasは、人工知能を簡単かつ迅速に実装するのに役立つディープラーニングライブラリです。デモでは、ブラウザでKerasの学習プロセスとパフォーマンスを確認できます。
ConvNetJSは、ブラウザでディープラーニングモデルを学習できるライブラリです。デモを使用すると、ニューラルネットワークの学習プロセスと結果を視覚化することができます。
クイックドローの手描きデータセットを学習し、ユーザーの絵が何であるかを認識するゲームです。このゲームはCNNを利用して絵を学習して認識します。
CNNを活用してテトリスゲームを学習する人工知能を作成しました。チャンピオンの試合データと同様に、ブロックをドロップするように繰り返し訓練されました。
ユーザーが CNN の内部動作を理解しやすくするために実装したプログラムです。画像認識プロセスを段階的に視覚化して表示できます。
TensorFlowで事前トレーニングされたディープラーニングモデルをロードして、3Dビジュアライゼーションシーンに出力します。各モデルの処理プロセスを可視化して表示できます。
ユーザーが描いた絵が何であるかを予測し、一致する可能性が高いアイコンを提示してユーザーが選択できるようにした描画アプリです。
ユーザーが問題として提示した絵を描くと、その絵が何なのか学習された人工知能が合うゲームです。
RNN — 順番を覚えるニューラルネット
前を覚えていないと成り立たないもの — 旋律、文字、動作。音楽がいちばん分かりやすい例です。
事前に訓練されたドラム RNN モデルを使用して作成されたドラム作曲アプリです
Performance RNN モデルを活用して、表の使用頻度を参考に曲を作成します。モデルは LSTM を使用して音楽構造とパターンを学習しました。
LSTMを活用して、ユーザーが作成した文字のストロークを記憶し、それに基づいて予測された文字を表示します。
RNNを活用して作成したイヤー描画アプリです。QuickDrawのデータセットを学習し、ユーザーが絵を描くと手描きのように引き継ぐ機能を持っています。
MusicVAE モデルを活用して繰り返しのメロディを作成するアプリです
Magenta と Improv RNN を活用してアルペジオパターンを演奏します。
TensorFlowとカメラを使った動き認識でキャラクターを操縦できるゲームです。ゲームキャラクターがユーザーの行動に沿って相手を攻撃します。
GAN — 存在しないものを作り出す
二つが競い合いながら本物らしいものを作ります。生成AIの前の世代です。
GANの学習プロセスをインタラクティブなビジュアライゼーションツールでリアルタイムで見ることができるプログラムです
選択した属性値で顔画像を生成する GAN モデルです。モデルの種類と属性値を変更して、必要な文字画像を作成できます。
Pix2Pix GANモデルを利用してスケッチなどのソース画像を入力して他の形式の画像に変換するサービスです。
AnimeGANモデルを利用して風景写真をアニメーション化できるサービスです。
自動運転
認識と強化学習が現実の問題で出会う場所です。最後には答えのない問いも待っています。
KITTY と NuScenes データセットを streetscape.gl (自律走行データを視覚化するためのツール) を利用して視覚化した自律走行デモです。
WebGLとThree.jsで構築された自律走行シミュレータです
複数の強化学習アルゴリズムを適用して自律走行車を訓練することができます。それぞれの強化学習過程とその結果を確認可能です。
自律走行中に発生する可能性のある倫理的な問題の状況をゲーム形式で表示するアプリです。正解があるわけではなく、他の人の選択も確認できます。
生成AI
書籍の刊行後、いちばん変わった分野です。今使われているサービスに入れ替えてあります。
GPT-5、Claude 3.5など、世界中の有名な最新AIモデルを一箇所で無料で選択して使用できる韓国のAIポータルサービスです。
OpenAIの代表的な対話型AIです。最新のGPT-5モデルを搭載し、テキストだけでなく音声で会話したり、画像を見て分析したり、絵を描くマルチモーダル機能を提供します。
GPT-5をベースにしたMicrosoftのAIアシスタント(旧: Bing Chat)です。検索エンジンBingと結合され、最新情報に基づいて回答し、DALL·E 3を通じて絵も描きます。
Googleの最新マルチモーダルAIモデルであるGemini(旧: Bard)です。テキスト、コード、画像を理解して処理でき、Googleサービスと連携して様々な情報を提供します。
ログインなしで無料で使用できるAI画像生成ツールです。かつて「DALL·E mini」という名前で有名でした。
DALL·E 3を搭載したMicrosoftの画像生成ツール(旧: Bing Image Creator)です。ユーザーが入力した文章を高品質な画像に変換できます。




















































