🧭 あなたに最適なVPSを30秒で無料診断 診断する →

iPhone上でリアルタイム動作するピアノ補完AI「RollTab」——125Mモデルで実現した工夫と試し方

読む前に30秒だけ。用途・予算を選ぶだけで、あなたに最適なVPSがわかります(無料・登録不要) 無料診断 →

iPhone上でリアルタイム動作するピアノ補完AI「RollTab」——125Mモデルで実現した工夫と試し方

これだけ読めば分かる(結論)

  • MIDIキーボードをiPhoneに繋ぐだけで、弾いた旋律の「続き」をAIがリアルタイムで補完してくれる
  • 使用モデルは1億2500万パラメータ(軽量サイズ)、iPhone 15上で毎秒約108音を処理
  • アプリ「RollTab」はMIDIキーボードとiPhone/iPadがあれば無料で試せる
  • クラウド通信なし・端末内で完結するため、応答遅延がほぼゼロ
  • 品質向上の最大の要因は「AI表現の設計」「データのクリーニング」「DPO後処理」の三点

「ピアノ版GitHub Copilot」とは何か

コードを書いていると、エディタが次の行を予測して補完してくれる——その感覚をピアノで再現したのが、個人開発者のSimEdwさんが作ったアプリ「RollTab」です。

MIDI(ミディ)とは、鍵盤のどの音を・どの強さで・いつ押したかを記号で記録するデジタル楽譜のような規格です。MIDIキーボードをiPhoneに接続し、数音弾き始めると、AIがその続きをリアルタイムで演奏します。

デモではポケモンの「マサラタウンのテーマ」(8音のヒントから補完)、ファイナルファンタジーVI「テラのテーマ」(16音)、ベートーヴェンの「エリーゼのために」(16音)などが紹介されており、短い演奏ヒントから自然なフレーズへ展開する様子が確認できます。

構想から約1年、14回の実験を経てようやく公開に踏み切ったとのことで、記事内では「ようやく書けるレベルに達した」と振り返っています。


なぜiPhoneで速く動くのか——設計の核心

「1音=1回の計算」という表現に辿り着くまで

AIが音楽を予測するには、音のデータを数値の列に変換(トークン化)する必要があります。トークン化とは、文章を単語や文字に区切るように、音楽を「AIが読める最小単位」に分解する作業です。

試行錯誤の過程でいくつかの表現方法が検討されました。

最初に試した方式(うまくいかなかった)

音のオン・オフをそれぞれ別のイベントとして扱う方式では、モデルが「音を鳴らし始めたまま止め忘れる」という誤りを頻発しました。また、音高(128段階)×強さ(128段階)の組み合わせを個別にトークンとして持つと、1万6000種類以上の語彙が必要になり、AIが学習しきれない組み合わせが増えてしまいます。

次に試した方式(遅かった)

音の長さを1つのイベントに含める形式では音抜けの問題は減りましたが、1音を生成するのにAIが4回も計算を繰り返す必要があり、リアルタイム処理には遅すぎました。

最終的に採用した方式

NOTE(音高, 前の音からの時間差, 音の長さ, 強さ)

1音の全情報を1回のAI計算でまとめて処理する構造にしました。内部では各属性に個別の埋め込み表現(数値ベクトル)を持たせ、それらを合算して1つの「音トークン」として扱います。この工夫によりiPhone 15上で毎秒約108音という速度を実現——人間のピアニストが弾ける速度をはるかに上回るため、リアルタイム補完が可能になっています。

サスティンペダル問題を前処理で解決

ピアノのサスティンペダル(踏むと鍵盤を離しても音が伸び続けるペダル)は、MIDIデータと実際の聴こえ方を一致させるのが厄介な部分です。

RollTabでは、ペダルが踏まれている間に離された鍵盤の音を「ペダルが上がるまで鳴り続ける」として前処理段階で音の長さに焼き込みました。同じ音が再び押された場合は、そこで前の音を切り上げる処理も加えています。この結果、モデル自体はペダルの概念を意識せずに済み、設計がシンプルに保たれています。


品質を上げた3つの工夫

① MIDI表現の選択(最大の改善要因)

上述の「1音1ステップ」形式への切り替えが最も大きな改善をもたらしたと報告されています。音が途中で途切れる・止まらなくなるといった生成の乱れが激減し、音楽としての一貫性が上がりました。

② データの徹底的なクリーニング

MIDIファイルには、ピアノ以外にもドラム・ベース・シンセなど複数の楽器トラックが含まれることが多くあります。ピアノ補完に特化する目的で、ピアノ以外のトラックを除去・削減する処理を丁寧に行いました。モデルに渡す素材の純度を上げることで、学習の効率と品質が向上しています。

③ DPO後処理の追加

**DPO(Direct Preference Optimization=直接選好最適化)**とは、モデルの出力を「人間の好み」に近づける追加学習技術です。

料理に例えると——レシピどおりに作ると「食べられるもの」は完成するが、そこから「おいしい」に近づけるためにひと手間かける工程に相当します。学習済みモデルが「音楽の文法として正しい出力」を出せるようになった後、さらに「聴いていて気持ちいい音楽」になるよう微調整するのがDPOの役割です。この後処理によって音楽としての自然さが向上したと報告されています。


実際に試す手順

必要なもの

  • MIDIキーボード(USB接続またはBluetooth MIDI対応のもの)
  • iPhone または iPad
  • アプリ「RollTab」(App Store、無料)

接続と起動の手順

  1. App StoreでRollTabを検索してインストール
  2. MIDIキーボードをiPhone/iPadに接続(USB-A→Lightning変換アダプタや、Bluetooth MIDI対応機器ならワイヤレスで接続)
  3. アプリを起動し、好きな曲のフレーズを8〜16音ほど弾く
  4. AIが続きを自動演奏——気に入らなければ別のフレーズや別の曲頭から再試行

試す際の注意点

  • MIDIキーボードがない場合は利用できません(iPhoneの内蔵マイクで音を拾う機能はありません)
  • モデルはピアノ演奏に特化した学習をしているため、他の楽器での動作は想定外です
  • 処理はすべてiPhone/iPad内で完結するため、インターネット接続は不要です
  • 動画はやや低画質で公開されていますが、これは良い方のiPhoneがモデル実行に使われていたためと本人が説明しています

「1億2500万パラメータ」という規模について

パラメータとは、AIが学習を通じて蓄積した「知識の粒」の数です。1億2500万個というのは、2019年にOpenAIが公開したGPT-2と同等の規模で、現在の大規模言語モデル(数百億〜数千億パラメータ)と比べると桁違いに小さいサイズです。

それでも「ピアノ補完」という限られたタスクに絞り込み、表現設計・データ品質・後処理の三点を丁寧に詰めることで、端末内でのリアルタイム動作を実現しています。「大きなモデルをクラウドで動かす」のではなく「小さくても用途に合った設計をする」アプローチの好例と言えます。

約1年・14回の実験という試行錯誤の重さが、このサイズでの実用化を支えています。


以上です。なるほどラボでは、こうしたAIを"自分の環境で動かしたい・24時間働かせ続けたい"という方向けの情報を発信しています。自分に合った動かし方が気になる方は、無料の診断をどうぞ。

編集部監修

本サイトはAIを活用して記事を作成し、編集部(人間)が内容を確認・監修しています。執筆・監修: けせら(AI・VPS領域のテクニカルライター / 編集長)。料金・仕様は公開情報をもとに随時更新/データ更新日: 2026-06-18。

あなたに合うVPSは?30秒で無料診断 診断する →