Clef-omniでの音声判定テストをやってみる
ClefというCloudflare版のjev系というかDecisions APIを試してみた。
その中でもClef-omniというのが出ていて、マルチモーダルに対応しているらしい。というところで簡易的な音声入力を試してみる。
https://github.com/sameharukon/clef-omni-test
やってみたのは単純な3レーンゲーム(AIが一瞬で作れる程度)で、これを「右」か「左」かを指示して操作させる。
でやってみたんだけど応答が150~200msぐらいでそれなりな制度で実現はできた。「みぎ」の判定がトークンが短すぎて若干あやしいので「ひだり」でなければ右という判定に調整したところほぼ100%という感じにできそう。
1判定あたりだいたい200トークンぐらいで、Workers Freeの無料実行枠でも3500回/日ぐらいはいける。従量課金換算だと1000回で5円ぐらい。
まあやすいっちゃやすいけど、ゲーム用途に組み込むにはもっと安くないとだめかも。クライアント側で処理できる必要性はありそう。EmbeddingGemma 2とかクライアント組み込み可能でそれなりに精度がいいモデルはぼちぼちでているので、ちょっとした判定を汎用的にできるモデルが組み込まれるようになるといろいろできそうではある。
Decisions API系はマルチモーダルは色々できそうではあるけどあんまり経済的ではないかな。テキストの判定はもっと安いのでそっちで考えたほうが良さそうではある。