カカオは自社開発のオムニAIモデル「カナナ・オ(Kanana-o)」の音声生成技術を一段引き上げたと4日に明らかにした。

従来の音声AIが自然にテキストを読み上げることに焦点を当てていたのに対し、カナナ・オは利用者が望む話し方や感情、抑揚を反映する。利用者が「とても速く読んで」「低い声で読んで」「悲しい声で読んで」「キョンサンド方言で読んで」のように自然言語で望む発話方式を指示すると、AIが速度、音量、音の高さはもちろん、感情や抑揚、強度まできめ細かく反映して音声を生成する。

/##カカオ## 提供

このほか「スポーツ中継のように」「アナウンサーのように」「童話の読み聞かせのように」といった役割ベースの指示はもちろん、「トーンを下げて速く、悲しい声で読んで」のように複数条件を同時に含む複合指示も実行できる。

カカオは、カナナ・オが発話指示の履行能力を評価する「InstructTTSEval」韓国語ベンチマークで94.50点を記録し、GPT-4o-mini-tts(91.10点)を上回ったと明らかにした。

カナナ・オは自社開発の音声トークナイザーLM-SPT(LM-aligned SPeech Tokenizer)を通じて生成速度と効率も同時に高めた。LM-SPTはAIが音声をより少ないトークン数に圧縮して表現する技術である。AIが処理すべきデータ量を減らし、より高速かつ効率的に音声を生成する。

ノ・ビョンソク カカオユニファイドファウンデーションモデル成果リーダーは「今後カナナ・オモデルを多様なサービスに適用し、より自然で便利なAI音声体験を提供する」と述べた。

※ 本記事はAIで翻訳されています。ご意見はこちらのフォームから送信してください。