Next Generation Artificial Intelligence

About

「MediaGnosis®」は、音声音響処理・画像映像処理・自然言語処理・クロスモーダル処理といった
マルチメディアの情報処理を統合的にオールインワンで扱うことで、
これまでよりも効率的な「学習」と高精度かつ総合的な「推論」を実現する
次世代メディア処理AIです。
「MediaGnosis®」は、
音声音響処理・画像映像処理・自然言語処理・
クロスモーダル処理といった
マルチメディアの情報処理を統合的に
オールインワンで扱うことで、
これまでよりも効率的な「学習」と
高精度かつ総合的な「推論」を実現する
次世代メディア処理AIです。

従来のアーキテクチャ

各メディア処理、各エンジンが完全に疎結合。
しばしばエンジンごとに別会社のものを用いており、機能間の相乗効果が見込めない。

MediaGnosisの知識集約型アーキテクチャ

人間が1つの脳で様々な処理を実施できることと同様に、
様々なメディア処理の知識を1つに集約させることで、高精度かつ柔軟性の高い判断を実現。

A社製
音声処理AI
B社製
画像処理AI
C社製
言語処理AI

一つの統合されたAIが
音声・画像・言語を処理

内部でそれぞれのAIが連携し
より高精度な出力が可能

Natural Language
Processing

自然言語処理 AI

Image and Video
Processing

画像映像処理 AI

Speech and Audio
Processing

音声音響処理 AI

Crossmodal
Processing

統合処理 AI

Key Points

01
世界トップクラスの AI 機能群をオールインワンで提供。
ニーズに合った機能を必要なだけ選んで使えます。

AI 議事録作成

音声認識で会話をリアルタイムにテキスト化し、話者認証で「誰が話したか」を自動判定。文書分類で議題ごとに内容を整理し、会議終了と同時に構造化された議事録を自動生成します。

  • 会議直後に議事録が完成
  • 話者の自動判別で発言者を明確化
  • 議題ごとの自動分類で検索性向上

イベント効果測定

表情推定で参加者の感情変化をリアルタイムに計測し、性別年齢推定で来場者の属性を把握。笑い声検知で盛り上がりのピークを検出し、イベントの効果を定量的に可視化します。

  • 参加者の感情変化をリアルタイム計測
  • 来場者の属性分析が自動化
  • 盛り上がりのピークを定量的に可視化
02
マルチモーダル情報と LLM を複合的に用いた推論が可能。
様々なビジネスシーンで単体 AI では実現が困難な価値を提供可能に。
Case1
AI ロールプレイ
AI ロールプレイ
面談練習、接客シミュレーションなどのスキルアップトレーニングを、自分のペースで実施可能に。ヒューマンリソースの効率化、育成コストの削減へご活用ください。
マイク
カメラ
MediaGnosis
音声認識タスク特化型LLM顔表情認識第一印象推定音声感情認識
ロールプレイ
レポート
Case2
営業サポート
営業サポート
複数人での会話を話者別に分析できます。話者別のマイクの準備は不要、発声が重なっていても分析可能です。営業活動や店舗窓口業務のサポートにご活用ください。
マイク
MediaGnosis
複数人同時発話音声認識話者ダイアライゼーション音声感情認識音声年齢認識音声性別認識話し言葉書き言葉変換話し方認識
対話記録
Case3
グループ分析
グループ分析
映像内の人物についての分析だけでなく、「誰と誰が同じグループか」を推定可能です。オフィスやオープンスペースの利用者分析、展示会でのオートマーケティングなど、広い用途にご活用ください。
カメラ
MediaGnosis
顔・人物検出追跡グループ検出顔年齢認識顔性別認識顔表情認識行動認識所持品認識マイクロジェスチャ認識
構造化
データ
03
高性能かつ超軽量。全ての推論処理を CPU 上で実現。
リソースコストの削減や小規模システムにも向いています。

Demonstration

MediaGnosisの各種機能をブラウザから手軽にお試しいただくことができます。

カメラとマイクを使用して、音声と顔映像の入力から様々な情報をリアルタイムにセンシングするアプリケーションをお試しいただけます。

Technology

MediaGnosisの「知識集約型アーキテクチャ」では、入力情報(音声音響情報・画像映像情報・自然言語情報、など)、および出力情報(数値・ベクトル・ラベル・テキスト、など)の両者に対して、複数の機能間で同様の役割を持つ情報処理機構(理解部)を、複数の機能間で共通化できます。
これにより、1つのモデルの中に様々なAI処理機能を統合することが可能となります。

Functions

MediaGnosisでは様々な機能がサポートされてます。また、知識集約型アーキテクチャ以外にも、サポートする機能ごとに、査読付き国際会議や論文誌にも採録されているNTT独自技術が複数内包されています。
以下は、代表的な機能です。

Speech and
Audio

Processing

  • 音声認識

    音声の発話内容をテキスト化します。

  • 複数人同時発話音声認識

    複数人会話を対象に話者ごとに分けてテキスト化します。

  • 目的話者音声認識

    事前に登録した話者の音声のみをテキスト化します。

  • 話者ダイアライゼーション

    複数人会話を対象に事前登録なしに話者ごとに音声を分類します。

  • 音声話者認識

    音声が事前に登録された話者であるか否かを判定します。

  • 音声感情認識

    音声から観測される感情を分類します。

  • 音声疑問判定

    音声から疑問表現であるか否かを判定する。

  • 話し方認識

    音声の話し方(「ハキハキ」「ボソボソ」等)を分類します。

  • 音声言語識別

    音声が何語であるかを推定します。

  • 音声年齢認識

    音声から話者の年齢を推定します。

  • 音声性別認識

    音声から話者の性別を推定します。

  • 笑い声・咳こみ認識

    音声から「笑っている」「咳をしている」を認識します。

  • 泣き声・叫び声認識

    音声から「泣いている」「叫んでいる」を認識します。

  • 発話区間検出

    各音声処理の前処理として音信号から音声部分のみを抽出します。

Image and
Video

Processing

  • 顔表情認識

    顔表情の分類や顔感情価覚醒度の推定をします。

  • 顔年齢認識

    顔から年齢を推定します。

  • 顔性別認識

    顔から性別を推定します。

  • 顔向き推定

    顔の向きを判定します。

  • 視線推定

    顔の目の領域から視線の向きを判定します。

  • 顔ランドマーク検出

    顔の特徴点を検出します。

  • 顔認証

    顔が事前に登録された人物であるか否かを判定します。

  • マイクロジェスチャ認識

    人が無意識に行っているしぐさを認識します。

  • グループ検出

    複数の集団が映る映像内の人物グループを検出します。

  • 行動認識

    人物の行動を分類します。

  • 服装認識

    人物の服装を認識します。

  • 所持品認識

    人物の所持品を認識します。

  • 顔・人物検出追跡

    顔/人物に関する前処理として、顔/人物領域を抽出し追跡します。

  • 画像キャプション生成

    画像に対する説明文を生成します。

  • 文字検出

    情景文字認識の前処理として画像内のテキスト領域を検出します。

  • 情景文字認識

    看板などから画像に映っているテキストを認識します。

Natural
Language

Processing

  • タスク特化型LLM

    情報抽出等に関する指示を与えてテキスト処理を行います。

  • テキスト要約

    テキストを簡潔に要約します。

  • 話し言葉書き言葉変換

    音声認識したテキストの整形のために書き言葉調に変換します。

  • 方言テキスト変換

    テキストの方言表現を標準語に変換します。

  • テキスト感情認識

    音声認識したテキストから感情を分類します。

  • 音声認識結果誤り訂正

    音声認識したテキストの誤認識を訂正します。

Crossmodal

Processing

  • 第一印象推定

    発話映像から観測される第一印象を分類します。

  • コミュニケーションスキル推定

    発話映像から観測されるコミュニケーションスキルを分類します。

  • 音声映像感情認識

    発話映像から観測される感情を分類します。

  • 画像・動画質問応答

    画像・映像とそれに関する質問文に対して、回答文を生成します。

Contents

tsuzumi超軽量版

NTT公式 - tsuzumi超軽量版

多人数リモートコミュニケーション

NTT公式 - 多人数リモートコミュニケーション

次世代音声処理技術

NTT公式 - 次世代音声処理技術

文章執筆支援技術

NTT公式 - 文章執筆支援技術

MOTESSENSE

次世代メディア処理AI「MediaGnosis®」が潜在的なモテ因子(=魅力的な個性)を発見。5つの観点から個性を分析し、自分らしい魅力向上のためのアドバイスをお届け。

次世代メディア処理AI「MediaGnosis™」

NTT公式 - 次世代メディア処理AI MediaGnosis

知識集約型マルチメディア理解技術 MediaGnosis

NTT公式 - 知識集約型マルチメディア理解技術 MediaGnosis