Next Generation Artificial Intelligence
About
従来のアーキテクチャ
各メディア処理、各エンジンが完全に疎結合。
しばしばエンジンごとに別会社のものを用いており、機能間の相乗効果が見込めない。
MediaGnosisの知識集約型アーキテクチャ
人間が1つの脳で様々な処理を実施できることと同様に、
様々なメディア処理の知識を1つに集約させることで、高精度かつ柔軟性の高い判断を実現。
音声処理AI
画像処理AI
言語処理AI
一つの統合されたAIが
音声・画像・言語を処理
内部でそれぞれのAIが連携し
より高精度な出力が可能
Natural Language
Processing
自然言語処理 AI
Image and Video
Processing
画像映像処理 AI
Speech and Audio
Processing
音声音響処理 AI
Crossmodal
Processing
統合処理 AI
Key Points
AI 議事録作成
音声認識で会話をリアルタイムにテキスト化し、話者認証で「誰が話したか」を自動判定。文書分類で議題ごとに内容を整理し、会議終了と同時に構造化された議事録を自動生成します。
- 会議直後に議事録が完成
- 話者の自動判別で発言者を明確化
- 議題ごとの自動分類で検索性向上
イベント効果測定
表情推定で参加者の感情変化をリアルタイムに計測し、性別年齢推定で来場者の属性を把握。笑い声検知で盛り上がりのピークを検出し、イベントの効果を定量的に可視化します。
- 参加者の感情変化をリアルタイム計測
- 来場者の属性分析が自動化
- 盛り上がりのピークを定量的に可視化

レポート


データ
Demonstration
カメラとマイクを使用して、音声と顔映像の入力から様々な情報をリアルタイムにセンシングするアプリケーションをお試しいただけます。

Technology
これにより、1つのモデルの中に様々なAI処理機能を統合することが可能となります。
Functions
以下は、代表的な機能です。
Speech and
Audio
Processing
音声認識
音声の発話内容をテキスト化します。
複数人同時発話音声認識
複数人会話を対象に話者ごとに分けてテキスト化します。
目的話者音声認識
事前に登録した話者の音声のみをテキスト化します。
話者ダイアライゼーション
複数人会話を対象に事前登録なしに話者ごとに音声を分類します。
音声話者認識
音声が事前に登録された話者であるか否かを判定します。
音声感情認識
音声から観測される感情を分類します。
音声疑問判定
音声から疑問表現であるか否かを判定する。
話し方認識
音声の話し方(「ハキハキ」「ボソボソ」等)を分類します。
音声言語識別
音声が何語であるかを推定します。
音声年齢認識
音声から話者の年齢を推定します。
音声性別認識
音声から話者の性別を推定します。
笑い声・咳こみ認識
音声から「笑っている」「咳をしている」を認識します。
泣き声・叫び声認識
音声から「泣いている」「叫んでいる」を認識します。
発話区間検出
各音声処理の前処理として音信号から音声部分のみを抽出します。
Image and
Video
Processing
顔表情認識
顔表情の分類や顔感情価覚醒度の推定をします。
顔年齢認識
顔から年齢を推定します。
顔性別認識
顔から性別を推定します。
顔向き推定
顔の向きを判定します。
視線推定
顔の目の領域から視線の向きを判定します。
顔ランドマーク検出
顔の特徴点を検出します。
顔認証
顔が事前に登録された人物であるか否かを判定します。
マイクロジェスチャ認識
人が無意識に行っているしぐさを認識します。
グループ検出
複数の集団が映る映像内の人物グループを検出します。
行動認識
人物の行動を分類します。
服装認識
人物の服装を認識します。
所持品認識
人物の所持品を認識します。
顔・人物検出追跡
顔/人物に関する前処理として、顔/人物領域を抽出し追跡します。
画像キャプション生成
画像に対する説明文を生成します。
文字検出
情景文字認識の前処理として画像内のテキスト領域を検出します。
情景文字認識
看板などから画像に映っているテキストを認識します。
Natural
Language
Processing
タスク特化型LLM
情報抽出等に関する指示を与えてテキスト処理を行います。
テキスト要約
テキストを簡潔に要約します。
話し言葉書き言葉変換
音声認識したテキストの整形のために書き言葉調に変換します。
方言テキスト変換
テキストの方言表現を標準語に変換します。
テキスト感情認識
音声認識したテキストから感情を分類します。
音声認識結果誤り訂正
音声認識したテキストの誤認識を訂正します。
Crossmodal
Processing
第一印象推定
発話映像から観測される第一印象を分類します。
コミュニケーションスキル推定
発話映像から観測されるコミュニケーションスキルを分類します。
音声映像感情認識
発話映像から観測される感情を分類します。
画像・動画質問応答
画像・映像とそれに関する質問文に対して、回答文を生成します。
Contents

tsuzumi超軽量版
NTT公式 - tsuzumi超軽量版

多人数リモートコミュニケーション
NTT公式 - 多人数リモートコミュニケーション

次世代音声処理技術
NTT公式 - 次世代音声処理技術

文章執筆支援技術
NTT公式 - 文章執筆支援技術

次世代メディア処理AI「MediaGnosis™」
NTT公式 - 次世代メディア処理AI MediaGnosis

知識集約型マルチメディア理解技術 MediaGnosis
NTT公式 - 知識集約型マルチメディア理解技術 MediaGnosis
