中国工程院院士王耀南氏インタビュー:人工知能が機械視覚をインテリジェントにする

May 07, 2024 伝言を残す

ビッグランゲージモデルを原動力とする人工知能の発展により、グラフィック図像学の研究と応用は新たな機会を迎え、ビッグランゲージモデルからビッグビジョンモデルへの発展を促進している。2023年12月30日、大晦日と元旦に、中国工程院院士、ロボット視覚認識制御技術国家工程研究センター所長の王耀南氏は、中国グラフィック・グラフィックス学会第19回若手科学者大会で、マシンビジョンインテリジェンス発展の最新動向を共有した。

 

南都記者との独占インタビューで、王耀南氏は、人工知能は機械視覚をインテリジェントにし、より高い演算能力は大型視覚モデルのトレーニングをサポートできると述べた。しかし、よりスマートな大型視覚モデルには、より高い演算レベル、より優れたモデルアーキテクチャ、より効果的な学習アルゴリズムも必要となる。

 

この会議は、中国画像グラフィックス協会、琶洲研究室、華南理工大学、中山大学、中国画像グラフィックス協会青年部会によって主催されています。

 

業界のトレンドについて話す

 

ビジュアルコンピューティングからビジュアルインテリジェンスへ

 

王耀南氏:中国のマシンビジョン研究には40年近い歴史があり、最初はセンサーの研究、つまり光情報を画像情報に変換することから始まりました。次に行うことは、取得した画像をより鮮明にするための強化を含む視覚処理です。

 

鮮明な画像が得られたら、画像から興味のあるターゲットを取得する必要があります。たとえば、無人運転の分野では、マシンビジョンは画像内のターゲットを検出し、どれが人でどれが車であるかという質問に答える必要があります。

 

これらは、マシン ビジョンの 3 つの主要領域と呼んでいます。要約すると、イメージング、処理、理解です。

 

マシンビジョンは、過去のビジュアルコンピューティングから今日のビジュアルインテリジェンスへと移行しました。人工知能と組み合わせたビジュアルコンピューティングにより、認知レベルが向上し、複雑な環境を理解する能力が強化され、ビジュアルインテリジェンス業界全体が昨年急速な発展を遂げました。

 

マシンビジョンインテリジェンスの開発の方向性は、産業検査、インテリジェント製造、衛星リモートセンシングなどの分野に適用される幅広いアプリケーションを実行することです。

 

マシンビジョンについて話すとき、その応用、応用主導の技術開発について話さなければなりません。中国画像グラフィックス協会には30の専門委員会があり、主にグラフィック画像を中心に研究を行い、国民経済に貢献しています。これらの技術には、産業、農業、地理情報システム、リモートセンシング、土地資源など、幅広い応用シナリオがあります。

 

人は生まれた時に世界を見ることができ、その後世界を理解することができ、情報の80%は視覚によって獲得されます。マシンビジョンは人間の目をシミュレートし、最終的には人間の目のレベルに到達し、いくつかの側面では人間の目を超えて、より遠くを見、より鮮明に見ることができます。

 

ビッグビジョンモデルについて語る

 

ビッグビジュアルモデルはますますインテリジェントになる

 

Yao-Nan Wang: Big Language Model は、書籍、言語、テキストからの知識をデータとして使用し、学習した内容に基づいて推論して回答できるニューラル ネットワーク モデルをトレーニングするデータ駆動型 AI です。

 

一方、大視覚モデルのデータは主にさまざまな画像から取得され、その中には人間や自然が生成した視覚データも含まれます。例えば、医療大視覚モデルは、人間の臓器や病変の画像を視覚データとして大モデルに入力し、トレーニングすることで、医師のようにCT写真を読み取り、患者が診察に来た際に写真を撮影して患者の状態を推論する効果が得られます。

 

現在の視覚モデルは、私たちが想像するほど人間の脳と同じではなく、そのギャップはまだ非常に大きいです。学習データの増加とモデルパラメータの調整により、モデルはますます大きくなり、知識もますます増え、その知能レベルはますます高くなり、より賢くなります。

 

モデルをより速く構築し、解釈可能性や安全性、制御性を高めたより優れたモデル アーキテクチャを設計し、より効果的な学習アルゴリズムを研究するためには、演算能力のレベルを高め、計算速度を加速する必要があります。

 

実際のところ、ビジュアル マクロモデリングはここ数年で目新しいものではなく、段階的に開発されてきました。1980 年代には、人工知能の発展に伴い、ニューラル ネットワークの研究が始まりました。ここ数年で、演算能力とアルゴリズム能力が向上し、大規模なモデルを構築できるようになり、大規模な言語モデルや大規模なビジュアル モデルが誕生しました。過去には、演算能力が十分でなかったため、それほど大規模なモデルは作成されませんでした。

 

2024年の見通しについて

 

この事業が広州から全国、そして世界へと拡大していくことを期待しています。

 

王耀南:湖南大学ロボット視覚認識・制御技術国家工学研究センターは、2022年に広東・香港・マカオ大湾区に位置する広州増城に移転し、湖南大学広東・香港・マカオ大湾区イノベーション研究所(広州増城)を設立しました。

 

当研究所は、機械のインテリジェントビジョンの研究と応用に重点を置いており、インテリジェント製造、医療、製薬分野の特殊操作ロボット、および汎用大型ビジョンモデルなどが含まれています。たとえば、これらの研究は製造業に応用されており、特に3Cおよびハイエンド部品業界では、多数の労働者を置き換え、製品の品質検査を完了することができます。現在、当研究所はソフトウェアとハ​​ードウェアのシステムを開発しており、その主な機能は広東企業のデジタル化とインテリジェント化を促進し、製造業の発展を促進することです。

 

さらに、当研究所では、非常に多くのアルゴリズムを備えた産業用インターネット ソフトウェアなど、主にハイエンドのインテリジェント機器の製造に使用されるインテリジェント マシン ビジョンおよび制御システムも行っています。

 

広東省は改革開放の最前線であり、経済の主戦場です。産業チェーンとサプライチェーンが完備しており、多くの製造企業が集まっています。当社が広東省に進出したのは、まず市場の需要があったからです。また、当社の研究センターには、広東省に多数の研究開発チームがあり、多くのプロジェクトを上陸させ、科学技術の成果を転換させています。

 

2023年上半期には、部品の供給を中心にいくつかの課題に直面しました。2024年には、これらの問題が解決され、広東省のAI産業の産業チェーン、サプライチェーン、研究開発能力が向上し、大きな国内市場で新しい軌道が切り開かれ、活気に満ちた雰囲気の中で、誰もが自発的に行動し、革新することで、課題はすべて解決できると信じています。

 

私は広東省のAI産業の発展に自信を持っています。過去30年間、私たちは科学技術の自立に向けて多大な努力を払い、多くの科学研究成果を蓄積してきました。広東省は中国最大の経済省です。

 

当社が携わる人工知能とロボット工学の分野は好機を迎え、過去2年間で爆発的に成長し、多くの新しい市場をもたらし、新しい産業軌道を引き寄せました。将来的にはスマート端末がますます増え、生産設備と機器産業の発展にもつながります。2024年には、広州市増城にある当社の研究所が事業を全国、そして世界に展開できるようになることを願っています。