萩原正人 - ステート・オブ・AI ガイド (Page 3)

新たなタイプの自然言語処理！言語モデルを賢く使うテクニック10選

GPT-3 などの大規模・汎用言語モデルの出現によって、自然言語処理においてタスクを解くやり方にも変化が生じています。タスクやドメインごとにモデル・手法を工夫するかわりに、プロンプトとしてどのように指示を与えるか、言語モデルとどのようにやりとりするか、という点に焦点が移っています。本記事では、言語モデルを使って、数値計算・論理推論などの複雑な問題を、より精度高く解かせるための手法に関する研究およびトレンドを、ごく最近発表された論文も含め１０個ほど紹介します。

Free Post

機械学習

陰の立役者 VQ-VAE が強力に！新・量子化モデル SQ-VAE を完全解説

画像や音声などの連続値データを、離散的な潜在変数の系列で表現する VQ-VAE。トランスフォーマーと並んで、近年の AI 分野において最も重要な技術の一つであると言っても過言ではありませんが、訓練が難しく、うまく使うために様々なテクニックが必要でした。最近、Sony から、「確率的な量子化処理」を取り入れた SQ-VAE が発表されました。訓練のためのテクニックが必要なく、コードブック使用率を高め、より質の高い生成ができるなど、今後のインパクトが期待できます。本記事では、この SQ-VAE を、VAE や VQ-VAE の基礎までさかのぼって解説します。

Free Post

音声認識

「最強の系列モデル」S4 で生成も！音声表現・音声生成の最新研究

長距離ベンチマークで従来手法を圧倒的性能で破って話題となった系列モデル S4 の出現から半年ほどですが、その音声生成への応用モデルなど、後続研究や解説記事などのフォローアップが出現し始めています。本記事では、最近発表された音声表現・音声生成の最新論文を厳選して解説します。

Free Post

自然言語処理

機械学習におけるベンチマーク完全ガイド　利用・構築・問題点まとめ

機械学習モデルの性能を測定・比較するための標準化されたタスク・データセットである「ベンチマーク」、機械学習分野で広く普及しており、モデルの開発を後押ししています。本記事では、コンピューター・ビジョン、自然言語処理、音声処理などにおけるベンチマークを最新のものも含めて紹介した後、これらベンチマークの利用・構築に関する示唆に富んだ論文を数本紹介し、「機械学習ベンチマークの利用・構築・問題点」を詳しくまとめました。

Free Post

機械学習

単純かつ効果的！訓練順序を工夫する「カリキュラム学習」とNLP応用

人間が学習するように、難易度に応じてデータを提示する順序を工夫する「カリキュラム学習」、シンプルかつ効果的な方法として研究が進んでいます。本記事では、カリキュラム学習の基礎をおさらいした後、自然言語処理における代表的な応用例 (機械翻訳、音声翻訳、自然言語理解、チャットボット) を幅広く紹介・解説します。

Free Post

自然言語処理

自然言語処理トップ会議 ACL 2022 から厳選！要チェック論文まとめ

先週 (5月22日〜27日)、自然言語処理のトップ会議である ACL 2022 がオンラインおよび対面のハイブリッド形式で開催されました。本記事では、ACL 2022 の論文の中から、現時点での引用数や、幅広い研究や開発に役立つかどうかなど、私の主観なども混ぜながら、要チェック論文を選んで解説しました。

DeepMind の「万能モデル」 Gato と Flamingo の技術を解説

Free Post

機械学習

DeepMind の「万能モデル」 Gato と Flamingo の技術を解説

先週、DeepMind から、単一のモデル・パラメータで、Atari のゲームを制御したり、画像のキャプションを生成したり、テキストで対話をしたり、現実のロボットアームを用いてブロックを積み上げたりできる最新の「超マルチモーダル・マルチタスクモデル Gato」が発表され、ネット上で「汎用人工知能に近づいたか」と話題になりました。また同時に、「GPT-3 の視覚×言語版」とも言える Flamingo も発表され、話題となりました。実際、Gato と Flamingo のどこが凄く、どこに課題があるのでしょうか。論文から技術詳細を解説し、考察してみたいと思います。

深層学習トップ会議 ICLR 2022 のベストペーパー・重要論文まとめ【CV編】

Free Post

コンピュータービジョン

深層学習トップ会議 ICLR 2022 のベストペーパー・重要論文まとめ【CV編】

先月末に、「深層学習のトップ会議」とも言える ICLR 2022 がオンライン上で開催されました。本記事では、この ICLR 2022 から、特に CNN や分類・生成タスクに関するベストペーパー・要チェック論文を厳選して解説します。特に 1) 理論的な裏付けがしっかりしており、2) 実タスクでの性能が良く、かつ、3) 実装が比較的容易、というものを厳選しました。どの論文も興味深く実用性もあり、今後の深層学習に強いインパクトを与えると予測されます。

深層学習トップ会議 ICLR 2022 の要注目論文まとめ【NLP/ML一般編】

Free Post

機械学習

深層学習トップ会議 ICLR 2022 の要注目論文まとめ【NLP/ML一般編】

先月末、「深層学習のトップ会議」とも言える ICLR 2022 がオンライン上で開催されました。本ブログでは、全 1,095 本の採択論文の中から要チェック論文を厳選し、２週間に分けて紹介します。今週は自然言語処理 (NLP) と機械学習全般に関する論文です。いずれの論文も、新しい概念を提案する挑戦的なものや、実務に使える実用的なものを中心に厳選しました。

Free Post

機械学習

表形式データに深層学習は「使える」のか本当に強いモデルはこれだ

実務において幅広く使われている「表形式データ」では、GBDT など決定木アンサンブルに基づく手法が伝統的に非常に強いことが知られています。一方、他ドメインで目覚ましい性能を上げている深層学習ベースのモデルも数多く提案されています。最近になって、表形式データに対する深層学習手法をサーベイ・比較した論文が立て続けに発表されました。現時点で表形式データに一番強いモデルは何なのでしょうか。本記事では、これらのサーベイ・比較論文を紹介しながら、この答えを探ってみます。

ついに出た！Googleによる最強・最大の言語モデル PaLM を解説【論文速報】

Free Post

自然言語処理

ついに出た！Googleによる最強・最大の言語モデル PaLM を解説【論文速報】

Google から、超大規模言語モデル PaLM (「パーム」、Pathways Language Model) が発表されました。パラメータ数 540B (5400億) の本モデル、現段階で「最強・最大の言語モデル」と言っても過言ではなく、言語理解、コーディングタスク、多言語タスクなど、様々な分野で最高性能 (SOTA) を軒並み達成しています。本論文、付録 (appendix) を除いた論文の本体だけで 62 ページもある大作なので読むのも大変なのですが、本記事では、その中でも重要な要点をかいつまんで紹介します。

OpenAI の超高品質テキスト→画像生成モデル DALL·E 2 の技術詳細を解説

Free Post

コンピュータービジョン

OpenAI の超高品質テキスト→画像生成モデル DALL·E 2 の技術詳細を解説

先週、テキストから画像を高い品質で生成できるモデル「DALL·E 2」が OpenAI が発表されました。初代「DALL·E」から一年あまりで、さらにテキストに忠実でリアルな画像生成を実現し、ネットを賑わせました。本記事では、「DALL·E 2」の技術詳細に注目し、論文を理解するための基礎となる技術を順に追って解説しました。

Free Post

機械学習

「とりあえずReLU」で本当に大丈夫？深層学習の活性化関数はこう選べ

ニューラルネットワークによって強力な非線形の予測性能を実現するのに必要不可欠な「活性化関数」。tanh や ReLU をはじめ、実に様々なものがこれまで提案されていますが、モデルやタスクに応じてどのように選んだら良いでしょうか。本記事では、最近発表されたサーベイ論文を中心に、「活性化関数をどのように選んだら良いか」をまとめました。

Free Post

機械学習

【じっくり1本】教師なし対照学習が作り出す表現は地球儀を一様に覆う

近年、利用の広がっている強力な学習手法である対照学習。その性能の秘訣を「アラインメント」と「一様性」の観点から解き明かした本論文、じっくり一本解説しました。論文の可視化の文書化の技術は一見の価値ありです。