Skip to content

情報通信業

基盤モデルのファインチューン ― インストラクションデータ適用

基盤モデルのファインチューン ― インストラクションデータ適用
精度向上
+12%(ベースモデル比)
インストラクションデータアセット
1,000以上

企業・組織独自LLMの構築に向け、著作権侵害リスクのない安全なインストラクションデータの作成・適用によるファインチューニングで専用モデル化・強化を行いました。軽量LLMでの実証ではベースモデル比+12%の精度向上し、競争力のある独自モデル化を実現しました。

「安全なデータ×学習で独自モデルを開発し、性能を向上させ、より特化型にしたい」という課題に対し、インストラクションチューニングで企業・組織独自LLMのデータ基盤を熟成させる支援を行いました。

課題

  • 安全なデータ×学習で独自モデルを開発したい(性能を向上させ、より特化型にしたい)
  • 学習データの著作権リスクへの対応(著作権侵害リスクのない安全なデータが必要)
  • 個社の用途・業界性への適合(汎用データでは個社モデルの特化に繋がりにくい)

インストラクションデータとは

インストラクションデータとは、入力(質問)に対する出力(回答)を指示する学習データのことです(1k〜1,000kセッション規模)。

LLMは一般に、Transformer等の学習前アーキテクチャに対し、Webクロール・Wikipedia等の大規模言語データ(10B〜2,000Bパラメータ規模、1,000B〜10,000Bトークン規模のテキスト)による事前学習を行ったうえで、インストラクションデータやRLHF(人間のフィードバックによる強化学習)によるファインチューニングを経て作られます。このファインチューニング工程で用いるインストラクションデータの質と量が、ベースモデルを個社の用途に合わせて専用化・強化できるかを左右します。

実証:軽量LLMでの精度向上

軽量LLMに1,000以上のインストラクションデータを適用した実証では、ベースモデルのモデル強度1,004に対しチューニング後モデルは1,152となり、+12%の精度向上を確認しました。国内外の主要モデル(クローズドソース・オープンモデル)と並べたベンチマーク上での比較により、インストラクションデータによる精度向上効果を定量的に検証しています。

インストラクションデータの類型

  • 抽象タスク系:抽象質問に対して、回答作法や回答粒度を学ばせる
  • 具体タスク系:具体質問に対して、回答工程や方法を学ばせる
  • リスクタスク系:リスク懸念の質問に対し、回答の織り混ぜ・配慮を学ばせる

ご提供内容

  • モデル規模に応じてインストラクションデータを用意、制作可能
  • 著作権侵害リスクのない安全なデータを提供しベースモデルに適用
  • 導入する個社モデルの用途・業界性に応じてデータの中身を調整
  • インストラクションデータにより専用モデル化・強化。構築ノウハウ&データを転用可能

優位性・提供価値

独自LLMを開発した経験(事前学習/ファインチューニング)と、対話データを元に精査を繰り返したノウハウ、安全なインストラクションデータ作成技術を保有。日本語に限らず各国データの用意が可能です。各企業に合ったデータ適用により、LLM導入の効率化とLLMの成熟化を実現します。

成果

  • モデル規模に応じたインストラクションデータを用意・制作(安全なデータをベースモデルに適用)
  • 個社モデルの用途・業界性に応じてデータの中身を調整(専用モデル化・強化を実現)
  • 軽量LLMでの実証でベースモデル比+12%の精度向上(1,000以上のインストラクションデータを適用)
  • LLM導入の効率化とLLMの成熟化(構築ノウハウ&データは転用可能)

Region

APAC 日本

Related solutions

事業創造のエキスパートと話す

事業成長のスピード・経営者不足・グローバル展開・技術内製化不足を即座に解決し、事業を伸ばします

お問い合わせ