情報通信業
基盤モデルのファインチューン ― インストラクションデータ適用
企業・組織独自LLMの構築に向け、著作権侵害リスクのない安全なインストラクションデータの作成・適用によるファインチューニングで専用モデル化・強化を行いました。軽量LLMでの実証ではベースモデル比+12%の精度向上し、競争力のある独自モデル化を実現しました。

企業・組織独自LLMの構築に向け、著作権侵害リスクのない安全なインストラクションデータの作成・適用によるファインチューニングで専用モデル化・強化を行いました。軽量LLMでの実証ではベースモデル比+12%の精度向上し、競争力のある独自モデル化を実現しました。
「安全なデータ×学習で独自モデルを開発し、性能を向上させ、より特化型にしたい」という課題に対し、インストラクションチューニングで企業・組織独自LLMのデータ基盤を熟成させる支援を行いました。
課題
- 安全なデータ×学習で独自モデルを開発したい(性能を向上させ、より特化型にしたい)
- 学習データの著作権リスクへの対応(著作権侵害リスクのない安全なデータが必要)
- 個社の用途・業界性への適合(汎用データでは個社モデルの特化に繋がりにくい)
インストラクションデータとは
インストラクションデータとは、入力(質問)に対する出力(回答)を指示する学習データのことです(1k〜1,000kセッション規模)。
LLMは一般に、Transformer等の学習前アーキテクチャに対し、Webクロール・Wikipedia等の大規模言語データ(10B〜2,000Bパラメータ規模、1,000B〜10,000Bトークン規模のテキスト)による事前学習を行ったうえで、インストラクションデータやRLHF(人間のフィードバックによる強化学習)によるファインチューニングを経て作られます。このファインチューニング工程で用いるインストラクションデータの質と量が、ベースモデルを個社の用途に合わせて専用化・強化できるかを左右します。
実証:軽量LLMでの精度向上
軽量LLMに1,000以上のインストラクションデータを適用した実証では、ベースモデルのモデル強度1,004に対しチューニング後モデルは1,152となり、+12%の精度向上を確認しました。国内外の主要モデル(クローズドソース・オープンモデル)と並べたベンチマーク上での比較により、インストラクションデータによる精度向上効果を定量的に検証しています。
インストラクションデータの類型
- 抽象タスク系:抽象質問に対して、回答作法や回答粒度を学ばせる
- 具体タスク系:具体質問に対して、回答工程や方法を学ばせる
- リスクタスク系:リスク懸念の質問に対し、回答の織り混ぜ・配慮を学ばせる
ご提供内容
- モデル規模に応じてインストラクションデータを用意、制作可能
- 著作権侵害リスクのない安全なデータを提供しベースモデルに適用
- 導入する個社モデルの用途・業界性に応じてデータの中身を調整
- インストラクションデータにより専用モデル化・強化。構築ノウハウ&データを転用可能
優位性・提供価値
独自LLMを開発した経験(事前学習/ファインチューニング)と、対話データを元に精査を繰り返したノウハウ、安全なインストラクションデータ作成技術を保有。日本語に限らず各国データの用意が可能です。各企業に合ったデータ適用により、LLM導入の効率化とLLMの成熟化を実現します。
成果
- モデル規模に応じたインストラクションデータを用意・制作(安全なデータをベースモデルに適用)
- 個社モデルの用途・業界性に応じてデータの中身を調整(専用モデル化・強化を実現)
- 軽量LLMでの実証でベースモデル比+12%の精度向上(1,000以上のインストラクションデータを適用)
- LLM導入の効率化とLLMの成熟化(構築ノウハウ&データは転用可能)
Region
APAC 日本