問い合わせに答えるAIが返品条件を間違えたため、手順を追加する。すると今度は、別の問い合わせへの回答が崩れてしまう。SkillOptの業務への応用を考えるとき、こうした場面が一つの例になります。失敗から手順の修正案を作り、ほかの問題でも役立つかを確かめてから採用する仕組みです。問い合わせ対応で効果が実証されたという意味ではありません。

仕事をするAIと、手順書を直すAIを分けます

SkillOptの技術レポートのv2によると、実際に仕事をするAIモデルの重みは固定します。重みとは、学習によって調整されるモデル内部の数値です。SkillOptが編集するのは、一つのスキル文書です。AIが仕事を進めるために読む手順書に相当すると考えると、役割をつかみやすくなります。

仕事を試す:課題に取り組み結果を残す。失敗を読み解く:どこで迷ったかを確かめる。手順を改善する:次の仕事で使う知識にする。手順を変えた後も、別の課題で確かめる

改善の入力になるのは、AIが仕事を実行した結果です。それを別の最適化モデル、つまり文書の改善案を考えるAIが読み、スキル文書への追加・削除・置換を提案します。人が失敗を振り返って手順書を直す流れに似ていますが、実際の仕組みでは、AIが編集案を作り、検証用データで採否を決めます。

編集案は、別に残しておいた検証用データで評価し、点数が厳密に改善した場合だけ採用します。同点では採用しません。さらに、変更量を制限し、却下した編集も記録します。修正案を思いつくことと、それを次の仕事に使うことの間に、確認の工程を置いています。

出力として配備するのは、改訂したスキル文書です。公式実装では、実行、振り返り、集約、選択、更新、評価の流れを用意しています。配備する成果物はbest_skill.mdというファイルで、通常300〜2,000トークンと説明されています。トークンはAIが文章を処理するときの単位で、日本語の文字数とはそのまま一致しません。

モデル内部の数値を再学習で変える方法に対し、SkillOptは外から与える文書を編集します。業務に当てはめれば、失敗を次の手順に反映し、その手順を検証してから使う工程を作れる可能性があります。

配備後の呼び出しは増やさず、改善の計算は別に行います

レポートによると、配備後には、この最適化のためのモデル呼び出しを追加しません。改善案を考えるAIを、毎回の業務処理に加える設計ではないということです。

ただし、改善に使う計算まで不要になるわけではありません。実行結果を集め、編集案を作り、検証する段階には計算資源が必要です。導入費用を考える際は、日々の業務を動かす計算と、手順書を改善するための計算を分けて見積もる必要があります。

公式実装では、2026年7月2日のv0.2.0に、夜間に過去の実行を再検証するSkillOpt-Sleepを追加したと説明しています。過去の実行を振り返る機能ですが、夜間に処理すること自体から、計算費用の削減や業務成績の向上を判断することはできません。