新しいAIモデルは本当に「良くなった」のか。日本語の業務文12件で新旧4モデルを伏せて読み比べた結果と、約1,700円でできる確かめ方
「新しいモデルが出たので、社内のAIもそちらに切り替えたい」
「切り替えたあとで、日本語の報告書やメールの出来が落ちないか心配だ」
生成AIのモデルは、数か月ごとに新しい世代へ入れ替わります。提供元は「より賢くなった」と紹介しますが、それが日本語の業務文でも本当に良くなっているのかは、使う側が確かめるしかありません。
前回の記事「裏側のAI処理の費用が約1/23に」では、画面の裏側で動く小さな処理を担うモデルを比べました。今回はその続編として、利用者がふだん依頼する文章作成や相談を担うモデルの「世代交代」を取り上げます。
マーキュリーのグループで開発する業務支援システムでは、2026年10月4日に、ふだんの依頼に使う2つのモデルを、Claude Sonnet 5からClaude Sonnet 5.5へ、GPT-6 SolからGPT-6.1 Solへ入れ替えました。その翌日、新旧4モデルに同じ12件の業務依頼を答えさせ、どちらのモデルの答えかを伏せて読み比べました。
結論からお伝えすると、以下の3点です。
- OpenAIのGPT-6.1 Solは、前の世代(GPT-6 Sol)よりはっきり良くなっていました。 採点役2つの判定がそろった12組のうち、11組で新しい版が選ばれました。
- AnthropicのClaude Sonnet 5.5は、前の世代(Claude Sonnet 5)とほぼ同等でした。 悪くなった証拠は見つかりませんでした。
- 測るのにかかった費用は約1,700円、AIによる採点が出そろうまで1時間足らずでした。 人の目で確かめたのは5組だけです。
本記事では、検証の設計と結果、途中でつまずいたこと、そして自社でモデルの乗り換えを確かめる進め方を解説します。
※本検証は、マーキュリーのグループである信濃ロボティクスイノベーションズ合同会社が開発する業務支援システム「secondbrain.work」の検証環境にて、2026年10月5日に実施した実測データに基づいています。
1. なぜ「新しい=良い」を確かめる必要があるのか
モデルの世代交代は、数か月ごとに起きる
前回は軽量モデルの提供終了への対応でしたが、今回は同じ会社の同じ価格帯に新しい世代が出たという、より日常的な場面です。secondbrain.workはAnthropic・OpenAI・Googleなど複数の会社のAIを使い分ける仕組みなので、「どの世代を既定にするか」という判断は年に何度も訪れます。
提供元の性能指標は、日本語の業務文の出来を表さない
新しいモデルの発表には、英語の試験問題やプログラミング課題での点数が添えられています。しかし、自治体へ出す報告書や取引先へのメール、口コミへのお詫びといった日本語の業務文が良くなったかどうかは、その点数からは分かりません。今回入れ替えた2つのモデルは前の世代と同じ料金ですが、私たちは「新しい=良い」と決めつけず、自分たちの業務に近い依頼で確かめることにしました。
2. 評価の設計:何を、どう比べたのか
比較した4モデル
| モデル名 | 提供元 | 本検証における位置付け | 公称単価(100万トークンあたり・入力/出力) |
|---|---|---|---|
| Claude Sonnet 5.5 | Anthropic | 新しい既定(2026年10月4日から) | $2.00/$10.00 |
| Claude Sonnet 5 | Anthropic | 前の既定(比較基準) | $2.00/$10.00 |
| GPT-6.1 Sol | OpenAI | 新しい既定(2026年10月4日から) | $2.00/$10.00 |
| GPT-6 Sol | OpenAI | 前の既定(比較基準) | $2.00/$10.00 |
※単価は2026年10月時点のAPI登録価格です。各社の改定により変動する場合があります。
12件の業務依頼
用意したのは、公共施設やキャンプ場の運営を想定した、業務でよくある12件の依頼です。
| 種類 | 依頼の内容 |
|---|---|
| 提案の骨子 | 予約と決済のデジタル化を3段階で提案する骨子 |
| 3案の比較 | 予約受付をWeb中心へ切り替えるか、3案を4つの観点で比べる |
| 原因の分析 | 利用者満足度が下がった原因の仮説と、問われそうな論点の整理 |
| 公用文への書き直し | 話し言葉の報告を、自治体へ提出する報告書の文体に直す |
| 交渉のメール | 単価の引き上げを相談してきた外部ライターへの返信 |
| 判断基準の設計 | 職員が減る中で、10の業務を「やめる・簡素化する・残す」に振り分ける |
| 手順の設計 | 雨の日の受付業務のチェックリスト |
| 議事録の抽出 | 議事録から決定事項・担当・期限を表にし、未決事項を分ける |
| 敬語の手直し | 取引先へのメールをビジネス敬語に直し、理由を添える |
| 要約 | 制度変更の告知を役員向けに3行で要約し、自社への影響を2点挙げる |
| 苦情への返信 | 星1つの口コミへ、公式アカウントとして200字程度で返信 |
| 数値のまとめ | 月別の利用者数から前年同月比を計算し、特徴を3点にまとめる |
これを新旧4モデルに2回ずつ答えさせ、96の答えを集めました。新旧の答えを対にした比べる組は48組です。
採点の3つの工夫
AIの答えをAIに採点させるとき、やり方を誤ると結論が歪みます。
1つ目は、別の会社のAIに採点させることです。 Anthropicの新旧の答えはOpenAIのGPT-6 AstraとGoogleのGemini 3.1 Proが、OpenAIの新旧の答えはAnthropicのClaude Opus 5.5とGoogleのGemini 3.1 Proが採点します。自社のモデルをひいきする可能性を避けるためです。
2つ目は、どちらの答えかを伏せたうえで、表示の順を入れ替えて2回聞くことです。 AIの採点役は、答えを見せる順番に左右されることがあります。実際、順を入れ替えると判定が逆になった回数は、Anthropicの組で48回中14回、OpenAIの組で48回中6回ありました。2回とも同じ側を選んだときだけを、その採点役の判定として数えました。
3つ目は、2つの採点役の判定がそろった組だけを結論に使うことです。 片方だけが選んだ組は「意見が割れた」として、勝ち負けに数えていません。
採点の観点は「正確さ」「依頼への的確さ」「日本語の自然さ」「そのまま業務で使えるか」の4つで、各5点満点です。採点役には「長い方・見出しが多い方を良いとしない」「差が小さければ引き分けでよい」と指示しました。最後に、私たちの代表も、どちらの答えかを伏せたまま5組を読み比べました。
公平性を担保するための条件
- 4モデルとも、利用者が画面から送るのと同じ経路で、同じ依頼文を送信
- 会社ごとの決まりや手引きをAIに覚えさせる仕組みも、利用者と同じ状態のまま(この点が後述のつまずきにつながります)
- 全問の末尾に「追加の情報の取得や確認は不要です」と添え、確認を挟まずに最後まで答えさせた
- 答えは1問ごとに新しい会話で取得
3. 結果1:GPT-6.1 Solは前の世代よりはっきり良い
勝ち負けの集計
| 比べた組(各24組) | 新しい版が勝ち | 前の版が勝ち | 意見が割れた |
|---|---|---|---|
| GPT-6.1 Sol 対 GPT-6 Sol | 11 | 1 | 12 |
| Claude Sonnet 5.5 対 Claude Sonnet 5 | 5 | 2 | 17 |
(出典:信濃ロボティクスイノベーションズ合同会社 検証データ、2026年10月)
※2つの採点役の判定がそろった組だけを勝ち負けに数えています。引き分けはありませんでした。
GPT-6.1 Solは、判定がそろった12組のうち11組で新しい版が選ばれました。採点役のClaude Opus 5.5とGemini 3.1 Proは、それぞれ単独で見ても新しい版に傾いています。
短い文書の依頼で、差がはっきり出た
とくにはっきりしていたのは、敬語の手直し・要約・苦情への返信・数値のまとめといった短い文書の依頼で、8組すべてで新しい版が選ばれたことです。
たとえば口コミへの返信では、「200字程度」という指定に近い長さで書いていました。数値のまとめでは、前年同月比の計算に加えて「8月の減少が合計を押し下げた」という読み取りまで添えていました。
4つの観点の平均点を見ると、差が出たのは「そのまま業務で使えるか」で、新しい版が5点満点で4.54、前の版が4.07でした。一方、提案の骨子や3案の比較といった長い文書の依頼では、意見が割れた組が多く、差は小さいと見ています。
4. 結果2:Claude Sonnet 5.5はほぼ同等、悪くなった証拠はない
意見が割れた組が多かった
Claude Sonnet 5.5は、24組のうち17組で採点役の意見が割れました。判定がそろった7組の内訳は、新しい版が5組、前の版が2組です。「新しい版がはっきり良い」とは言えませんが、「悪くなった」と言える証拠もありませんでした。
日本語のうまさでは、4モデルとも差がつかない
「日本語の自然さ」の点数は、4モデルとも5点満点で4.7から4.8と、ほとんど差がありませんでした。敬語や公用文の言い回しで差がついた組は、ほぼありません。月別の前年同月比の計算も、4モデルとも2回とも全問正しく答えています。
差がついたのは日本語のうまさではなく、依頼どおりの形で、手直しなしに使えるかでした。
答えの長さ・速さ・費用
| モデル | 1回あたりの実費(平均) | 返るまでの時間(中央値) | 字数(中央値) |
|---|---|---|---|
| Claude Sonnet 5.5 | 4.48円 | 15.8秒 | 1,164字 |
| Claude Sonnet 5 | 5.59円 | 20.9秒 | 678字 |
| GPT-6.1 Sol | 8.84円 | 20.3秒 | 795字 |
| GPT-6 Sol | 9.42円 | 11.0秒 | 490字 |
(出典:信濃ロボティクスイノベーションズ合同会社 検証データ、2026年10月。実費は1回の依頼全体にかかった費用)
新しい版はどちらも答えが長くなりました。返るまでの時間は、GPT-6.1 Solが目安で11秒から20秒に延び、Claude Sonnet 5.5は21秒から16秒に縮みました。1回あたりの費用はどちらも少し安くなっており、「長い答え=高い」ではありませんでした。
人の目でも、5組中4組は新しい版
私たちの代表が伏せたまま読み比べた5組では、4組で新しい版を選んでいました。OpenAIの2組は、AIの判定と一致しました。Anthropicの3組はいずれもAIの意見が割れた組で、2組で新しい版を、1組(話し言葉を報告書の文体に直す依頼)で前の版の簡潔さを選びました。
5. つまずいたこと:採点役は「社内の決まり」を知らない
実は、ここまでの数字は1回目の採点のままではありません。1回目の採点では、新しい版の「正確さ」の点が下がっていました。採点の理由を読むと、その多くが「依頼に無い人名を作り出している」「依頼に無い資料のURLを付けている」というものでした。
調べると、どれも作り話ではありませんでした。secondbrain.workには、会社ごとの決まりや手引きを覚えさせることができます。検証に使った組織には「金額の約束を含む文面は、送る前に代表へ確認する」という決まりがあり、新しいモデルはそれに従って注意書きを添えていました。URLも、社内の手引きに載っている、他の自治体の公開資料でした。答えたAIはこうした前提を受け取っていますが、採点役のAIはそれを知らなかったのです。
そこで、社内の決まりに由来する語を含む18組だけ、採点役に前提を伝えて採点し直しました。
| 比べた組 | 前提を伝える前 | 前提を伝えた後 |
|---|---|---|
| GPT-6.1 Sol 対 GPT-6 Sol | 11勝5敗 | 11勝1敗 |
| Claude Sonnet 5.5 対 Claude Sonnet 5 | 4勝5敗 | 5勝2敗 |
前提を伝えないままだと、会社の決まりに忠実なモデルほど低く評価されるところでした。補正の前と後の数字は、どちらも記録に残しています。
6. 中小企業が「モデルの乗り換え」で押さえたい4つの教訓
1. 提供元の数字ではなく、自社の依頼で測る
自社の業務でよくある依頼を10件から20件、実際の文面に近い形で用意して答えさせれば、報告書やメールの出来を自分たちの目で確かめられます。
2. 日本語のうまさでは差がつかない。見るべきは「依頼どおりの形か」
差が出たのは、「200字程度」「3行で」「表にして」といった指定を守り、手直しなしに使えるかどうかでした。評価の観点を「日本語が上手か」ではなく「このまま業務に出せるか」に置くと、違いが見えてきます。
3. 採点役のAIにも、自社の決まりを渡す
答えたAIが受け取っている前提(社内の決まり・手引き・用語)を、採点役にも渡します。渡さないと、決まりに忠実な答えほど「作り話」と誤って減点されます。同じ会社のAIに採点させないこと、表示の順を入れ替えて2回聞くことも欠かせません。
4. 千円台・1時間で測れるなら、乗り換えは「不安」ではなく「確認作業」になる
今回かかった費用は約1,700円(測り方の失敗でやり直した分も含みます)、AIの採点が出そろうまで1時間足らず、人の目で確かめたのは5組だけです。モデルはこれからも入れ替わりますが、そのたびにこの規模で確かめられるなら、「乗り換えて大丈夫か」はふだんの確認作業になります。
7. この評価の前提と範囲
本検証の結果を客観的に解釈いただくため、以下の前提を明記します。
- 1つの組織・12件の依頼・各2回という条件での結果です。Web検索や添付ファイル、長い会話を伴う依頼は含めていません。
- 採点はAIによるものです。順を入れ替えても同じ側を選んだ判定だけを数え、2つの採点役がそろった組だけを結論に使いましたが、意見が割れた組が多いAnthropicの組については「差が小さい」としか言えません。
- 前提を伝えて採点し直したのは18組だけで、残りの30組は1回目のままです。観点ごとの平均点は両方が混ざるため、勝ち負けの数を主に見ています。人の目による確認は5組で、傾向の確認であって統計的な結論ではありません。
- モデルの名前と料金は2026年10月時点の情報です。各社の公開情報をご確認ください。
8. 複数社のAIを安全に乗り換えられる基盤「secondbrain.work」
今回、既定のモデルを新しい世代へ入れ替え、その翌日に新旧の比較まで終えられた背景には、グループ会社で運用している業務支援システム「secondbrain.work」の仕組みがあります。
モデルを入れ替えても、社内の決まりはそのまま引き継がれる
secondbrain.workでは、会社ごとの決まりや手引きをAIモデルとは別に管理しています。そのため既定のモデルを入れ替えても、「金額の約束を含む文面は送る前に確認する」といった決まりは新しいモデルにもそのまま適用されます。今回、新しいモデルが社内の決まりに従った注意書きを添えていたのは、この仕組みによるものです。
secondbrain.workの特徴
secondbrain.workは、信濃ロボティクスイノベーションズ合同会社が開発する、業務特化型のマルチAI基盤です。
- 複数社AIの自動最適ルーティング: OpenAI、Anthropic、Googleをはじめとする主要AIモデルを束ね、タスクの性質に応じて最適なAIへ自動で処理を割り振ります。
- 1社依存のリスクを排除: 特定モデルの廃止や世代交代が発表された際も、業務全体を止めることなく裏側のモデル設定を切り替えられます。切り替えの前後で日本語の品質を確かめる運用も、同じ仕組みの上で行えます。
- 社内コンテキストとのシームレスな統合: Google ドライブ、Gmail、Slack、社内ドキュメントなどの社内情報とセキュアに連携し、自社の業務文脈を踏まえた回答・下書きを生成します。
【近日公開】ウェイティングリストの先行受付を開始いたします
secondbrain.workでは、企業の生成AI活用をより堅牢かつ経済的にアップデートする「マルチAI基盤」の一般提供に向け、近日中に公式ウェイティングリストの募集を開始いたします。募集開始の正式なご案内や、自社の業務に合わせたAI基盤の選定・モデルの乗り換えの検証にご関心をお持ちの企業様は、ぜひ下記フォームよりお気軽にお問い合わせください。
ご興味をお持ち頂けた方は、ぜひ下記のフォームからお問い合わせください!

