なぜ重要?

AIから、きれいに整理された会議メモが返ってきました。ところが、提出前に読み直すと、まだ決まっていない期限が確定事項になっています。元の記録を開き、直し、ほかにも同じ誤りがないか確認する。これは、生成が速いだけでは仕事全体の時短につながらない場面の一例です。

新モデルを選ぶときに見たいのは、正しい成果物ができるまでに、自分がどれだけ手を動かすか。この視点を持つと、性能の進歩を自分の仕事に引き寄せて考えられます。

本記事の出発点は、まさおAIじっくり解説chの、新モデルの登場とハーネスの見直しを扱う動画です。投稿者の使用感を受け、ここでは公式資料と研究をもとに、仕事を任せる仕組みを掘り下げます。元動画

「ハーネス」は、AIが働くための周辺の仕組みを指します。指示、参照資料、使える道具、途中経過の保存、完成後の確認などです。会議メモなら、何を整理するかだけでなく、何を推測してはいけないか、どの記録で確かめるかまで含まれます。

ここで面白いのは、モデルが進歩すると、必要な仕組みも変わることです。Anthropicの長時間開発の実験では、作る役割と評価する役割を分けた一方、モデル変更後には不要になった処理も外しています。特定の実験条件での結果ですが、AIの進歩に合わせて、周辺の仕組みを簡素化できる場合もあることを示しています。Anthropicの実験報告

私たちの仕事でも、以前は必要だった細かな指示や別ツールへの引き継ぎを、今も続けているかもしれません。一つのAIにまとめて任せた方が早い工程もあれば、確認を分けた方がよい工程もあるでしょう。新モデルを試す価値は、仕事のどの部分を任せ直せるかを見つけることにもあります。

ただし、その判断を性能表の点数だけで済ませることはできません。Opus 5.5の公式発表にあるOSWorld 2.0の「81.8%」は、部分達成を示す値です。すべての工程を終えた割合とは異なります。資料を作り、宛先を選ぶところまで進んでも、必要な送付が済んでいなければ、仕事は残ります。評価研究でも、途中の達成と最終的な完了は区別されています。公式の評価表、OSWorld 2.0研究

この区別を自分の作業にも持ち込むと、「すごい回答だった」で終わらず、「どこまで任せられ、どこから人の手が必要だったか」を確かめられます。

実務での使い方

1.頼む前に「何ができたら完成か」を決める

会議メモを例に考えます。次は説明用に作った架空の記録です。

見積案は金曜に出せそうだが、先方の承認が必要。担当は次回決める。納期は未定。

もしAIが「金曜に見積案を提出することが決定」とまとめれば、読みやすくても仕事に使うには修正が必要です。このメモの完成条件には、少なくとも「提案を決定に変えない」「担当者を補わない」「未定の納期を残す」が含まれます。

依頼文は、たとえばこう変えられます。

会議メモを「決定事項・提案・担当者・期限・未決事項」に整理してください。提案や見込みを、決定事項として扱わないでください。記載のない担当者や期限は「不明」としてください。最後に元のメモと照合し、判断に迷った箇所を示してください。

これなら、何を良い成果物とするかが見えます。ノーコードで作るアプリでも同じです。「画面ができた」に加えて、「入力した内容を保存し、開き直しても表示できる」まで決めれば、確認する操作が具体的になります。

完成条件は、失敗したら困る点に絞ります。最初から長いチェックリストを渡す必要はありません。

2.確認に必要な証拠を、AIにも自分にも残す

会議メモなら、要約だけを読み直しても、元の発言と一致しているかはわかりません。元の記録と並べ、決定事項・名前・数字・期限を確かめます。

作成したAIに見直しを頼むことはできます。確認を別の会話やAIに分けるなら、完成品、元の資料、合格条件を渡します。ただし、別のAIも同じ誤った資料を使えば、誤りを見逃す可能性があります。OpenAIの評価ガイドも、AIによる採点には回答の順番や長さによる偏りがあり、人の判断との照合が必要だと説明しています。OpenAIの評価ガイド

画像や動画を使った確認でも、渡した情報の範囲が重要です。Googleの公式資料では、動画の標準的な静的処理は毎秒1フレームを抽出し、速い動きの詳細を失うことがあるとされています。画面に一瞬だけ出るエラーなら、その箇所の画像や操作記録も添えた方が確かめやすいでしょう。Googleの動画理解ガイド

ここから導ける実務上の考え方は、確認したいことに合う証拠を用意することです。文章の正確さには原典、画面の使いやすさには実際の操作、保存の成否には保存後のデータが必要になります。

3.モデルは「正確さ・手直し時間・費用」で選び直す

完成条件と確認方法が決まったら、モデルを変えた効果も比べやすくなります。

OpenAIはGPT-6について、Astraを最高能力の選択肢、Solを難しい仕事の推論、Lunaを効率的な反復処理に位置づけています。こうした用途の説明は候補を絞る材料になりますが、実際の選択は、同じ仕事を任せた結果で判断します。GPT-6公式ガイド

会議メモの例なら、次の三つを記録すれば始められます。

見るもの記録すること判断につながる点
正確さ決定と提案の混同、抜け、勝手な補足必要な品質を満たしたか
手直し時間元の記録の確認から修正完了までの分数自分の作業がどれだけ残ったか
費用比較した作業の追加料金と、利用プランの条件続けて使える負担か

モデルの安さにも、いくつかの意味があります。Opus 5.5の公式発表では、前世代に比べ、通常の入力・出力単価が20%、キャッシュ読み出しが60%低くなっています。キャッシュは、繰り返し使う入力を再利用する仕組みです。同社が示す「典型的な仕事で40%低コスト」は、利用条件と処理量を含む試算です。公式の料金説明

この説明だけで、自分の月額料金や仕事一件の総費用が同じ割合で下がるとは判断できません。外部ソフトからAIを呼び出すAPIの従量料金と、チャットサービスの月額契約も分けて考えます。

たとえば、安いモデルを使っても確認と修正が増えれば、その分だけ人の時間が必要になります。反対に、利用料金が高くても、必要な品質を満たしたまま手直しが減れば、仕事全体では採用する理由が生まれます。個人で仕事を請ける場合にも、納品までに何分かかるかは、受けられる件数や採算に関わります。

今日始めるなら、まず今のモデルで、普段の依頼文と先ほどの依頼文を比べてみてください。モデルと指示を同時に変えなければ、どちらが効いたのかを追いやすくなります。扱ってよいメモを使い、一件でうまくいった後は別の例でも確かめます。

そして、必須条件を満たし、確認が済んだら終える。際限なく修正させると、せっかく減らした手間が別の場所で増えてしまいます。