要点(30秒で): 同じモデルでも、周りの”取り回し”を変えるだけでSWE-benchが22点動く——2026年に定着したこの発見を、9つの職種テンプレと1本のスクリプトに落とし込んだのがOSS「agentsmith」。まずは自分のCLAUDE.mdが「設定の失敗」で事故っていないか、そこから疑ってみるといい。

AIエージェントを本気で使い始めた人ほど、ある壁にぶつかる。デモは動く、けれど毎回同じところで転ぶ、検証を飛ばす、記憶が続かない。モデルを新しくしても、その”クセ”はなぜか消えない。

そこに刺さる小さなリポジトリが静かに伸びている。PromptPartner の「agentsmith」だ。うたい文句は、Claude でも Codex でも Gemini でも動く、モデル非依存の”操作ハーネス”。派手な機能ではなく、エージェントの土台そのものを組み替えにいく。

背景・文脈:2026年は「ハーネスの年」だった

まず前提を共有したい。2026年、AI開発の関心は静かに、しかし決定的にずれた。主役は賢いモデルから、その周りを固める仕組み——ハーネスへ移ったのだ。

数字が容赦ない。ある検証では、モデルを差し替えてもSWE-benchのスコアは1点しか動かないのに、ハーネス(実行ループ、ツール、権限、記憶の設計)を差し替えると22点動いた。LangChain に至っては、モデルを一切変えずハーネスだけ作り直して52.8%から66.5%へと13.7点跳ね、Terminal Bench 2.0の順位を30位から5位へ引き上げている。

「エージェント=モデル+ハーネス」。そしてハーネスのほうが結果を左右する。この一年で、それは業界の共通言語になった。agentsmith の README がずばり言い切るのが象徴的だ——モデルは成果の約1割、ハーネスが残りの9割だ、と。

【比較】入れ替える対象を「モデル」から「ハーネス」へ変えるとSWE-benchは1点→22点動く
【比較】入れ替える対象を「モデル」から「ハーネス」へ変えるとSWE-benchは1点→22点動く

仕組み・特徴:薄い核に、9つの職種を差し込む

では agentsmith は具体的に何をするのか。答えは拍子抜けするほど地味で、そこが良い。要は、エージェントに読ませる設定ファイル(CLAUDE.md / AGENTS.md / GEMINI.md)を、賢く”組み立てる”だけだ。

構造は二層に分かれている。ひとつは、どんな仕事にも共通する薄い核。アイデンティティ、動作モデル、原則ベースのルール、そして興味深いのが「STOPテーブル」と呼ばれる仕掛けで、エージェントが「まあ大丈夫だろう」と自分に言い訳して手を抜く瞬間を先回りで潰す、いわば自己正当化ブレーカーだ。

もう一層が、差し替え可能な9つの職種プロファイルである。software-dev、devops、marketing、documentation、data、research、design、admin、そして autonomous-loops。それぞれが「何をもって完了とするか」「どの検証ゲートを通すか」「どこで失敗しがちか」を職種ごとに定義する。

セットアップは setup.sh 一本。プロジェクトの種類を自動検出させる方式、対話ウィザード、フラグ直打ちの3通りがあり、何度流しても壊れない冪等設計で、既存ファイルはバックアップしてから自分の管理ブロックだけ書き換える。ライセンスはMIT、中身はほぼShellとPowerShellのプレーンなMarkdownで、外部依存を持たない。ここに”モデル非依存”が効いてくる。

【仕組み】agentsmithの二層構造——全職種共通の「薄い核」に、9職種から1つを差し込みsetup.shが設定ファイルを組み立てる
【仕組み】agentsmithの二層構造——全職種共通の「薄い核」に、9職種から1つを差し込みsetup.shが設定ファイルを組み立てる

なぜ今この設計なのか:設定ファイルの標準化と地続き

agentsmith が Claude・Codex・Gemini を横断できるのは偶然ではない。背後で、設定ファイルそのものが標準化へ動いている。

OpenAI が2025年8月に公開した AGENTS.md は、その後 Linux Foundation 傘下のAgentic AI Foundationへ移管され、2026年5月時点で170超の組織が参加、6万以上のリポジトリが採用するデファクトになった。Claude Code も AGENTS.md を読むようになり、CLAUDE.md は”より濃い”Claude専用レイヤーという位置づけに整理されつつある。

効果も測られている。138リポジトリを対象にした2026年の研究では、開発者が書いた AGENTS.md がタスク成功率を約4%上げ、エージェントが生むバグを35〜55%減らした。つまり、良い設定ファイルは”気休め”ではなく、計測できる品質改善なのだ。この「動かす層」を誰が整えるのかという問いは、オープンAIは追いついた、でも「動かす層」を誰も守っていないで見たMozillaの警鐘と、まっすぐ地続きだ。

agentsmith は、その「動かす層」を個人開発者の手元でも組めるように、テンプレ化して配っている、と読むとしっくりくる。

【時系列】設定ファイルの標準化——AGENTS.mdが公開から1年でデファクトへ、良い設定はバグを35〜55%減らす
【時系列】設定ファイルの標準化——AGENTS.mdが公開から1年でデファクトへ、良い設定はバグを35〜55%減らす

使いどころ・始め方

刺さるのは、単発のデモではなく”回し続ける”人だ。作者のLukasHertig自身、データ処理・マーケ・ソフト開発を半年間エージェントに回し、5回作り直した末にこの形へたどり着いたと書いている。実戦から絞り出された設定集、という手触りがある。

始め方は素直だ。リポジトリを持ってきて ./setup.sh を叩き、職種プロファイルと安全モードを選ぶ。あとは生成された CLAUDE.md を眺め、自分のプロジェクトに合わない箇所を削るところから始めればいい。verify.sh や handoff.sh といった検証・引き継ぎスクリプト、テンプレート群も同梱されている。

ひとつ現実的な注意を。設定ファイルは”重ければ良い”ものではない。エージェントは読む前から大量のトークンを消費するし、肥大したルールは逆にノイズになる。実際、Claude Codeは”読む前に”33kトークンで見たように、土台の”重さ”はそのままコストと反応の鈍さに跳ね返る。agentsmith が「薄い核」をわざわざ標榜しているのは、この落とし穴を分かっているからだろう。

日本・個人開発の視点

日本の個人開発者にとって、これは”輸入して終わり”の道具ではない。むしろ発想の型として効く。

日本語で仕事をさせるなら、成功条件も失敗パターンも、業界慣習も、英語圏の profile とは違う。agentsmith の価値は完成品というより、「核+職種プロファイル」という分け方そのものにある。自分の現場向けに profile を一枚書き足す——たとえば「日本語ドキュメント作成」「受託開発の納品ゲート」——そういう改造前提の骨格として眺めると、ぐっと使い出が増す。MITライセンスなので、そこは遠慮がいらない。

要点まとめ

  • 2026年の合言葉は「エージェント=モデル+ハーネス」。モデル差し替えは1点、ハーネス差し替えは22点動くという計測が潮目を変えた。
  • agentsmith は、その思想を「薄い核+9つの職種プロファイル」に落とし込み、1本のスクリプトで CLAUDE.md を組み立てるOSS。MITライセンス、モデル非依存。
  • 背後には AGENTS.md の標準化(6万リポジトリ超)があり、良い設定ファイルはバグを35〜55%減らすという研究も出ている。
  • 注意点は”重さ”。設定は盛るほど良いのではなく、土台の肥大はコストと鈍さに直結する。
  • 日本の現場では、完成品より「核+職種で分ける発想」と、自作profileの土台として活きる。

🐦‍⬛ 編集部の視点

正直に言う。この手の「ルール集リポジトリ」は雨後の筍で、ひとつひとつを追う価値はそう高くない。それでも agentsmith を取り上げたのは、単体の出来より、これが指し示す方向のほうが重要だからだ。

私たちはついモデルの新旧で一喜一憂する。GPTが、Claudeが、と。でも本当に成果を分けているのは、その周りの”取り回し”——検証を必ず通すか、記憶を継ぐか、暴走に線を引くか。地味で、面倒で、誰も自慢できない部分だ。22点対1点という数字は、そのことを冷たく突きつけてくる。

だから問いはシンプルだ。あなたのエージェントが今日ミスをしたとき、モデルを疑うか、それとも自分の設定ファイルを疑うか。agentsmith の「ほとんどの失敗は設定の失敗だ」という一文は、耳が痛いほど正しい。次に事故ったら、まず自分のCLAUDE.mdを開いてみてほしい。

出典・リンク

コメントを残す

Trending

World AI Newsをもっと見る

今すぐ購読し、続きを読んで、すべてのアーカイブにアクセスしましょう。

続きを読む