要点(30秒で):
– Ollamaは、ローカルPC上で大規模言語モデル(LLM)を動かすための無料・オープンソースのツール。Mac/Windows/Linuxに対応し、ollama run一発でモデルが動き出す手軽さが最大の強み。
– 2026年6月時点の最新版はv0.30系。8GB RAMから7B級モデルが動き、16GBあれば13B、24GB以上で30B級まで実用レベル。
– 2026年に最初に試すべきモデルは、軽量ならgpt-oss:20b、バランス重視ならQwen3系、コーディング用途はKimi K2.6、推論ならDeepSeek-R1が定番。
– APIはOpenAI互換。既存のSDK(OpenAI Python/Node)からほぼ書き換えなしで呼べる。クラウド版(Ollama Cloud)は月額$20のProプランあり。


Ollamaとは何か:3行で説明する

Ollamaは、ローカル環境で大規模言語モデル(LLM)を動かすためのランタイムツールです。ChatGPTのようにブラウザ越しではなく、自分のPCのCPUやGPUを使ってAIモデルそのものを実行できます。

「Dockerのように、モデルをpullしてrunするだけ」という設計思想がとにかく分かりやすく、2024年以降のローカルLLMブームを牽引してきた存在です。インストール直後から数行のコマンドだけで、QwenやLlama、Gemma、DeepSeekといった有名なオープンウェイトモデルを試せます。

そして2026年現在、Ollamaは単なる個人用ツールを超え、OpenAI互換のAPIサーバーとしても利用される定番ツールへと成長しました。社内システムやアプリ開発で「外部APIに依存したくない」ケースの第一選択肢になっています。


なぜ今Ollamaを使うのか:3つの理由

LLMの選択肢はクラウドAPIだけで十分、という見方もあります。それでも2026年にローカルでOllamaを動かす意味は、おおきく3つに整理できます。

1つ目はプライバシー。社内文書や顧客データを外部APIに渡さずに処理できる点は、企業利用での最大の動機です。

2つ目はコスト。月数十時間以上LLMを使う開発者にとって、API課金とローカル実行の電気代+ハードコストはどこかで逆転します。とくに長文要約やバッチ処理を回す用途では、ローカル実行のほうが圧倒的に安いケースが多くあります。

3つ目は学習と実験。モデルの挙動を理解したい、プロンプトを試行錯誤したい、温度パラメータやコンテキスト長をいじってみたい──そうした学習用途で、毎回API課金を気にせず触れる環境は貴重です。

クラウドAPIとの違いをより深く知りたい場合は、ChatGPT・Claude・Gemini比較|違いと使い分け2026年版も参考になります。


インストール手順(Mac / Windows / Linux)

公式サイト ollama.com/download から、各OS用のインストーラーを取得できます。手順はシンプルです。

macOSの場合

macOSは14 Sonoma以降が必要です。インストール方法は2通り。

  • 公式DMGをダウンロードしてアプリケーションフォルダに入れる
  • Homebrew派なら brew install ollama

Homebrewのほうがアップデート管理が楽なので、開発者にはBrewでのインストールを推奨します。Apple Siliconでは自動的にMetal経由でGPU加速が効き、特別な設定は不要です。

Ollamaの仕組み:CLI と OpenAI互換API の二刀流(localhost:11434)
Ollamaの仕組み:CLI と OpenAI互換API の二刀流(localhost:11434)

Windowsの場合

公式サイトから.exeインストーラーをダウンロードして実行するだけ。WSLは不要で、ネイティブWindowsアプリとして動きます。NVIDIA GPUがあればCUDAが自動的に使われ、ない場合はCPUモード(やや遅い)で動作します。

PC性能で動かせるモデルサイズ早見表(Q4量子化目安:1B≒約0.6GB)
PC性能で動かせるモデルサイズ早見表(Q4量子化目安:1B≒約0.6GB)

Linuxの場合

ワンライナーで終わります。

curl -fsSL https://ollama.com/install.sh | sh

このスクリプトがsystemdサービスを登録するので、再起動後も自動でバックグラウンド常駐します。GPU利用にはNVIDIAならCUDA、AMDならROCmが別途必要です。

インストール後、ターミナルでollama --versionを叩いて版数が表示されればOKです。


最初に覚える基本コマンド5つ

Ollamaの基本操作は、覚えるべきコマンドが5つしかありません。

# モデルをダウンロードして対話開始
ollama run qwen3

# モデルだけ先にダウンロード
ollama pull llama3.2

# ローカルにあるモデル一覧
ollama list

# 起動中のモデルを確認
ollama ps

# モデルを削除(ディスク節約)
ollama rm モデル名

ollama runを初めて実行するとモデルが自動でダウンロードされ、そのまま対話モードに入ります。終了は/bye。会話の途中でモデルを切り替えたいときは一度/byeしてから別モデルをrunしなおします。

サーバーを明示的に起動したい場合はollama serve。デフォルトで11434番ポートにOpenAI互換のAPIエンドポイントが立ち上がります。


主要モデルの選び方:何を動かせばいいか

ここが本記事で最も検索される部分です。Ollamaの公式ライブラリには4,500本超のモデルがありますが、ほとんどの人にとって覚えるべきは主要な5〜6系列だけで十分です。

2026年・Ollama主要モデル系列の用途別マップ(最初の1つを決める)
2026年・Ollama主要モデル系列の用途別マップ(最初の1つを決める)

系列ごとの特徴を比較

モデル系列 開発元 代表サイズ 強み こんな人に
Llama 3.x / 4 Meta 1B〜405B / 16x17B等 汎用バランス、エコシステム最大 まず標準を知りたい
Qwen 3 / 3.5 / 3.6 Alibaba 0.6B〜235B 多言語・日本語良好、最新性 日本語タスクが中心
Gemma 3 / 4 Google 270M〜31B 軽量・省メモリ 8GB RAMで動かしたい
DeepSeek-R1 / V3 DeepSeek 1.5B〜671B 推論・数学・コード じっくり考えさせたい
gpt-oss OpenAI 20B / 120B 推論強度を調整可、安定 ChatGPT風の挙動が欲しい
Kimi K2.6 Moonshot フロンティアMoE コーディング最強格 開発支援が主用途
Phi系 Microsoft 2.7B〜14B 小サイズで賢い 軽量モバイル想定

「とりあえず一つ」なら、Qwen3の8Bかgpt-oss:20bから入るのが2026年時点で最も無難な選択です。

サイズ(パラメータ数)の見方

モデル名についている7Bや27Bはパラメータ数です。一般則として「大きいほど賢いが、メモリと速度を食う」。

Q4量子化(GGUFのデフォルト)の場合、ざっくり1Bあたり0.6GBのRAM/VRAMが必要と覚えておくと判断が早くなります。


必要スペック:自分のPCで何が動くか

最小要件は8GBのRAM・10GBの空きディスク・AVX2対応の64bit CPU。GPUは必須ではありません。

ただし「動く」と「快適」は別物。実用速度(毎秒15トークン以上)を出すには、ある程度の余裕が要ります。

RAM/VRAMとモデルサイズの目安

環境 動く目安 体感速度 用途
8GB RAM(CPUのみ) 1B〜7B(Q4) 3〜8 tok/s お試し・軽い要約
16GB RAM + 8〜12GB GPU 7B〜14B 30〜60 tok/s 日常使い・コード補助
24GB GPU(RTX 3090/4090等) 〜32B 20〜40 tok/s 本格開発・複数モデル切替
48GB+ GPU / Mac M2 Ultra 64GB+ 〜70B 10〜25 tok/s プロ用途・本番運用
マルチGPU 80GB+ 70B〜120B超 環境依存 研究・推論サービス化

Macユーザーの場合、メモリ統一アーキテクチャの恩恵でユニファイドメモリがそのままVRAMとして使えます。M2/M3/M4の16GBモデルで7〜14Bが、32GBで27B級が、64GB以上なら70B級が現実的に動かせる目安です。

ハードウェア別の細かい推奨構成はローカルLLMおすすめモデルと必要スペック2026年Mac/Windows別で詳しく扱っています。


Modelfileで自分専用モデルを作る

Ollamaの面白さは、Modelfileという設定ファイルで既存モデルをカスタマイズできる点にあります。Dockerfileのような感覚で、システムプロンプトやパラメータを焼き込んだ「派生モデル」を作れます。

主要なディレクティブは7つ:FROM / PARAMETER / TEMPLATE / SYSTEM / ADAPTER / LICENSE / MESSAGE。

最小構成の例:

FROM qwen3:8b
SYSTEM "あなたは日本語で簡潔に答える技術アシスタント。冗長な前置きは禁止。"
PARAMETER temperature 0.3
PARAMETER num_ctx 8192

これをModelfileという名前で保存し、

ollama create my-assistant -f ./Modelfile
ollama run my-assistant

これで自分専用のmy-assistantが完成します。プロジェクトごとにシステムプロンプトを変えた派生モデルを用意しておくと、毎回プロンプトを書き直す手間がなくなります。


OpenAI互換APIとして使う

2026年現在、Ollamaの最大の用途のひとつがOpenAI互換APIサーバーとしての利用です。

ollama serveが立ち上がっていれば、http://localhost:11434/v1にOpenAI SDKのbase_urlを向けるだけで、OpenAIのChat Completions APIと同じ感覚で叩けます。

from openai import OpenAI

client = OpenAI(
 base_url="http://localhost:11434/v1",
 api_key="ollama" # 何でもよい
)

resp = client.chat.completions.create(
 model="qwen3:8b",
 messages=[{"role": "user", "content": "Pythonでフィボナッチ数列"}],
)
print(resp.choices[0].message.content)

ツール呼び出し(Function Calling)やJSONスキーマによる構造化出力にも対応しているため、エージェント開発の検証環境としても使えます。


Ollama Cloud:ローカルが厳しいときの選択肢

「手持ちのPCでは大きいモデルが動かない」「外出先からも使いたい」というニーズには、公式のOllama Cloudが用意されています。

プラン 料金 主な内容
Free $0 お試し用、利用枠あり
Pro $20/月(または$200/年) 個人開発者向け、十分な実用枠
Max $100/月 ヘビーユース・チーム想定

特徴は、トークン課金ではなく月額固定であること。GPU時間ベースで計測され、上限内なら使い放題に近い使い方ができます。クラウドでもAPIは完全にOpenAI互換で、ローカルとクラウドをコード変更なしで切り替えられるのが強みです。


よくある質問(FAQ)

Q1. Ollamaは完全に無料?商用利用は可能?

Ollamaツール自体はMITライセンスの無料OSSで、商用利用も可能です。ただしモデルそれぞれにライセンスがある点に注意。たとえばLlamaは独自のMeta商用ライセンス、Gemmaはオープンウェイトでも独自規約、Qwenはモデルごとに条件が異なります。業務で使う前に必ず各モデルのライセンスを確認してください。

Q2. インターネット接続なしで動く?

ダウンロード後は完全オフラインで動作します。これがOllamaの最大の魅力の一つで、機密データを外部に送りたくない用途や、出張先の不安定回線でも使い続けられる安心感があります。

Q3. 日本語性能は実用レベル?

2026年時点では、Qwen3系、Llama 3.3 / 4系、Gemma 3 / 4あたりは日本語でかなり自然に応答します。コーディング寄りならKimi K2.6やDeepSeek-R1、軽量で日本語を捌くならgpt-oss:20bが定番。専門タスクで物足りなければ、量子化を緩める(Q5/Q6/Q8)か、より大きなパラメータ数のモデルに上げるのが王道です。

Q4. ChatGPTやClaudeと比べてどれくらい賢い?

正直にいえば、フロンティアの商用モデル(GPT-5系・Claude Opus 4.x・Gemini 3.x)には及びません。とくに長文の論理整合性や複雑な指示追従ではまだ差があります。一方、短中長の要約・コード補助・分類・抽出といった定型タスクは、Qwen3 30B級やgpt-oss:120BでクラウドAPIに肉薄するレベルまで来ています。「全用途で置き換える」のではなく「使えるタスクから移していく」のが現実的です。

Q5. アンインストールはどうやる?

Macは/Applications/Ollama.appの削除+~/.ollamaの削除、もしくはbrew uninstall ollama。Windowsはコントロールパネルからアンインストール後に%USERPROFILE%\.ollamaを削除。Linuxは/usr/local/bin/ollama削除とsystemctl disable ollama、加えて~/.ollama削除で完了します。モデルファイルは数GB単位で残っているので、ディスク回収のためにも忘れずに消すのがおすすめです。


まとめ:最初の30分でやることリスト

ここまでの内容を、初日のチェックリストにまとめます。

  1. 公式サイトからOllamaをインストール(Mac/Win/Linux共通10分以内)
  2. ターミナルでollama --versionを確認
  3. まずollama run qwen3:8bまたはollama run gpt-oss:20bを実行
  4. 数問雑談・要約・コード生成を試して速度と日本語の品質を体感
  5. 余裕があればModelfileで自分用のシステムプロンプトを焼き込み
  6. 開発用途ならOpenAI互換API(11434番ポート)に既存コードを向けてみる

Ollamaの本当の強みは、「自分の手元でLLMを所有している感覚」が手に入ることです。クラウドAPIが止まろうが値上げされようが、自分のPCの中に動くモデルがある安心感は、一度味わうと手放しにくくなります。

ハードウェアの制約は確実にあるものの、2026年は8GBクラスのPCでも実用的なモデルが揃った節目の年。まずは一つ動かしてみるところから、ローカルLLMの世界を始めてみてください。


🐦‍⬛ 編集部の視点

ローカルLLMは「速度・賢さでクラウドAPIに勝てるか」という土俵で語られがちだが、Ollamaの価値はそこではない。自分のデータが自分の手元から出ないこと、APIキーの管理や月末請求から解放されること、そしてモデル選択を自分で握れること──この3点が本質である。2026年は20B〜30B級モデルが「16GBのMacBook Airで実用速度」というラインに乗ってきた節目で、個人開発者・小規模事業者にとって導入コストが急速に下がっている。「商用APIで何でも済ませる時代」と「ローカルで賄える領域は賄う時代」が併存するのが今年の景色だ。

出典・リンク

コメントを残す

Trending

World AI Newsをもっと見る

今すぐ購読し、続きを読んで、すべてのアーカイブにアクセスしましょう。

続きを読む