一言でいうと

ローカル環境でAIモデルを取得・実行し、アプリから呼び出せる推論APIを提供するランタイム。

より具体的には

対応するモデルの取得、保存、ロード、推論をまとめて扱い、HTTP APIやコマンドラインから利用できる。Ollama自体が一つのLLMなのではなく、用途に応じて選んだモデルを実行するためのソフトウェアである。

Windows、macOS、Linuxで利用でき、環境に応じてCPUやGPUによる推論を行う。利用可能なアクセラレーション、メモリ使用量、応答速度は、OS、ハードウェア、ドライバー、モデルによって異なる。

関連記事での使用例

HandyとローカルLLMで音声入力環境を構築しようとした話

この記事では、Windows上のOllamaでQwen3 8Bと14Bを比較し、Radeon 780MのVulkan経路で8Bモデルを文章整形に利用した。

関連