ai
Ollama
一言でいうと
ローカル環境でAIモデルを取得・実行し、アプリから呼び出せる推論APIを提供するランタイム。
より具体的には
対応するモデルの取得、保存、ロード、推論をまとめて扱い、HTTP APIやコマンドラインから利用できる。Ollama自体が一つのLLMなのではなく、用途に応じて選んだモデルを実行するためのソフトウェアである。
Windows、macOS、Linuxで利用でき、環境に応じてCPUやGPUによる推論を行う。利用可能なアクセラレーション、メモリ使用量、応答速度は、OS、ハードウェア、ドライバー、モデルによって異なる。
関連記事での使用例
HandyとローカルLLMで音声入力環境を構築しようとした話
この記事では、Windows上のOllamaでQwen3 8Bと14Bを比較し、Radeon 780MのVulkan経路で8Bモデルを文章整形に利用した。