LM Studioサーバ利用情報
サーバとインストール情報
項目 |
内容 |
|---|---|
サーバ名 |
|
OS |
AlmaLinux 9.8 |
Private IP |
|
GPU |
NVIDIA RTX PRO 6000 Blackwell、約96 GB VRAM |
実行ユーザー |
|
推論サービス |
LM Studioのサーバ版 |
llmsterインストール版 |
|
インストール先 |
|
CLI |
|
現在のCLIバージョン |
未確認 |
C++ランタイム参照先 |
|
自動起動 |
|
CLIのバージョンは、サーバ上で lms version により確認できます。以前表示された v0.0.47 は、更新前のCLIの情報です。
モデル情報
用途 |
モデルID |
パラメータ数 |
保存サイズ |
量子化 |
|---|---|---|---|---|
チャット・文章生成 |
|
27B |
17.74 GB |
GGUF版。正確な量子化方式は未確認 |
テキスト埋め込み |
|
未確認 |
84.11 MB |
未確認 |
Qwenは1種類の量子化版をダウンロード済みです。導入時には Q4_K_M を候補として案内しましたが、選択結果やファイル名は未確認のため、確定情報としては記載していません。
現在確認できているQwenの動作設定
項目 |
設定・実測 |
|---|---|
推論 |
GPUで動作確認済み |
ロード方式 |
APIリクエスト時に自動ロード(JIT) |
JIT時のコンテキスト長 |
8192トークン |
JIT時の同時推論上限 |
4件 |
自動アンロード |
未使用状態が1時間続いた場合 |
GPUメモリ使用量 |
JITロード後、約19.9 GiB |
32kコンテキスト |
手動ロードで動作確認済み。ただしJIT設定には引き継がれない |
APIエンドポイント
OpenAI互換APIのベースURL:
http://192.168.27.18:1234/v1
用途 |
HTTPメソッド |
URL |
|---|---|---|
モデル一覧 |
GET |
|
チャット・文章生成 |
POST |
|
APIトークン認証は無効です。モデル一覧取得とチャット応答は動作確認済みです。
Pythonサンプルの使い方
モデル一覧:
python lmstudio_api_sample.py --list
モデルと質問を指定:
python lmstudio_api_sample.py \
--model qwen/qwen3.8-27b \
--prompt "正準分布を簡単に説明してください。"
アンロードされている場合、最初のリクエストではモデルのロード時間が加わります。
WebUI
ブラウザからのアクセス先:
項目 |
内容 |
|---|---|
WebUI |
Open WebUI |
コンテナ管理 |
Podman |
コンテナ名 |
|
イメージ指定 |
|
接続先API |
|
会話・設定の保存先 |
Podmanボリューム |
自動起動 |
|
ログイン |
WebUIアカウントでログイン |
モデル選択欄で qwen/qwen3.8-27b を選択して利用します。WebUIのログインと、LM StudioのAPI認証は別です。
ネットワーク・ファイアウォール
項目 |
設定 |
|---|---|
Private Net側インターフェース |
|
IPアドレス |
|
firewalld |
稼働中 |
適用ゾーン |
|
API許可ポート |
|
WebUI許可ポート |
|
送信元IPのスクリーニング |
なし |
API待ち受け先 |
|
WebUI公開先 |
|
WindowsからAPIへの接続と、ブラウザからWebUIへのアクセスは確認済みです。
サーバ管理用コマンド
サービス状態:
systemctl status lmstudio.service open-webui.service --no-pager
再起動:
sudo systemctl restart lmstudio.service
sudo systemctl restart open-webui.service
ファイアウォールの永続設定確認:
sudo firewall-cmd --zone=public --permanent --list-ports
LM StudioはOS起動時の自動起動を設定済みです。現在のoneshot形式では、起動後のデーモン異常終了に対する自動復旧は設定されていません。