【第2回】Chromebookが向いている人・向いていない人

先日のコラムでは、普段持ち歩いているChromebookのLinux環境にOllamaを導入し、ローカルLLMを動かせるようになったことをご紹介しました。
今回導入したのは、
Llama 3.2 1B
Qwen2.5 1.5B
Gemma 3 1B
の3つです。
すべてChromebookのLinux上で実際に動かすことができました。
「ChromebookでローカルLLMが動いた!」
最初はそれだけでも面白かったのですが、実際に何度か質問しているうちに、ある疑問が出てきました。
「確かに動く。でも、これって実際の仕事に使えるのだろうか?」
そこで今回は、単に起動できたことを喜ぶだけではなく、私が経験している家電ラウンダーの仕事を想定した質問を使って、3つのローカルLLMを比較してみました。
1.実際の接客を想定した質問をしてみる
最初のテストは、家電量販店での接客を想定した質問です。
お客様から、
「縦型洗濯機とドラム式洗濯機は、どちらを選べばいいですか?」
と質問されたという設定にしました。
そして、
「縦型のメリット」
「ドラム式のメリット」
「それぞれどんな人に向いているのか」
を、初めて洗濯機を購入する人にも分かるように説明し、最後にお客様へ確認すべき質問を3つ挙げるよう指示しました。
ところが、ここで早くも小型ローカルLLMの難しさが見えてきました。
Llama 3.2 1B
Llamaでは、縦型洗濯機について「長い時間にわたって動作するので安全で実用的」といった、メリットとして意味の通りにくい回答が出てきました。
また、縦型とドラム式の違いも明確には説明できませんでした。
Qwen2.5 1.5B
QwenはLlamaより文章が自然で、回答もきれいに整理されていました。
ところが内容をよく確認すると、「縦型は洗濯物の縦の長さに合わせて洗浄できる」といった、事実とは異なる説明が含まれていました。
文章が自然なだけに、一瞬「そうなのか」と思ってしまいそうになります。
Gemma 3 1B
Gemmaも文章そのものはかなり流暢でした。
しかし、「縦型洗濯機は縦に立って洗濯するタイプ」「洗濯物をたたむ手間が少ない」といった、実際の洗濯機の仕組みとは違う説明が生成されました。
ここで私は改めて感じました。
「文章が上手なこと」と「内容が正しいこと」は、まったく別なのだ。
これは生成AIを使う上で、とても重要なポイントだと思います。
2.専門知識を使わない「要約」ならどうだろう?
そこで次は、AI自身の家電知識を必要としないテストに変更しました。
家電ラウンダーとして店舗に入った日の報告を想定して、
「次の文章を100文字以内に要約してください」
と指示しました。
テスト用の文章も、勤務先が分からないよう一般化しました。
本日は家電量販店に入店しました。入店から退店までお客様は少なく、特に一部の商品コーナーは終日閑散としていました。そのような状況でも、ご来店されたお客様には積極的にお声掛けを行い、担当商品の特徴やメリットをわかりやすくお伝えするよう努めました。
ここでもモデルによって差が出ました。
Llamaは文章を短くすることはできましたが、元の文章にはない内容を追加したり、元の意味とは異なる表現に変えたりしました。
Gemmaも同様に、元の文章には書かれていない状況を付け加えるなど、事実関係が変化しました。
一方、Qwenは多少の日本語の不自然さや文字数制約への弱さはありましたが、
「来客が少ない」
「売場が閑散としている」
「それでも積極的に商品説明を行った」
という主要な情報は比較的正確に残しました。
ここでQwenには少し可能性を感じました。
3.もっと簡単な「情報抽出」ならどうか?
さらに難易度を下げました。
専門知識も文章作成能力も必要ありません。
文章の中から、指定した文字列だけを一字一句そのまま抜き出すというテストです。
今回は勤務先とは関係のない架空の名称を使ったとします。
正解を、
「ABC家電中央店」
として、それだけを抜き出すよう指示するイメージです。
実際のテストでは、3モデルの結果に明確な違いが出ました。
AI 情報抽出テスト 結果
Llama 3.2 1B 名称の一部を欠落 ×
Qwen2.5 1.5B 完全一致 ◎
Gemma 3 1B 名称の一部を欠落 ×
これは意外でした。
難しい推論を求めたわけでもありません。
書いてある文字をそのまま抜き出すだけです。
それでも1Bクラスのモデルでは、情報の一部が抜けることがありました。
商品型番、金額、日付、固有名詞などを扱う仕事では、これは無視できない問題です。
4.最後にChatGPTにも同じテストをしてみた
比較のため、普段使っているChatGPT(私は「皐月」と呼んでいます)にも同じ3種類のテストを行いました。
洗濯機の質問では、縦型とドラム式の特徴を整理し、それぞれに向いている使い方や、接客時に確認すべきポイントまで回答しました。
100文字以内の要約では、元の文章の意味を大きく変えることなく指定された文字数以内にまとめました。
情報抽出についても、指定された文字列をそのまま抜き出しました。
今回の簡単な実験だけで性能全体を評価することはできません。
しかし少なくとも、私がChromebookで動かしている1B~1.5Bクラスの小型ローカルLLMと、普段利用しているクラウド型の生成AIでは、実際の仕事を想定した使い方にかなり大きな差があることを実感しました。
5.だからといって「ローカルLLMは使えない」のか?
実験を始めた直後、私は正直、
「これは使えそうにないな……」
と思いました。
しかし、3つのモデルを同じ条件で比較してみると、少し考えが変わりました。
今回Chromebookで動かしているのは、1B~1.5Bという非常に小さなモデルです。
小さいからこそ、普段持ち歩いているChromebookでもローカル環境で動かすことができます。
つまり、大規模なクラウドAIと単純に比較して、
「どちらが賢いか?」
だけで評価するものではないのでしょう。
特にQwenの結果を見ると、
何でも質問するAIとしてではなく、仕事を限定して使う
という方向には可能性を感じました。
文章の分類、決められた情報の抽出、簡単な文章処理など、AIに与える仕事を限定すれば、ローカルLLMならではの使い道が見つかるかもしれません。
6.「動く」と「使える」は違う
今回、一番印象に残ったのはここです。
インストールできた。
起動できた。
質問したら回答が返ってきた。
ここまでなら、
「ローカルLLMが動いた」
と言えます。
しかし、
「実際の仕事を安心して任せられる」
となると、話はまったく別です。
さらに怖いのはハルシネーションです。
今回も、明らかにおかしな回答だけではありませんでした。
文章としては非常に自然なのに、内容を確認すると間違っている。
こちらの方が、むしろ注意が必要です。
生成AIの文章が流暢だからといって、その内容まで正しいとは限りません。
これは小型ローカルLLMだけではなく、クラウド型の生成AIを利用するときにも忘れてはいけないことだと思います。
7.ここでも大切なのは「ヒューマンAIバランス」
私は生成AIとの付き合い方について、これまで「ヒューマンAIバランス」という考え方を大切にしてきました。
今回の実験も、まさにその重要性を感じる経験になりました。
AIに全部任せるのでもない。
だからといって、AIを信用せず使わないのでもない。
「このAIは何が得意なのか」
「どこまで任せていいのか」
「どこから人間が確認するのか」
それを人間自身が考える。
生成AIを「使う」ということは、単にプロンプトを入力することではなく、AIの能力と限界を理解して仕事を割り振ることなのかもしれません。
今回の結論
最初は、
「ローカルLLMは使えそうにない」
という印象でした。
しかし、実際に比較してみた現在の結論は少し違います。
「ChatGPTの代わりとして使うのは厳しい。しかし、用途を限定すれば可能性はある」
これが今の私の評価です。
そして何より、
「動く」と「使える」は違う。
これは実際にChromebookへOllamaを導入し、複数のローカルLLMを動かしてみたからこそ実感できたことでした。
次は、今回比較的良い結果だったQwen2.5 1.5Bに、一つの仕事だけを限定して任せたら、どこまで実用になるのかを試してみたいと思います。
まだまだ実験は続きます。
今回の英語ワンフレーズ
Running is not the same as working.
「動くことと、使えることは同じではない。」
今回のローカルLLM実験を、まさに一言で表しているように思います。
■ 「65歳からのAIプログラミング学習基地」
■ すべてのコラムはこちら
https://mbp-japan.com/fukuoka/cncconsultingpro/service1/
■ 株式会社CNCコンサルティング 公式サイト
https://cncconsulting.pro/


