top of page

工場のRFP(提案依頼書)において、AI、ML、LLM、RAG、エージェントが1つの文章にまとめられる理由

9月10日
読了時間: 15分

工場のRFP(提案依頼書)において、AI、ML、LLM、RAG、エージェントが1つの文章にまとめられる理由   

そして、その1枚の図が実際に指し示している階層


添付: 各階層は代替財ではなく、直下の階層を前提として能力と責任を一段階引き上げる構造である。
添付: 各階層は代替財ではなく、直下の階層を前提として能力と責任を一段階引き上げる構造である。

役員会(ボードルーム)や発注文書では、まず言葉が混同されがちです。「生成AIで不良を減らす」「LLMを導入する」「エージェント化して運用する」といった形で、1つの文章の中に異なる階層が混在しています。添付の図表は、その混線を1枚にまとめてクリアにしてくれます。

AIの上にMLがあり、MLの上にDLが、その上にGenAI・LLM・RAGが積み重なり、最上階にAgentic AIが位置します。各階層は代替財ではなく、直下の階層を前提として能力と責任を一段階引き上げる構造です。

工場側が問うべきは、モデルの名前ではありません。この作業にはどの階層までが必要なのか。そしてその階層が、自社のMES・SCADA・FDC・PLC・CCTVの上で、何として入力・出力されるのかです。


添付: Towards AI 階層はピラミッドではなく、累積(積み上げ)構造である。最上階のエージェントだけを購入しようとすれば、下の階層が空洞化したまま稼働させることになる。
添付: Towards AI 階層はピラミッドではなく、累積(積み上げ)構造である。最上階のエージェントだけを購入しようとすれば、下の階層が空洞化したまま稼働させることになる。


1. 全体像(ザ・ビッグピクチャー)— ある階層が次の階層を可能にする

図の左側、「THE BIG PICTURE」こそが核心です。外側から内側へ、あるいは下から上へと読み進めます。

  • AI — 機械に思考、推論、行動を行わせる最も広い傘。ルールベースのエキスパートシステムもここに含まれます。

  • ML — 人間がすべてのルールを記述するのではなく、データからパターンを学習します。

  • DL — その学習を多層ニューラルネットワークによってさらに押し上げます。画像・音声・時系列データのように、人間が手作業で特徴量を定義することが困難な入力がここで扱えるようになります。

  • GenAI — 分類や予測を超えて、テキスト・画像・音声などの新しいコンテンツを生成します。

  • LLMs — GenAIの中でも、言語の理解と生成に特化した大規模モデルです。

  • RAG — その言語モデルに外部知識(ドキュメント、マニュアル、ログ、SOP)を検索して結合します。学習時点以降の事実や社内規定に回答を紐付けます。

  • Agentic AI — 理解と生成を超えて、目標を分解し、ツールを活用し、計画を立てて実行します。

右側の「THE EVOLUTION」は、同じ文脈を時系列で再描画したものです。

Think → Learn patterns → Learn complex patterns → Create content → Understand language → Knowledge + generation → Act autonomously.

最も重要な一文は、すでに図の最上部に記されています。

「Each layer builds on the previous one, adding more capability and intelligence.(各階層は直下の階層を前提として構築され、より高度な機能と知性を付加する)」

工場がこの一文を見落とすと、「LLMチャットボットを購入したのに、レシピパラメータの自動制御まで期待してしまう」という不整合な発注が発生することになります。


添付: LinkedIn / Dr. Archana Ashok 生成と行為(アクション)は同じ円(領域)に存在するものではない。GenAIがテキストを生成し、Agentic AIがツールと目標を結合させる。
添付: LinkedIn / Dr. Archana Ashok 生成と行為(アクション)は同じ円(領域)に存在するものではない。GenAIがテキストを生成し、Agentic AIがツールと目標を結合させる。



2. 現場の事例が指し示す階層 — チャットボットとチャンバーは同じ「AI」ではない

図の下部「REAL-WORLD EXAMPLES」を工場の文脈(言葉)に置き換えると、その階層差が明確になります。

階層

図表内の例

工場における実例

この階層だけで完結するという錯覚

AI

エキスパートシステム、ロボティクス、ゲームAI

インターロック、レシピ分岐、アラームロジック

「すでにAIを導入済み」と錯覚し、学習や根拠の提示を省略する

ML

スパム検出、レコメンド、不正検出、予測分析

歩留まり予測、設備異常スコア、需要予測

表形式データ向けモデルで、画像・音声・振動まで対応できると思い込む

DL

画像・音声認識、自動運転

AOI(自動光学検査)欠陥判定、保護具・エリア違反検知、音響異常検知

認識精度のみに囚われ、処置や監査トレーサビリティを欠落させる

GenAI

ChatGPT, Midjourney, DALL-E, 拡散モデル

作業標準書案の作成、異常レポートドラフト作成、教育用コンテンツ生成

生成された文章をそのまま現場への直接指示として運用してしまう

LLMs

GPT-4/5, Claude 3, Gemini, Llama 3, Qwen

SOP(標準作業手順書)・FDC(不良原因解析)ログ照会、原因仮説の記述

モデルが自社工場のチャンバー仕様を把握していると過信してしまう

RAG

企業向けチャットボット、社内文書Q&A、ナレッジベース

作業許可・LOTO・レシピ・過去のチケットを根拠とした回答提示

検索機能を付加するだけで、ハルシネーション(錯覚)や責任問題が解消すると思い込む

Agentic AI

自律型エージェント、ツール利用、ワークフロー自動化

巡回ルート最適化、レシピ補正案の提示、設備停止勧告

自律化を「検証なしでの自動実行」と同一視してしまう

この図表が誠実(正直)である理由は、まさにここにあります。

ChatGPTはLLM / GenAIの事例であり、工場のAgenticレイヤーではありません。社内文書のQ&AはRAGの事例であって、PLCに制御命令を打ち込むシステムではありません。

ヒューマノイドや四足歩行ロボット(犬型ロボット)の「ハードウェア(身体)」が公開市場で価格設定されることと、その身体が自社の安全規定の枠内で適切に停止するという「判断」は、まったく異なる階層の領域です。


添付: Palladium Dynamics スマートファクトリーの画面(ダッシュボード)は、すでに稼働しています。今埋めるべき「空白」はダッシュボードそのものではなく、画面上のデータがどの階層から導き出されたものであり、誰がその実行を承認するのかという点です。
添付: Palladium Dynamics スマートファクトリーの画面(ダッシュボード)は、すでに稼働しています。今埋めるべき「空白」はダッシュボードそのものではなく、画面上のデータがどの階層から導き出されたものであり、誰がその実行を承認するのかという点です。


3. なぜこの階層構造が工場においてより鮮明になるのか

図表にある「WHY THIS MATTERS」の4行を製造現場の文脈で読み解くと、以下のようになります。


  • 階層と相互関係を正しく理解せよ — LLMを導入したからといってRAGを導入したことにはならず、RAGを構築したからといってエージェントが自律運用されるわけではありません。

  • 課題に応じた最適な階層を選定せよ — 保護具の未着用検知であればDL(ディープラーニング)ビジョンで十分です。過去の同一レシピにおける異常履歴を引用して原因を記述するにはRAGが必要です。許容範囲内で流量補正を提案するには、エージェントと検証ゲート(Validation Gate)が必要です。

  • 真の価値を生み出すプロダクトを構築せよ — デモ(POC)は生成(GenAI)レイヤーで成立しますが、歩留まり・不良・重大災害の改善といった実効的成果は、処置および監査(Action & Audit)レイヤーで決します。

  • RAGとエージェントを精度と自律性の観点から正しく使い分けよ — 精度は「検索された根拠(Evidence)」であり、自律性は「許容されたアクション空間(Typed Actions)」です。この2つを単一の言葉で混同すると、システムの障害・失敗ポイントが見えなくなります。

AI技術は絶えず進化します。将来への備えとは、単なる「モデルの置き換え」ではなく、「堅牢な階層設計(アーキテクチャ)」に他なりません。

ディープラーニングが画像を認識できるようになったことと、その画像が「現在のSOP(標準作業手順書)において許容される状態か」を判断できるようになったことは、まったく次元の異なる事象です。


添付: promptengineering.org 「AI ⊃ ML ⊃ DL」は教科書的な図表に過ぎません。工場側が次に問うべき真の領域(円)は、単なるGenAIの導入ではなく、その出力(データ・文章)が現場の規定や設備制御命令に対してどのように安全に接続(クローズ)されるかです。
添付: promptengineering.org 「AI ⊃ ML ⊃ DL」は教科書的な図表に過ぎません。工場側が次に問うべき真の領域(円)は、単なるGenAIの導入ではなく、その出力(データ・文章)が現場の規定や設備制御命令に対してどのように安全に接続(クローズ)されるかです。


4. 構造的ギャップ(Structural Gap)—

言語モデルの出力が工場の入力となるために

汎用的なAIスタックをそのまま製造現場に適用しようとすると、以下の「5つの構造的ギャップ(空欄)」が生じます。

これは、ロボット工学におけるVLA(Vision-Language-Action)モデルの概念と、実際の産業現場の制御要件との間に存在する乖離と同様の構造的課題です。

核心要因

汎用LLM / デモエージェント

産業現場が要求するもの

Action Space

トークン、ツール呼び出し、チャット応答、6DoF姿勢

レシピパラメーター、設備コマンド、許容エンベロープ(安全動作領域)

Knowledge

事前学習コーパス +(存在する場合)Web情報

SOP(標準作業手順書)、作業許可、LOTO、FDC、社内過去失敗モード

Sensor Modality

テキスト ± 画像

FDC時系列データ + 映像 + 音響・振動・熱

Control Rhythm

対話ターン、クラウド往復遅延

ウェハー・バッチイベント、オンプレミス超低遅延

Safety & Audit

ポリシーフィルター、ブラックボックスの許容

すべての判断における根拠提示。歩留まり・不良・重大災害に対する責任追跡性

LLM(大規模言語モデル)の性能が低いからではありません。制御対象が「文章」ではなく「工程」だからです。RAG(検索拡張生成)が脆弱だからでもありません。検索対象が「Wikipedia」ではなく「外部へ持ち出せないライン(現場)データ」だからです。エージェントという概念が非現実的だからでもありません。工場における「自律」とは、「何でも行う」ことではなく、「厳格に検証された型付きアクション(Typed Action)のみが検証ゲート(Validation Gate)を通過する」ことを意味しなければならないからです。

したがって、図表の下部に示された「KEY MODERN CONCEPTS」は、工場の言語によって以下のように書き換えられます。


  • Multimodal AI(マルチモーダルAI) — 単にテキストを処理するだけでなく、映像・センサー・ログを一元的なコンテキストとして扱います。既存のCCTVやFDC(不良原因解析)データがその出発点となります。

  • RAG(検索拡張生成) — 生成の前に、あるいは生成と同時に、自社の規定や過去の異常発生事例を正確に参照・引き出します。

  • Fine-tuning(ファインチューニング) — 汎用モデルが「何が見えているか」を解決する一方で、ドメインコアは「このチャンバー、このレシピにおいて何が許容されるか」を解決します。

  • Prompt Engineering(プロンプトエンジニアリング) — プロンプトは入口(インプット)に過ぎません。出口(アウトプット)は、スキーマ化された処치構造と「根拠の鎖(Evidence Chain)」です。

  • AI Safety(AIセーフティ) — 単なる不適切な言葉を弾くフィルター文脈ではなく、誤ったアクションが「歩留まり低下」や「重大災害」へ直結することを防ぐためのシステム設計です。

  • AI Agents(AIエージェント) — 計画・ツール・実行を担います。ただし、実際の実行主体はあくまで「PLC」であり、エージェントの役割は「最適な提案」の提示にとどまります。


添付: Weaviate RAGはLLMにドキュメントを読み込ませるための単なる裏技(トリック)ではない。回答が自社のナレッジベースのどのページから導き出されたのか、その追跡可能な根拠(エビデンス)を記録・保持するための不可欠な装置である。
添付: Weaviate RAGはLLMにドキュメントを読み込ませるための単なる裏技(トリック)ではない。回答が自社のナレッジベースのどのページから導き出されたのか、その追跡可能な根拠(エビデンス)を記録・保持するための不可欠な装置である。
添付: JR Automation 半導体ラインにおける制御・指示は、チャット画面上のテキストではありません。ウェハー、レシピ(プロセス条件)、そしてインターロック(安全遮断回路)そのものです。
添付: JR Automation 半導体ラインにおける制御・指示は、チャット画面上のテキストではありません。ウェハー、レシピ(プロセス条件)、そしてインターロック(安全遮断回路)そのものです。


5. 統一コア上に階層を構築するアプローチ — 概念をプロダクトへ昇華させるために

ミスリル(Mithril)を単なる「安全管理企業」と捉えるのは、アーキテクチャの一部しか見えていない証拠です。プロダクト群は多岐にわたりますが、駆動するエンジンは単一です。この階層構造を「現場用アダプター」として解釈することで、各要素の役割が明確になります。

  • NENYA: 産業現場の映像・センサー・工程・行動データから直接学習する sVLA (Specialized Vision-Language-Action) コアエンジン。オープンソースVLMをファインチューニングしただけの単なるチャットボットではありません。「産業用エンコーダー ➔ マルチモーダル統合 ➔ 推論器 ➔ XAI(説明可能なAI) ➔ 検証ゲート ➔ PLCアダプター」を自社階層として垂直統合しています。

  • Guardian-Alpha: 作業員・危険要因・IoT領域をカバー。DLビジョン + エージェントによる即時処置(PTZカメラ追尾、アラート発報、設備制御信号) + 監査ログを統合。

  • Optima-Alpha / Optima-Vision: FDC(不良原因解析)・品質・欠陥領域をカバー。工程知識を照会する「RAG」と、傷・パーティクルを検出する「DL」を同一ループ内で同期運用。

  • Robotics & Physical OS: 四足歩行ロボット、ドローン、ヒューマノイドのための「アクションレイヤー」。Agentic AIの判断が「物理的な身体」へと降下・実行される領域です。

これら4つのプロダクトが共有するコアコンセプトは、本フレームワークの進化プロセスそのものです。

Perception(認識) ➔ Context(文脈) ➔ Evidence(根拠) ➔ Action(実行)

この構造が成立するための必要十分条件

  • 産業特化型データで構築されたコア: 汎用モデルが「何が見えているか」を解析している間に、NENYAは「このレシピ、このチャンバー、このSOPにおいて、今何が許容されているか」を決定決定論的に解きます。

  • 既存インフラとの非破壊的共存: MES、SCADA、FDC、PLCといった既存システムのリプレイスは不要です。「提案はAIモデルが行い、検証は決定論的ルールが担い、実行はPLCが司る」という役割分担を徹底します。

  • オンプレミス・閉域網での完全稼働: 追加のセンサーインフラを要さず、既存のCCTVで安全を監視し、既存のFDCデータを受信します。データが工場外へ流出することはありません。

  • すべての判断に対する追跡可能な根拠の付与: Perception ➔ Decision ➔ Action(許容された安全領域内) ➔ Audit(エビデンスチェーン)。単なるアラーム画面は「プロダクト」とは呼びません。

  • 実現場における定量的検証: 2023年11月以降、25か所以上の現場へ導入され、累積学習フレーム数は2,300万に達します。危険行動検知の再現率は98.7%、偽陽性率は0.8%、安全事故削減率は94%(導入前比・内部運用基準)を記録。ハンイル現代セメント、三表(Sampyo)、聖信洋灰、SPC、AJU、東遠システムズ、韓国タイヤなど、セメントから食品・飲料、半導体設備、二次電池へとドメインが拡大しても、コアアーキテクチャの原則は揺らぎません。

  • ライン由来の実証データ: 二次電池コーティング工程では、不良率26%低減、設備ダウンタイム31%削減、歩留まり3.8%p向上(顧客フィードバック基準)を達成。半導体設備のブラインドテストでは、従来システムが2/5の精度にとどまる中、NENYA Gen1は5/5の適合精度を記録しました。数値の出処はベンチマークではなく、現実の生産ラインです。

NENYAの世代交代もまた、本フレームワークの階層構造と完全に同期しています。

  • Gen 1: 理解と説明(LLM・RAGレイヤー)

  • Gen 2: 処置と検証ゲート(エージェントにおける「許可された行動」のみの選定)

  • Gen 3: PLC連動およびフィードバック再学習

目指すべき地点は「自律製造インテリジェンス」ですが、現在現場で稼働しているロジックは、本フレームワークが提示する厳格な順序に則っています。

「提案するAI + 検証するルール + 実行するPLC」


添付: Korea JoongAng Daily ポスコ(POSCO)製鉄所に投入された四足歩行ロボット(ロボット犬)。「身体(ハードウェア)」が厳しい製造現場へと足を踏み入れたとき、最後に残される真の問いは「どのように巡回するか」ではありません。「その判断がアーキテクチャのどの階層から導き出されたものであり、その追跡可能な根拠(エビデンス)がどこに記録・保存されるのか」という点です。
添付: Korea JoongAng Daily ポスコ(POSCO)製鉄所に投入された四足歩行ロボット(ロボット犬)。「身体(ハードウェア)」が厳しい製造現場へと足を踏み入れたとき、最後に残される真の問いは「どのように巡回するか」ではありません。「その判断がアーキテクチャのどの階層から導き出されたものであり、その追跡可能な根拠(エビデンス)がどこに記録・保存されるのか」という点です。
添付: Communications of the ACM すでに稼働している観制画面(ダッシュボード・SCADA)を単に別のシステムへ置き換えることは、本来解決すべき課題ではありません。
添付: Communications of the ACM すでに稼働している観制画面(ダッシュボード・SCADA)を単に別のシステムへ置き換えることは、本来解決すべき課題ではありません。


6. エンタープライズが今、調達仕様書に記載すべき3つの原則

図表内の「Choose the right approach for your problem」という一節を、実際のRFP(提案依頼書)や調達仕様書の言葉に翻訳すると、以下の3点に集約されます。

  1. 導入単位を「モデル名」ではなく「階層(Layer)とタスク」で定義せよ

    「LLM導入」「エージェント導入」といった曖昧な記述を排除し、「この工程のこの作業において必要な階層(認識 / 根拠 / 生成 / 処置)、目標成功率、失敗時の物理インターロック、そして判断根拠の記録主体」を明記します。検証用データセットはベンダー任せにせず、発注元(自社)が主導権を握る必要があります。

  2. 自社の安全規定・品質規格に基づく評価試験(ベンチマーク)を策定せよ

    公開ベンチマーク(MMLU等)は参考指標に過ぎません。そのテスト項目に「密閉空間作業許可」「LOTO(ロックアウト・タグアウト)」「高所落下防止」「コンベア挟み込み」「IATF16949品質追跡性」が含まれていない限り、そのスコアは自社工場の実績とは無関係です。エビデンスチェーン(Evidence Chain)をループの最終検証ブロックに配置する理由はここにあります。

  3. 既存の制御・設備レイヤーを否定・対立させるな

    AIモデルが高性能化するほど、現場に既に存在するCCTV、FDC、PLC、SOP(標準作業手順書)の価値は高まります。汎用GenAIの言語能力向上に伴い、自社固有のレシピや禁止動作を正確に参照・結合する「RAG」および「ドメイン微調整コア」の資産価値は跳ね上がります。レトロフィット(後付け適合)が可能な「判断・検証レイヤー」こそが、投資対効果(ROI)を最短で創出します。



7. 図表が「空欄」として残した領域

本フレームワークはAIの系譜図を明瞭に示しています。AIがMLを内包し、MLがDLを包含し、DLがGenAIを拓き、LLMが言語理解を担い、RAGが追跡可能な根拠を付与し、Agentic AIが目的達成に向け動作する——。

ここで証明された真の価値は、単に7つの用語が存在することではなく、同じ「AI」という総称の傘下に、入出力と責任の所在が全く異なる階層が積層しているという事実です。

製造現場に今求められているのは、その図表の「すぐ隣にある空白(Blank Space)」を埋めることです。

  • この工程・この設備・このSOPにおいて、どの階層から着手すべきか。

  • 必要なのはテキストの「生成」か、検索された「根拠」か、許可された「アクション(Typed Action)」か。

  • 逸脱が発生した際、どの安全ゲートがラインを停止させ、その判断を監査ログとして何に残すのか。

この空白を定義しないまま推進された導入は、宣伝文句に過ぎないChatGPT利用、アラームを鳴らすだけのDLビジョン、根拠を欠いたハルシネーション生成、あるいは無検証なエージェントによる誤作動を引き起こします。低遅延な物理応答を要するハードウェアと、データを外部へ持ち出せない閉域網の工場が同時に存在する本質的な理由がここにあります。

ミスリル(Mithril)の回答は、このアーキテクチャ階層をそのまま包括的なプロダクトラインナップへ展開することです。

  • 判断コア: NENYA(sVLAエンジン)

  • 安全管理: Guardian-Alpha

  • 歩留まり・品質分析: Optima-Alpha / Optima-Vision

  • 物理自律制御: Physical OS

作業員に寄り添うCCTVカメラから、チャンバー内のプロセスセンサー、そして巡回ロボットに至るまで、同一の「産業用判断言語」がシームレスに貫通します。この技術基盤は、NVIDIA Inception、TIPS、忠南C-STAR、高麗大学パターン認識・マシンラーニング研究室との強力な共同R&Dによって裏打ちされ、グローバル市場においてはSunway、TOA、Elsewedy/AOI等との提携により展開が進んでいます。

必要なのは、現時点で現場に蓄積されているログや映像、防止すべき事故、そして改善すべき歩留まりの定義のみです。その材料を元に、今解決すべき階層が「認識」なのか、「根拠」なのか、あるいは「処置」なのかを精緻に特定することから始まります。

ミスリルのアーキテクチャと御社現場の「空白」が、この階層構造のどこに位置づけられるべきか、ぜひ定義を開始しましょう。

 
 
 

コメント


bottom of page