注目ベンチャー紹介:Lamb Labs
2026
.
09
.
29

Written by Hiroaki Kawada
今回の注目ベンチャーの紹介はLamb Labsです。
Lamb Labsは、AIモデルのWeight(重み)を半導体チップ内に直接組み込む「MPU(Model Processing Unit)」を開発するアーリーステージのAI半導体スタートアップです。一般的なGPUでは、AI推論のたびにHBMなどの外部メモリから大量のWeightを読み出します。Lamb Labsは、AIモデルを約1-bitまで圧縮してWeightをチップ内部に固定することで、このデータ移動を削減し、高速・低消費電力なAI推論の実現を目指しています。
Lamb Labs
サービス/プロダクト概要
- AI推論に特化した独自チップ「MPU(Model Processing Unit)」を開発
- Alibabaが開発する既存のAIモデルQwenの27B(約270億パラメータ)モデルをベースに、約1-bitまで量子化したモデル「Larry」を開発
- Larryは元モデルのWeightを**3.8GBまで圧縮(14.6×小型化)**しながら、同社の評価では元モデルの92%の性能を維持
- Softwareでモデルを小型化したうえで、そのWeightと演算回路を専用Hardwareに組み込む
- 現在はFPGAで技術を実証しており、最終的には27Bモデルを20,000+ tokens/secで動かすCustom ASICを目標としている
- 下の図は小型AIモデル「Little Lamb」のWeightをすべてFPGA内部に格納した実証市販のKria KV260を使用し、12,000 FPGA token steps/sec
- token生成時の外部DRAMからのWeight読み出しはゼロ
- ※27Bモデル「Larry」の性能値ではなく、Weightを完全にOn-chip化するArchitectureを小型モデルで実証したもの

特徴/提供価値
- 一般的なGPUでは外部メモリからWeightを繰り返し読み出すのに対し、Lamb LabsはWeight自体をチップ内に固定することでデータ移動を削減
- 約1-bitまでモデルを圧縮することで、大規模なWeightをチップ内部に格納することを目指す
- 将来のASICではWeightをMask ROMなどに固定するため、GPUのようにモデルを自由に変更することはできない一方、特定モデルを大量に繰り返し利用する用途では高い処理速度と電力効率を狙える
- Softwareによるモデル圧縮と、モデルに合わせたHardware設計を一体で行う点が特徴
ビジネスモデル
- 自社開発したAI推論チップをデータセンター事業者などに販売
- 特定のAIモデルを大量に利用する推論用途をターゲット
- 顧客ごとの受託開発ではなく、複数顧客へのチップ販売を目指す
市場動向・なぜ今この会社なのか?
- 生成AIの普及により、Inference(推論)のユーザー数と必要なToken/secが急速に増加
- 従来のGPUでは、処理量を増やすほどGPUやサーバーの追加が必要となり、**ラック数、消費電力、冷却設備、CapEx(設備投資)、Opex(運用コスト)**が増大
- 特に同じAIモデルを大量のユーザーが利用する用途では、GPUの汎用性よりも、Token/secあたりのコストと電力効率が重要
- Lamb Labsは特定モデルを専用Chipに固定することで、より少ない電力・設備で大量のTokenを処理し、推論インフラ全体のコストを抑えることを目指す
顧客・競合・パートナー
- 顧客:AI企業、クラウド/データセンター事業者、Hyperscaler
- パートナー:未定
- 競合(パートナー候補含む): Taalas(モデル特化型Chip+Software)、Etched(Transformer特化Chip+Software+Rack-level System)、Groq(AI推論Chip+Software+Rack/Cloud Infrastructure)
用語解説
- Qwen:Alibabaが開発する大規模言語モデル(LLM)。Lamb LabsはQwenの27Bモデルをベースに量子化した「Larry」を開発
- Weight(重み):AIが学習によって獲得した数値データ。推論時に繰り返し利用される
- PTQ(Post-Training Quantization:学習後量子化):学習済みモデルを低bit化する手法
- QAT(Quantization-Aware Training:量子化考慮学習):低bit化を考慮して追加学習し、性能低下を抑える手法
- Mask ROM:製造時にデータを固定する書き換え不能なメモリ。Lamb LabsではWeightをチップ内部に固定するために利用する構想