2026 年從算力租賃轉型為 Token 工廠

從算力租賃轉型為 Token 工廠,意味著透過自訂區塊鏈協議、智慧合約和 Token 經濟模型,將你的算力資源 Token 化,以 Token 化存取取代傳統租賃費用,即便是執行在香港伺服器上的工作負載也不例外。整個歷程分為三個階段:評估、設計和部署。Token 計費與算力租賃將在相當長的一段時間內並行存在,因此從算力租賃的轉型更像是一個漸進過程,而不是「硬切換」。與其按固定費用租用 GPU 小時,不如透過質押 Token 取得算力存取權,不論這些 GPU 位於本地叢集還是香港伺服器。例如,在 Venice 專案中,質押 100 枚 VVV Token 即可解鎖專業版訂閱,而每枚 DIEM Token 可永久提供 1 美元的推理額度。此模型將你的 AI 基礎設施從「租金成本」轉變為「基於 Token 的存取」,涵蓋包括香港伺服器在內的所有區域。
關鍵要點
- 透過同時保留兩種計費模式並分批遷移使用者,從算力租賃逐步轉向基於 Token 的算力存取。
- 透過將 Token 吞吐量除以 GPU 功耗來衡量「每瓦 Token 數」,以追蹤效率。
- 使用者透過質押 Token 來解鎖算力存取,而不是支付按小時計費的租金。
- 部署智慧合約以自動化算力編排、安全與支付流程。
階段一 – 為從算力租賃轉型評估 AI 基礎設施
AI Token 工廠將推理基礎設施轉變為基於 Token 的 AI 服務,在消費單位層級進行治理與貨幣化。你可以在地端或主權環境中運行這些系統,從而確保資料永不離開你的受控邊界。AI Token 工廠正成為一種新的運算單位——一組專門為特定目標產生 Token 的系統集合。使用者不再以固定費用租用 GPU 小時,而是透過質押 Token 來取得算力存取權。
稽核硬體並匹配共識機制
從將硬體與推理工作負載進行匹配開始你的評估工作。面向推理的平台選擇標準應優先考慮延遲、吞吐量、GPU 排程以及高密度 GPU 管理能力。
| 硬體元件 | 在 AI 推理工廠中的角色 | 關鍵規格 |
|---|---|---|
| NVIDIA Blackwell GPU | 模型推理的平行運算 | RTX PRO 6000:600W 雙槽,96GB GDDR7;HGX B300:8 GPU,2.1TB GPU 記憶體 |
| CPU | 控制與編排 | 與 GPU/DPU 保持平衡 |
| NVIDIA BlueField DPU | 安全卸載 | 硬體層級安全能力 |
| Spectrum-X 乙太網路 | 高速網路 | 低延遲互連 |
| 企業級 Kubernetes | GPU 資源排程 | 彈性與擴展能力 |
對於較小規模的部署,NVIDIA DGX Spark 內建 128GB 統一記憶體,並運行 DGX OS,這是一款基於 Ubuntu 的 AArch64 系統。它僅支援 Arm 架構,可能會影響推理工具鏈的相容性。
在基於機密運算(Confidential Computing)的 AI Token 工廠中,硬體強制的可信執行環境(TEE)為不同租戶工作負載提供加密隔離。
在大規模建置 AI 工廠之前,先稽核以下指標:
- Token 發行延遲(在 1、10、100、1000 req/s 負載下的 P50 / P95 / P99)
- Token 驗證延遲(快取與未快取 JWKS)
- 帳本吞吐量與 P95 寫入延遲
- 在 10K / 1M / 100M 筆交易/天條件下的每筆交易成本
- 回執大小(JWS 封裝 + 證明鏈 + 中介資料)
定義 Token 在算力存取中的效用
Token 效用將驅動你的 AI 基礎設施設計。你必須決定每枚 Token 能解鎖什麼——推理額度、優先排程權,還是治理投票權。此一決策將塑造你的 Token 產出目標與跨 AI 工廠的基礎設施編排規則。在投入資本之前,將每一個 AI 基礎設施元件對應到可度量的 Token 產出。
階段二 – Token 工廠經濟學與合規設計
Token 工廠經濟學從一個核心指標開始:每瓦電力能產出多少 Token。你透過將每秒 Token 吞吐量除以 GPU 的熱設計功耗(TDP,單位瓦)來計算「每瓦 Token 數」。
每瓦 Token 數 = 吞吐量(Token/秒) ÷ GPU TDP(瓦)
範例:H100 SXM5 在 FP8 精度下以連續批次處理(batch=32)運行 Llama 3.1 70B → 約 2,000 Token/秒 ÷ 700W TDP ≈ 2.86 Token/瓦。
注意:對於受記憶體頻寬限制的解碼型工作負載,實際功耗可能低於 TDP,因此在容量規劃中可將 TDP 視為一個合理的上限。
這個比值驅動你整個 Token 工廠的經濟體系。收入 = 每瓦 Token 數 × 可用千兆瓦功率,因此受約束的是電力容量,而不是 GPU 數量。在投入資本之前,先比較不同硬體選項。
| GPU | TDP(瓦) | 估算吞吐量(Token/秒) | 估算每瓦 Token 數 |
|---|---|---|---|
| A100 SXM4 80GB | 400 | ~500 | 1.25 |
| H100 SXM5 80GB | 700 | ~2,000 | 2.86 |
| H200 SXM5 141GB | 700 | ~2,900 | 4.14 |
| B200 SXM6 192GB | 1,000 | ~5,000 | 5.00 |
基於 Llama 3.1 70B,在 FP8 量化與連續批次處理條件下的吞吐量估算值。
在你的 AI 工廠中,有三大槓桿可以提升每瓦 Token 數。更大的並發批次在相同功耗下可帶來 20–40 倍的吞吐量提升。量化優化——例如從 FP16 降到 FP8——在不提高 TDP 的前提下可以額外增加 30–40% 的吞吐量,而 INT4/AWQ 則可將每 Token 基礎設施成本減半。框架效率同樣關鍵:在相同硬體上,TensorRT-LLM 的吞吐量大約可達到樸素 PyTorch 的兩倍。將「每百萬 Token 成本」作為配套指標進行追蹤:每百萬 Token 成本 = ($/小時) ÷(吞吐量 Token/秒 × 3,600)× 1,000,000。
設定 Token 供給與質押機制
電信業者提供了一個有用的定價參考。他們正從固定月費訂閱轉向基於實際用量(Token 消耗量)計費。你可以遵循相同模式:按消耗的 Token 計費,而不是按預留的小時計費。此一轉變讓你的 Token 產出直接與需求掛勾,並獎勵高效的 AI 基礎設施。設定你的 Token 供給,使質押行為可以解鎖算力存取,並根據你自有硬體量測的每瓦 Token 數資料來設計質押等級。
對接 SEC 與 MiCA 合規要求
監管設計從一開始就塑造你的 Token 經濟學。在美國,SEC 會將證券法分析框架套用於 Token 發行,因此你必須紀錄質押獎勵與存取權利如何有別於投資報酬。在歐盟,MiCA 則為加密資產發行與服務供應商建立了統一框架。與你的法律顧問合作,對 Token 進行分類,清楚揭露質押條款,並保留 Token 產出與分配的紀錄。將合規視為 AI 工廠設計中的輸入條件,而不是事後補強。
階段三 – 部署 AI 工廠並遷移使用者
Token 計費與算力租賃將在相當長的一段時間內並行運作。你應該按使用者族群(cohort)分批遷移,而不是一次性全部切換。這種分階段方式可以降低干擾,並讓你先在小規模中測試新系統,再逐步擴展。從現在開始,你將從規劃走向執行。
從裸機到工作負載:智慧合約上線流程
部署 AI 工廠需要一個在裸機與工作負載之間搭建橋樑的編排層。你需要「從裸機一路編排到工作負載」,管理 GPU 基礎設施編排與推理工作負載的動態資源配置。智慧合約會自動選擇運算節點、處理向模型擁有者與資源提供者的付款,並透過替換離線機器來確保容錯能力。這個統一的編排層將成為 AI 雲產業的控制平面,支援生產等級的 AI 工廠部署。
智慧合約的部署遵循清晰的流程。首先,你從錢包發起一筆交易,以呼叫函式、傳送 Token 或部署合約。接著,你將交易廣播到區塊鏈網路,由節點驗證發送方簽章與餘額。然後,網路中的虛擬機執行合約位元碼,處理輸入並決定狀態變更。如果交易有效,系統會將更新後的合約狀態以不可竄改的方式記錄在區塊鏈上。已驗證的交易及其狀態變更會被打包進由礦工或驗證者確認的新區塊中。最後,系統發出事件通知外部系統,並提供包含執行細節的交易回執。
安全性在任何生產就緒的 AI 工廠中都至關重要。你可以透過區塊鏈與智慧合約的不可竄改性、受信載入器進行內容驗證、TCB(可信運算基底)驗證、中介軟體與 AI 引擎開源可驗證、端到端加密、運用 NVIDIA 與 Intel 函式庫實現 TEE 證明,以及將分散式金鑰儲存在去中心化檔案儲存上的加密保險庫,來實現安全與透明。區塊鏈紀錄與智慧合約具有不可竄改且透明的特性,而部署順序的具體內容則保持機密。輸入資料完整性透過雜湊與簽章在執行期間由受信載入器加以驗證與證明。
這一整套編排堆疊降低了從原始算力到最終客戶工作負載交付之間的摩擦。你現在可以直接「通向 Token」,向使用者交付基於 Token 的服務。隨著這套基礎設施編排層的落地,從算力租賃的轉型將進一步加速。你正在大規模建置 AI 工廠,從裸機邁向 Token 交付。AI 編排堆疊將成為你整體 AI 基礎設施的編排控制平面。
Token 分配、治理與後訓練
在智慧合約上線後,你需要分配 Token 並建立治理機制。基於質押的投票允許 Token 持有者對參數更新產生影響,例如每瓦 Token 效率目標或 GPU 排程優先順序。你需要監控 Token 產出率等營運指標,並據此調整基礎設施編排。Token 分配應與使用者在 AI 工廠中的貢獻與質押水準相對應。
由 Token 工廠驅動的後訓練環節,填補了從 MVP 到真正生產級 AI 之間缺失的一層。你可以使用自家 AI 工廠產生的資料對基礎模型進行客製化。流程包含數個關鍵步驟。資料匯入與篩選會使用 Token 工廠的生產資料——聊天紀錄、日誌與回饋——作為訓練資料,將每一次使用者互動轉化為模型持續最佳化的訊號。多節點監督式微調(SFT)允許使用者啟動由 Nebius Papyrax 等框架驅動的作業,這些框架會自動處理切分、平行化、排程與檢查點管理,以實現最大吞吐量與可重現性。強化微調(RFT)則透過將顯性與隱性使用者回饋轉化為獎勵模型,使模型行為在「有用性、語氣與安全性」等產品特定目標上完成對齊。推測解碼在微調之後進一步優化推理速度。整條管線——壓縮、微調與部署——最終整合為一個可組合的統一系統,從而迅速將基礎模型轉化為精簡、可投入生產的資產。
你透過 AI 基礎設施來管理 Token 產出,並根據使用者互動持續優化輸出。AI 基礎設施支援持續的訓練迭代,讓你的工廠隨著時間推移變得更「聰明」。此時你已經在營運一座生產就緒的 AI 工廠,為使用者提供客製化推理服務,並與自家的 Token 經濟體系深度整合。
現在,你已經擁有一條清晰的路線圖:在 Q1 完成評估,在 Q2 完成設計,然後在 Q3–Q4 部署並遷移使用者。在主網上線或分發任何 Token 之前,務必先在測試網中完成所有測試。透過分階段方式,Token 計費與算力租賃將長期並存,從而確保轉型過程的平滑性。牢記,你的 AI 工廠經濟表現取決於每瓦 Token 效率,而不僅僅是 Token 價格。先從一小批既有租賃使用者中選出試點族群,觀察他們的質押行為,並在擴大全面 Token 產能之前,先優化好你的 AI 基礎設施。
常見問題(FAQ)
Token 工廠會如何改變我銷售算力的方式?
你會停止銷售「預留時數」,轉而銷售「存取權」。使用者透過質押 Token 來解鎖推理服務,你按使用者消耗的 Token 量計費。你的收入因而能更真實地追蹤實際需求,而不是閒置的預留容量。
我該如何評估硬體是否足夠高效?
追蹤「每瓦 Token 數」。將每秒 Token 吞吐量除以 GPU 的熱設計功耗(瓦)。文中的 H100 範例值約為 2.86 Token/瓦。比值越高,代表在相同電力容量下可以獲得更多收入。
我需要在第一天就關掉原有的算力租賃業務嗎?
不需要。Token 計費與算力租賃會在較長時間內並行存在。你可以按使用者族群分批遷移,讓部分使用者率先切換到 Token 模式,對其餘使用者繼續保留舊的定價,並以質押行為指引你的整體推廣節奏。
在主網上線之前我需要測試什麼?
先在測試網上跑通所有環節。驗證 Token 發行延遲、帳本吞吐量以及每筆交易成本等指標。只有當試點族群證明該模型可行之後,才開始分發 Token 並切換到主網環境。
後訓練在我的 AI 基礎設施中處於什麼位置?
後訓練將你的工廠生產資料轉化為訓練訊號。你會利用聊天紀錄、日誌與回饋對基礎模型進行微調,然後透過獎勵模型將其對齊到特定產品目標。此一環節弭平了「能用的 MVP」與「真正可投入生產的 AI 系統」之間的鴻溝。
