搜尋

會員登入

搜尋

導覽

會員

異質運算與軟體生態並進 Arm以每瓦效能與CSS重構AI PC產業版圖

瀏覽次數:167

當前 AI PC 的浪潮正以前所未有的速度席捲個人電腦市場。隨著傳統單一 Wintel 路線的邊界逐漸模糊,PC 產業正加速走向多元化的架構分流。面對從輕薄長續航筆電到高階邊緣 AI 工作站的龐大需求,Arm 如何透過硬體 IP、運算子系統(CSS)與軟體生態系,在此波結構性變革中扮演核心驅動角色?


Arm 邊緣 AI 市場策略總監林哲仲,針對端雲混合架構、微軟 Copilot+ PC 規格大戰、軟體生態落地以及高階邊緣 AI 工作站等關鍵議題,深入解析 Arm 在邊緣運算與 PC 架構變革中的策略佈局。林哲仲認為,Arm 看待 AI PC 的視角並非盲目地將所有 AI 工作搬到本地端執行,而是落實混合式 AI 分工(Hybrid AI)。大型語言模型與巨量資料處理依然仰賴雲端,而涉及低延遲、個人隱私、背景助理與輕量推論的工作,則最適合在裝置端高效率執行。



圖一 :   Arm 邊緣 AI 市場策略總監林哲仲
圖一 : Arm 邊緣 AI 市場策略總監林哲仲

「對日常 AI 與代理程式而言,重點不只是瞬間的峰值算力,而是能否在長時間使用中維持低功耗與穩定的系統反應。」 林哲仲強調。


在裝置端,許多深受市場歡迎的 MacBooks、Chromebooks 及 Windows on Arm 筆電均展現了長續航與卓越散熱優勢。這主要歸功於 Arm 運算子系統(CSS)內建的可配置 C1 CPU 叢集,讓晶片設計夥伴能依據實際工作負載,在高效能核心(Performance cores)與高效率核心(Efficiency cores)之間做出更精細的分工,大幅降低模擬層運算的開銷。


而在雲端側,Arm 架構的每瓦效能(Performance-per-Watt)同樣在下探整體持有成本(TCO)。以 Google 近期發布的 Google Axion N4A 為例,早期測試顯示 N4A 與同級 x86 虛擬機器(VMs)相比,可提供最高 2 倍的性價比提升與 80% 的每瓦效能改善。在 AI 資料中心伺服器機櫃電力預算緊繃的當下,Arm 從雲端到終端的每瓦效能優勢,正全方位重塑運算成本。


突破 40 TOPS 迷思:異質整合與 CSS 打造 AI PC 加速器


微軟為 Copilot+ PC 設定了 40 TOPS NPU 的硬性門檻,迅速激化了市場競爭。然而,單靠 NPU 的算力數字就能決定 AI PC 的優劣嗎?


林哲仲表示,微軟 Copilot+ PC 開發者指南明確指出,Windows 11 會將任務智慧分派至最適切的 CPU、GPU 或 NPU 上。因此,真正的 AI PC 競爭,實質上在於異質運算的系統級整合,包含 CPU、GPU、NPU、記憶體架構與軟體堆疊的完美協同。


為了滿足 IC 設計廠與 OEM 夥伴對 AI PC 快速客製化的需求,Arm CSS 扮演了至關重要的角色。CSS 將運算、系統 IP、互連匯流排、安全機制與實體實作預先整合驗證。自 2023 年推出以來,已成功協助合作夥伴將首顆晶片產出時間縮短最高 12 個月,並節省數千萬美元等級的一次性工程費用,讓晶片商與 OEM 能夠在更短時間內推出涵蓋不同價位帶與功耗規格的主流 AI 筆電。


貫穿軟體底層:KleidiAI 與 AppReady 打通最後一哩路


「未來的 PC 競爭不再只是單純的硬體規格大賽,而是軟硬體的無縫整合。」林哲仲直言,Arm 目前在軟體層面正推動多項突破性進展,確保使用者在本地端與雲端模型切換時擁有流暢體驗。


在作業系統與應用層,Arm AppReady for Windows 正全力加速原生 Arm64 應用程式開發與移植,涵蓋依賴項、架構專用程式碼至測試調校,從根本改善反應速度與背景能耗。


而在 AI 框架層,Arm KleidiAI 則扮演了關鍵的橋樑角色。作為專為 AI 與電腦視覺最佳化的微架構函式庫,KleidiAI 已直接整合至 PyTorch ExecuTorch、Google LiteRT、Microsoft ONNX Runtime、MediaPipe、llama.cpp 及 Alibaba MNN 等主流 AI 框架。開發者無須重寫既有應用,即可自動呼叫 Arm Neon、SVE 與 SME2 的硬體加速能力。


這項軟體整合帶來了非常顯著的效能提升。在 Windows on Arm 平台上,KleidiAI 結合 ONNX Runtime 執行 Phi-3 語言模型時,提示處理(Prompt Processing)吞吐量提升達 2.4 倍,詞元生成(Token Generation)速度提升 12%;在 Android 平台上提示處理速度更大幅提升 2.6 倍。


此外,針對涉及檢索增強生成(RAG)、工具呼叫(Tool Calling)與長時間執行的代理程式,Arm 也推出了 Performix 效能分析工具,協助開發者精確釐清雲端瓶頸,精細調校端雲兩端的分工。



圖二 :   Arm的AI PC平台
圖二 : Arm的AI PC平台

搶進高階 AI 工作站:NVIDIA RTX Spark 展現 Arm CPU 系統調度強項


近期市場出現如 NVIDIA RTX Spark / DGX Spark 等整合高效能 Arm CPU 與 Blackwell GPU 的新平台,這預示著 PC 市場正在分化出全新的「本地高階 AI 工作站」層級。


這類系統搭載由 10 顆 Cortex-X925 與 10 顆 Cortex-A725 核心組成的 NVIDIA Grace CPU,並採用統一記憶體池(Unified Memory Pool),可在桌面端直接進行高達 200B(2000 億)參數規模的模型原型開發、微調與推論。


林哲仲分析,在高階代理式 AI(Agentic AI)系統中,CPU 不再只是輔助角色,而是負責系統調度、資料前/後處理、詞元化(Tokenization)、工具呼叫與記憶體存取的心臟。Arm 架構優異的效能密度與每瓦效能,確保了 GPU 能源源不絕地獲得算力供給,同時大幅降低 CPU 與 GPU 之間的資料搬移成本,為需要敏感資料控管與快速疊代研發的企業提供了雲端之外的最佳選擇。


架構多元化與運算分流的關鍵推手


總結當前 PC 產業的結構性轉變,林哲仲認為,Arm 的價值並非要單純取代傳統 x86 架構,而是推動 PC 市場走向多元化與細分化。


從極致輕薄、全天續航的主流 AI 筆電(如 Copilot+ PCs、MacBooks),到強大的邊緣 AI 工作站與後端的雲端資料中心,PC 產業正經歷一場從單一規格走向情境分工的重大轉型。Arm 透過完整的 IP 組合、CSS 運算子系統、KleidiAI 軟體生態與雲端平台優勢,正建構起貫穿「端到雲」的擴展性基礎,引領下一個十年的運算新局。


Card Image

PIC32-BZ6:新一代高度整合單晶片無線平臺

隨著智慧設備的射頻(RF)設計複雜性日益增加,傳統無線解決方案通常需要多晶片組合才能新增功能,或頻繁重新設計才能滿足不斷升級的行業標準。為此,Microchip推出全新高度整…

隨著智慧設備的射頻(RF)設計複雜性日益增加,傳統無線解決方案…