
作者:Jack OmniXRI, 2023/07/17
在電影「食神」中,唐牛和史蒂芬周同時選了佛跳牆來爭奪食神地位,結果唐牛抗議對方抄襲動作,結果裁判說:「比賽就是這樣的!好像跑步游泳一樣,還不是你做什麼他就做什麼!有什麼好抗議的?抗議無效!」。同樣地,在AI晶片或神經加速處理器(Neural Network Processing Unit, NPU或Deep Learning Accelerator, DLA)領域中,大家也都說自家的晶片世界最棒,對手看不到車尾燈,難道沒有一個較為公正衡量晶片運行(推論)效能,就像手機跑分軟體一樣,讓大家比較信服的基準嗎?
其實在AI晶片領域中所謂的「效能」,可能因關心的重點不同而會有不同定義和解讀。分別可從硬體每秒可執行乘加的次數(又可細分FP32,FP16及INT8等)、對於特定模型在指定推論精度下每秒可執行次數或推論一次所需時間(包含有無模型優化處理)、特定模型推論功耗(推論一次耗費焦耳數)、每瓦特可執行乘加指令次數及其它特定規範時的表現,甚至有用每塊美金獲得算力來當成基準。所以常會遇到誰也不服誰,老王賣瓜自賣自誇的現象。
目前較被大家接受的就是ML Commons[1]所提出的MLPerf規範,其中包含訓練及推論兩大項,而推論部份又可細分為資料中心(Datacenter)、邊緣(Edge)、行動(Mobile)及微型(Tiny,大多為MCU)。前不久(2023/6/27)才剛公佈了Tiny v1.1測試結果報告[2],其中也包括了台灣新唐科技(Nuvoton)及臺灣發展軟體科技(Skymizer)提交的亮眼成果。接下來就幫大家解讀一下這份報告,讓大家能更了解未來單晶片運行AI的方向及可行性。





作者:Jack OmniXRI, 2023/5/3
說到小型電腦主機,大家大概第一個就會想到樹莓派吧?如信用卡般尺寸加上完整的週邊及充足的開源開發資源,讓開發者們愛不釋手。幾年前人工智慧(AI)開始興起時,大家也是馬上拿來應用於小型語音及視覺應用。不過沒多久大家就發現要運行深度學習模型所需的算力遠遠高出樹莓派CPU (Arm Cortex-A53/72 x4 Core@1.2~1.8GHz) 所能提供的。於是又有了像Intel神經計算棒(Neural Compute Stick)這類AI加速計算的外掛裝置出現,但其算力還是只能應付小尺寸(640x480像素以下)影像或要求檢測速度不高(每秒1~3張)的場景。對於實際場域高效電腦視覺應用(如物件偵測、影像分割等),一般就得配置一台大型桌機加上Nvidia GPU顯卡才能達成AI推論需求。好在隨著半導體技術的突飛猛進,兼具高效計算及迷你尺寸的主機已不再是遙不可及。其中Intel和許多廠商合作推出的NUC (Next Unit of Computing) 系列產品[1]從入門款(Celeron N4505 CPU + UHD 16EU GPU)到高階款(Core i7 13Gen CPU + Iris 96EU GPU)一應俱全,讓開發者在性能及價格選用上有了更大的彈性空間。
為了更進一步了解這類迷你主機在AI推論效能的表現,此次選用了東擎(ASRock Industrial) NUC BOX-1260P作為主要實測硬體(以下簡稱測試機),AI推論部份則選用OpenVINO 2022.3版作為基礎工具。而測試項目則使用OpenVINO Notebooks中最新的物件偵測「Convert and Optimize YOLOv8 with OpenVINO」範例作為實測效能的分析。以下就開始展開逐一說明。