Jack OmniXRI, 2026/07/15

大家還記得 2014 年 Amazon 推出智慧音箱 Echo 系列時,只要說一句「Hi Alexa」之後,就能接著以口語描述方式進行查詢、網購、訂位甚至控制家電等工作。這樣的操作方式令人感到神奇,從此開啟了智慧音箱百花齊放、電腦語音辨識的新人機介面世代。
不過這樣的操作方式一開始很令人感到困惑,為什麼電腦都已可以辨識完整句子,還要先說「Hi, Alexa」這樣的關鍵字(Keyword)呢?其中最主要的因素是為了省錢、省通訊流量及省推論計算時間。因為接收端通常是由一個幾塊美金的單晶片(MCU)構成,實在難以處理複雜的語音、語意辨識,若24小時每分每秒把接收到的語音資料往雲端伺服器送,那麼整個通訊頻寬及伺服器計算能力就會馬上被癱瘓掉,所以當接受到語音且是特定關鍵字後再將完整句子送到雲端進行分析就能免除超過99%的浪費。
為滿足上述「關鍵字偵測(Keyword Spotting, KWS)」需求,原則上只要使用 Arm Cortex-M4 以上等級 MCU 就足夠處理,當然使用 Arduino UNO Q [1] (以下簡稱 UNO Q)內建 Arm Cortex-A53 + Cortex-M33 更是可以輕鬆解決。本文就將帶著大家了解如何使用 UNO Q 來完成「關鍵字偵測」。




