你大概看過這種畫面:有人截一張 ChatGPT 或 Perplexity 的圖,說「你看,AI 都推薦這個品牌」。但只問一次的截圖,到底算不算數?如果再問一次,答案會不會就變了?
這是我們繁體中文 GEO(生成引擎優化)系列實驗的第一題。在研究「哪些做法能讓品牌更常被 AI 提到」之前,得先確認一件更基本的事:AI 的答案到底穩不穩定?要問幾次,才知道它「真正」推薦誰?
重點結果
| 項目 | 結果 |
|---|---|
| 樣本 | Perplexity AI 搜尋,10 個繁中查詢 × 每題 60 次 = 600 筆回答 |
| 開放推薦題 | 連續兩次拿到完全相同品牌清單的機率僅 8.5% |
| 指名對決題 | 兩次相同的機率高達 88% |
| 「誰是前段班」 | 幾乎問第一次就定了 |
| 「精準排名」 | 最久要問到第 58 次才穩 |
| 品類必提名單 | Dreame、Roborock 在開放題接近 100% |
一句話:想知道「誰在前段班」問一兩次就夠;想精準到「排名」或「出現幾成」,得問到幾十次。 這也是為什麼嚴謹的 AI 聲量監測不能靠一張截圖。
實驗設計摘要
假設:單看一次 AI 回答並不可靠;品牌的出現頻率要重複問很多次,才會穩定下來。
為什麼先驗這題:後面所有實驗,測的都是「某個做法讓品牌出現的頻率上升了多少」。如果 AI 單次的答案本身就上下亂跳,那再漂亮的提升都可能只是隨機雜訊。所以第一步不是優化,是校準量尺——先搞清楚雜訊有多大。
方法:為了讓結果可信、不是事後挑數據,在跑之前就把所有設定寫死並公開(這叫預先登記,原始數據之後也會公開供檢驗)。流程是——用 Perplexity 的 AI 搜尋,每個問題重複問 60 次、記錄全部回答,再用事先定好的公式算出每個品牌的出現頻率與穩定度。總共記錄了 600 次回答。
選的主題:掃地機器人。品類品牌清楚可列舉、比較需求強、規格是事實,最適合當測量練兵的對象。追蹤 12 個主流品牌。
提問設計:10 個真實的繁中查詢,來源是 Google 自動完成、「其他人也問」,以及 Dcard/PTT/Mobile01 上的真實提問語氣(2026-06-24 擷取)。定稿後凍結、不增刪,並依意圖從廣泛到指名分成 L1–L4 四層——這個跨度本身就是觀察重點:
| ID | 意圖層 | Prompt |
|---|---|---|
| P01 | L1 廣泛 | 掃地機器人推薦 |
| P02 | L1 廣泛 | 2026 掃地機器人推薦 ptt |
| P03 | L1 廣泛 | 掃地機器人哪個牌子好 |
| P04 | L2 條件 | 掃拖一體掃地機器人推薦 |
| P05 | L2 條件 | 養寵物適合的掃地機器人推薦 |
| P06 | L2 條件 | 自動倒垃圾的掃地機器人推薦 |
| P07 | L3 利基 | 預算一萬以內 掃地機器人推薦 |
| P08 | L3 利基 | 小坪數套房 掃地機器人推薦 |
| P09 | L4 指名 | Roborock 石頭掃地機器人好用嗎 |
| P10 | L4 指名 | Ecovacs 和 Roborock 哪個好 |
為什麼強調「需求錨定」與「凍結」?因為若讓 AI 自己生成要測的問題,它會偏向品牌的強項、把數字灌虛;用真實搜尋語氣、定稿後凍結,量到的才是真實的競爭場。
接著把 600 次回答攤開看品牌清單怎麼變化,結果有三件事值得講。
發現一:單次到底多不可靠?要看題型
先回答最初的問題:單次截圖可靠嗎?不可靠,但程度差很多,要看你問的是哪種問題。
| 題型 | 例子(實測 prompt) | 連續兩次「清單完全相同」的機率 |
|---|---|---|
| 開放推薦(L3) | P07「預算一萬以內 掃地機器人推薦」 | 8.5%(十次有九次會變) |
| 指名對決(L4) | P10「Ecovacs 和 Roborock 哪個好」 | 88%(問題本身把答案框死了) |
所以「AI 答案不穩」這句話太籠統。真相是:你問得越開放,答案越會跳;越指名,越固定。
發現二:「穩定」有三種
那「要問幾次才穩」?我們發現「穩定」可以拆成三層,答案天差地遠:
| 你想知道的 | 要問幾次才穩 | 說明 |
|---|---|---|
| 誰是前段班(哪幾個品牌) | 1–2 次 | 十題裡有九題,第 1 次回答就能看出穩定的前五名。AI 對「主流品牌是誰」非常有共識。 |
| 第幾名(排序) | 數十次(最久第 58 次) | 當幾個品牌頻率接近(都在九成上下),名次會一直互換。 |
| 每次的完整清單 | 開放題永遠不一樣 | 這不是壞事,是 AI 的本質,所以才要用「頻率」而非「單次」衡量。 |
一句話總結:想知道「誰在前段班」,問一兩次就夠;想精準到「排名」或「出現幾成」,得問到幾十次。 這正是 模型聲量要用「重複量、看頻率」而不是單次快照的原因。
發現三:繁中的「AI 必提名單」,以及換個問法就洗牌
這次實測也順手量到兩個對品牌很有用的事實。
繁中掃地機器人的「AI 必提名單」:Dreame 和 Roborock 在幾乎每個開放推薦題都接近 100% 出現,是穩坐的第一梯隊;Dyson、Narwal、LG 這些則在長尾忽隱忽現。
換個問法,名單就洗牌。 同一個品類,問法不同,AI 提到的品牌完全不一樣:
| 問法(實測 prompt) | 衝上前段的品牌 | 出現率 | 對照 |
|---|---|---|---|
| P07「預算一萬以內 掃地機器人推薦」 | Xiaomi | 90% | 常勝軍 Roborock 掉到 37% |
| P05「養寵物適合的掃地機器人推薦」 | Narwal | 75% | 平常排不進前段 |
| P04「掃拖一體掃地機器人推薦」 | iRobot | 98% | — |
這代表一件事:你的品牌不是要擠進「掃地機器人」這個籠統的 AI 答案,而是要擠進「對的問法」的答案。 顧客問 AI 的方式,決定了誰會被推薦。
什麼叫「對的問法」?
「對的問法」指的是你的目標客戶真正會打進去的那句話——通常帶著具體意圖,而不是籠統的品類名。同樣想買掃地機器人,不同人會這樣問,而 AI 給的名單完全不同:
| 意圖層 | 例(實測 prompt) | AI 給的名單 |
|---|---|---|
| L1 籠統 | P01「掃地機器人推薦」、P03「掃地機器人哪個牌子好」 | 回到主流大牌,Dreame、Roborock 這種第一梯隊幾乎一定上榜 |
| L2 條件(功能/場景) | P04「掃拖一體」、P05「養寵物適合的」 | 對上情境的品牌冒頭:iRobot 98%、Narwal 75% |
| L3 利基 | P07「預算一萬以內」、P08「小坪數套房」 | Xiaomi 衝到第一(90%),Roborock 掉到 37% |
關鍵就在這:籠統問法被主流大牌壟斷、最難擠;但帶意圖的問法是分眾的,只要你的產品剛好對上那個意圖,就有機會被 AI 推到最前面,哪怕你在籠統榜上排不進去。
所以對品牌的實際做法是:先盤點你真正打得贏的意圖——你最強的場景、功能或價格帶是什麼?然後找出客戶會用來表達那個意圖的句子(就像上表那些 prompt),針對這幾個「對的問法」把內容寫到位,讓 AI 在那些問題上優先想到你。與其在「掃地機器人推薦」這種紅海硬拚,不如在「養寵物的小坪數套房適合哪台掃地機器人」這種精準問法上稱王。
品牌的四個行動原則
把上面的發現換成可以馬上用的做法:
- 別拿單次截圖當證據。 不論是證明自己被推薦、還是判斷對手聲量,一次都不算數——開放問題十次有九次會變。
- 要監測,就重複量、看頻率。 「被提到幾成」才是訊號,「這次有沒有被提到」是雜訊。
- 先搞清楚你品類的必提名單。 你在不在第一梯隊?差距多大?這是經營 AI 認知的起點。
- 針對「問法」經營,而不是籠統品類。 找出目標客戶真正會問 AI 的句子(尤其帶意圖的:預算、場景、功能),讓內容對得上那些問法。
範圍與限制
本次只測了 Perplexity 一個引擎、掃地機器人一個品類、一個時間點,數字會隨模型更新而變。它證明的是「方法成立、雜訊量得出來」,不是「所有品類都長這樣」。
—— Vanessa | GEO is cool
延伸閱讀:
常見問題
Q:問 AI 幾次,推薦結果才算準?
看你要的精度。想知道「哪幾個品牌是前段班」,問一兩次就夠;想精準到「排名」或「出現幾成」,開放型問題要重複問到數十次,本實驗最久的一題到第 58 次才穩定。
Q:AI 每次的推薦都一樣嗎?
開放型推薦問題幾乎每次都會變——連續兩次拿到完全相同品牌清單的機率只有 8.5%。但指名對決型問題很固定,兩次相同的機率高達 88%。
Q:掃地機器人,AI 最常推薦哪個牌子?
在繁體中文的開放推薦題裡,Dreame 和 Roborock 接近 100% 出現,是第一梯隊;但換成「預算一萬以內」Xiaomi 會衝到第一、「養寵物」Narwal 會冒出來。
Q:為什麼換個問法,AI 推薦的品牌就不一樣?
因為 AI 是針對「那個問法的意圖」回答。帶條件的問法(預算、場景、功能)會讓符合該情境的品牌跳到前面,籠統問法則回到主流品牌。
Q:一張 ChatGPT/Perplexity 截圖能當作品牌被推薦的證據嗎?
不能。單次截圖對開放型問題幾乎沒有代表性。要當證據,必須在固定條件下重複量測、看頻率與趨勢。