【GEO 實驗 01】同一個問題問 AI 十次,推薦的品牌會一樣嗎?

同一個問題問 AI 十次,推薦的品牌會一樣嗎?我們用 Perplexity 重複問、記錄 600 筆繁中回答的實測,量出 AI 推薦的穩定度:開放題十次有九次清單會變,指名題幾乎固定。

你大概看過這種畫面:有人截一張 ChatGPT 或 Perplexity 的圖,說「你看,AI 都推薦這個品牌」。但只問一次的截圖,到底算不算數?如果再問一次,答案會不會就變了?

這是我們繁體中文 GEO(生成引擎優化)系列實驗的第一題。在研究「哪些做法能讓品牌更常被 AI 提到」之前,得先確認一件更基本的事:AI 的答案到底穩不穩定?要問幾次,才知道它「真正」推薦誰?

重點結果

項目結果
樣本Perplexity AI 搜尋,10 個繁中查詢 × 每題 60 次 = 600 筆回答
開放推薦題連續兩次拿到完全相同品牌清單的機率僅 8.5%
指名對決題兩次相同的機率高達 88%
「誰是前段班」幾乎問第一次就定了
「精準排名」最久要問到第 58 次才穩
品類必提名單Dreame、Roborock 在開放題接近 100%

一句話:想知道「誰在前段班」問一兩次就夠;想精準到「排名」或「出現幾成」,得問到幾十次。 這也是為什麼嚴謹的 AI 聲量監測不能靠一張截圖

實驗設計摘要

假設:單看一次 AI 回答並不可靠;品牌的出現頻率要重複問很多次,才會穩定下來。

為什麼先驗這題:後面所有實驗,測的都是「某個做法讓品牌出現的頻率上升了多少」。如果 AI 單次的答案本身就上下亂跳,那再漂亮的提升都可能只是隨機雜訊。所以第一步不是優化,是校準量尺——先搞清楚雜訊有多大。

方法:為了讓結果可信、不是事後挑數據,在跑之前就把所有設定寫死並公開(這叫預先登記,原始數據之後也會公開供檢驗)。流程是——用 Perplexity 的 AI 搜尋,每個問題重複問 60 次、記錄全部回答,再用事先定好的公式算出每個品牌的出現頻率與穩定度。總共記錄了 600 次回答。

選的主題:掃地機器人。品類品牌清楚可列舉、比較需求強、規格是事實,最適合當測量練兵的對象。追蹤 12 個主流品牌。

提問設計:10 個真實的繁中查詢,來源是 Google 自動完成、「其他人也問」,以及 Dcard/PTT/Mobile01 上的真實提問語氣(2026-06-24 擷取)。定稿後凍結、不增刪,並依意圖從廣泛到指名分成 L1–L4 四層——這個跨度本身就是觀察重點:

ID意圖層Prompt
P01L1 廣泛掃地機器人推薦
P02L1 廣泛2026 掃地機器人推薦 ptt
P03L1 廣泛掃地機器人哪個牌子好
P04L2 條件掃拖一體掃地機器人推薦
P05L2 條件養寵物適合的掃地機器人推薦
P06L2 條件自動倒垃圾的掃地機器人推薦
P07L3 利基預算一萬以內 掃地機器人推薦
P08L3 利基小坪數套房 掃地機器人推薦
P09L4 指名Roborock 石頭掃地機器人好用嗎
P10L4 指名Ecovacs 和 Roborock 哪個好

為什麼強調「需求錨定」與「凍結」?因為若讓 AI 自己生成要測的問題,它會偏向品牌的強項、把數字灌虛;用真實搜尋語氣、定稿後凍結,量到的才是真實的競爭場。

接著把 600 次回答攤開看品牌清單怎麼變化,結果有三件事值得講。

發現一:單次到底多不可靠?要看題型

先回答最初的問題:單次截圖可靠嗎?不可靠,但程度差很多,要看你問的是哪種問題。

題型例子(實測 prompt)連續兩次「清單完全相同」的機率
開放推薦(L3)P07「預算一萬以內 掃地機器人推薦」8.5%(十次有九次會變)
指名對決(L4)P10「Ecovacs 和 Roborock 哪個好」88%(問題本身把答案框死了)

所以「AI 答案不穩」這句話太籠統。真相是:你問得越開放,答案越會跳;越指名,越固定。

發現二:「穩定」有三種

那「要問幾次才穩」?我們發現「穩定」可以拆成三層,答案天差地遠:

你想知道的要問幾次才穩說明
誰是前段班(哪幾個品牌)1–2 次十題裡有九題,第 1 次回答就能看出穩定的前五名。AI 對「主流品牌是誰」非常有共識。
第幾名(排序)數十次(最久第 58 次)當幾個品牌頻率接近(都在九成上下),名次會一直互換。
每次的完整清單開放題永遠不一樣這不是壞事,是 AI 的本質,所以才要用「頻率」而非「單次」衡量。

一句話總結:想知道「誰在前段班」,問一兩次就夠;想精準到「排名」或「出現幾成」,得問到幾十次。 這正是 模型聲量要用「重複量、看頻率」而不是單次快照的原因。

發現三:繁中的「AI 必提名單」,以及換個問法就洗牌

這次實測也順手量到兩個對品牌很有用的事實。

繁中掃地機器人的「AI 必提名單」:Dreame 和 Roborock 在幾乎每個開放推薦題都接近 100% 出現,是穩坐的第一梯隊;Dyson、Narwal、LG 這些則在長尾忽隱忽現。

換個問法,名單就洗牌。 同一個品類,問法不同,AI 提到的品牌完全不一樣:

問法(實測 prompt)衝上前段的品牌出現率對照
P07「預算一萬以內 掃地機器人推薦」Xiaomi90%常勝軍 Roborock 掉到 37%
P05「養寵物適合的掃地機器人推薦」Narwal75%平常排不進前段
P04「掃拖一體掃地機器人推薦」iRobot98%

這代表一件事:你的品牌不是要擠進「掃地機器人」這個籠統的 AI 答案,而是要擠進「對的問法」的答案。 顧客問 AI 的方式,決定了誰會被推薦。

什麼叫「對的問法」?

「對的問法」指的是你的目標客戶真正會打進去的那句話——通常帶著具體意圖,而不是籠統的品類名。同樣想買掃地機器人,不同人會這樣問,而 AI 給的名單完全不同:

意圖層例(實測 prompt)AI 給的名單
L1 籠統P01「掃地機器人推薦」、P03「掃地機器人哪個牌子好」回到主流大牌,Dreame、Roborock 這種第一梯隊幾乎一定上榜
L2 條件(功能/場景)P04「掃拖一體」、P05「養寵物適合的」對上情境的品牌冒頭:iRobot 98%、Narwal 75%
L3 利基P07「預算一萬以內」、P08「小坪數套房」Xiaomi 衝到第一(90%),Roborock 掉到 37%

關鍵就在這:籠統問法被主流大牌壟斷、最難擠;但帶意圖的問法是分眾的,只要你的產品剛好對上那個意圖,就有機會被 AI 推到最前面,哪怕你在籠統榜上排不進去。

所以對品牌的實際做法是:先盤點你真正打得贏的意圖——你最強的場景、功能或價格帶是什麼?然後找出客戶會用來表達那個意圖的句子(就像上表那些 prompt),針對這幾個「對的問法」把內容寫到位,讓 AI 在那些問題上優先想到你。與其在「掃地機器人推薦」這種紅海硬拚,不如在「養寵物的小坪數套房適合哪台掃地機器人」這種精準問法上稱王。

品牌的四個行動原則

把上面的發現換成可以馬上用的做法:

  1. 別拿單次截圖當證據。 不論是證明自己被推薦、還是判斷對手聲量,一次都不算數——開放問題十次有九次會變。
  2. 要監測,就重複量、看頻率。 「被提到幾成」才是訊號,「這次有沒有被提到」是雜訊。
  3. 先搞清楚你品類的必提名單。 你在不在第一梯隊?差距多大?這是經營 AI 認知的起點。
  4. 針對「問法」經營,而不是籠統品類。 找出目標客戶真正會問 AI 的句子(尤其帶意圖的:預算、場景、功能),讓內容對得上那些問法。

範圍與限制

本次只測了 Perplexity 一個引擎、掃地機器人一個品類、一個時間點,數字會隨模型更新而變。它證明的是「方法成立、雜訊量得出來」,不是「所有品類都長這樣」。

—— Vanessa | GEO is cool

延伸閱讀:

模型聲量:AI 時代品牌唯一的北極星指標

不要只測一次:模型聲量監測的方法論

常見問題

Q:問 AI 幾次,推薦結果才算準?
看你要的精度。想知道「哪幾個品牌是前段班」,問一兩次就夠;想精準到「排名」或「出現幾成」,開放型問題要重複問到數十次,本實驗最久的一題到第 58 次才穩定。

Q:AI 每次的推薦都一樣嗎?
開放型推薦問題幾乎每次都會變——連續兩次拿到完全相同品牌清單的機率只有 8.5%。但指名對決型問題很固定,兩次相同的機率高達 88%。

Q:掃地機器人,AI 最常推薦哪個牌子?
在繁體中文的開放推薦題裡,Dreame 和 Roborock 接近 100% 出現,是第一梯隊;但換成「預算一萬以內」Xiaomi 會衝到第一、「養寵物」Narwal 會冒出來。

Q:為什麼換個問法,AI 推薦的品牌就不一樣?
因為 AI 是針對「那個問法的意圖」回答。帶條件的問法(預算、場景、功能)會讓符合該情境的品牌跳到前面,籠統問法則回到主流品牌。

Q:一張 ChatGPT/Perplexity 截圖能當作品牌被推薦的證據嗎?
不能。單次截圖對開放型問題幾乎沒有代表性。要當證據,必須在固定條件下重複量測、看頻率與趨勢。

發佈留言