你收到一份 GEO 報告,封面寫著「你的品牌在 AI 回答中的出現率:18%」。裡面有漂亮的圖表、競品對比、趨勢線。但有一個問題那份報告通常不會回答你:那 18% 是用哪些問題問出來的?而那組問題,是誰、怎麼決定的?
這不是細節。決定那個數字的,往往不是你的品牌表現,是那組你從沒看到的問題。換一組問題,同一個品牌可能是 5%,也可能是 40%。
目次
- 一份 GEO 報告,最關鍵的東西藏在你看不到的地方
- 市面上的 prompt 多半這樣來:三種來源、三種偏誤
- 為什麼 prompt 集會決定結果
- 真實意圖怎麼對標(含 Google Suggest 等五個來源)
- 想像的 prompt vs 真實意圖對標:結果差在哪
- 怎麼判斷一份 GEO 報告可不可信:問對方這 5 個問題
- 三個常見誤區
- 常見問題 FAQ
一份 GEO 報告,最關鍵的東西藏在你看不到的地方
任何 GEO/AI 能見度報告的數字,本質都是同一個東西:
你的品牌在「某一組問題」的 AI 答案裡出現的比例。
那組問題,就是整份報告的地基。地基歪了,上面的圖表再精美都是歪的。多數報告把全部篇幅花在呈現結果(出現率、排名、趨勢),卻幾乎不揭露、也不檢討那組問題是怎麼來的。而那才是唯一真正決定數字的東西。
市面上的 prompt 多半這樣來:三種來源、三種偏誤
| prompt 來源 | 怎麼做 | 內建偏誤 |
|---|---|---|
| LLM 自動生成 | 餵品牌名/網址,讓 AI 生成「相關問題」 | 迴音室:AI 傾向生成你會贏的問題,數字虛胖 |
| 報告方主觀擬定 | 顧問憑經驗想幾個問題 | 偏向作者的認知與假設,未必是顧客真的會問的 |
| 直接拿 SEO 關鍵字 | 把搜尋關鍵字當 prompt | 人「打關鍵字」和「問 AI」的方式不同,少了口語、情境與追問 |
最常見、也最危險的是第一種。你用 AI 去生成「關於你的問題」,它會根據你的網站與自述,傾向生成那些你本來就表現好的問題——等於請對手出一份你會考高分的考卷。報告上的高分,量到的是你的舒適圈,不是真實的競爭場。
第三種看起來最嚴謹,其實也有破口。有人在 Google 打「植牙 費用」,但對 AI 他會說「我牙齒缺一顆,植牙跟做假牙哪個比較划算?大概要花多少?」——後者才是 AI 在回答、也才是你真正要被測的問法。
為什麼 prompt 集會決定結果
同一個品牌,問「最好的 X」「便宜的 X」「適合新手的 X」「老牌 vs 新銳的 X」,出現率會天差地遠。這不是雜訊,是結構:你選哪些問題、選哪些對手來比,會直接決定你量到什麼。 這也是上一篇講的測量建構性——測量的設計本身,會部分創造它聲稱要客觀觀察的那個現實。
所以「我們測了 200 個 prompt」這種話本身不代表嚴謹。如果那 200 個都偏向你的利基強項,再多也只是把同一個偏誤量了 200 次。
真實意圖怎麼對標(含 Google Suggest 等五個來源)
要讓報告反映真實,prompt 集必須錨定真實的人在搜尋與提問的意圖,而不是憑空想或讓 AI 生成。五個取得真實意圖的來源:
- Google 自動完成(Google Suggest):在搜尋框打入品類詞,看 Google 自動補完什麼。那是真實、高頻的搜尋意圖,常常是你想不到的模糊口語問法。這是最便宜、最快接觸真實意圖的入口。
- Google Search Console 實際 query:你的網站真的被哪些字搜到——這是你自己第一方、無法造假的需求資料。
- 關鍵字工具+相關搜尋/People Also Ask:補上搜尋量與長尾問句。
- 真實社群提問:Dcard、Threads、PTT、論壇裡,真人用什麼語氣問這個品類。AI 的訓練語料大量來自這些地方,這裡的問法最接近 AI 在處理的問法。
- 把上面對標成四層意圖,確保涵蓋整個漏斗,而不只測你會贏的那層:
| 層級 | 意圖 | 範例 |
|---|---|---|
| L1 廣泛品類 | 還沒有品牌概念 | 「推薦幾個[品類]」 |
| L2 功能比較 | 在比特性 | 「[品類]要看哪些功能」 |
| L3 在地/利基 | 縮小到情境 | 「台北適合[情境]的[品類]」 |
| L4 品牌對決 | 已在比品牌 | 「A 品牌 vs B 品牌」 |
對標完,把這組問題凍結並公開。凍結,才能跨期比較;公開,才能被檢驗。
想像的 prompt vs 真實意圖對標:結果差在哪
這是兩種做法最關鍵的分歧:
- 用想像/AI 生成的 prompt:你的數字通常偏高、也偏穩,因為你測到的是自己的舒適圈。報告很好看,但它讓你以為自己沒問題。
- 用真實意圖對標的 prompt:你往往會看到自己在 L1(廣泛、無品牌的問題)被略過得很嚴重——而那一層正是新客戶第一次接觸你的地方,是你真正的缺口與成長空間。
一句話總結:對標真實意圖的報告數字,通常比較難看,但它是真的。一份讓你很滿意的 GEO 報告,反而最該懷疑它的 prompt 是不是出自你的舒適圈。
怎麼判斷一份 GEO 報告可不可信:問對方這 5 個問題
下次有人給你 GEO/AI 能見度報告,把這五個問題丟回去:
- 這份報告用了哪些 prompt?我能完整看到那份清單嗎?
- 這些 prompt 怎麼來的——有對標真實搜尋與提問意圖嗎,還是 AI 生成或憑經驗擬的?
- 涵蓋整個漏斗嗎(從無品牌的廣泛問題,到品牌對決),還是只測我的利基強項?
- 每個 prompt 測了幾次?有沒有記錄模型版本與測量條件?
- 同一套方法、固定條件下,能不能跨期重複,給我一條可比較的趨勢?
五題都答得清楚的報告,值得信。答不出來、或顧左右而言他的,那個數字僅供參考。
三個常見誤區
誤區一:數字越高越好。 太好看的數字,常常是測了你的舒適圈。真正有用的報告會讓你看到難看但真實的缺口。
誤區二:prompt 越多越準。 沒對標真實意圖的話,再多 prompt 也只是把同一個偏誤重複量。質(有沒有對標真實意圖、有沒有涵蓋漏斗)比量重要。
誤區三:把搜尋關鍵字直接當 prompt。 人打關鍵字和問 AI 的方式不同。用 Google Suggest、社群真實提問補上口語與情境問法,才接近 AI 實際在處理的問題。
結論
GEO 報告的價值,全押在一個你通常看不到的東西上:它怎麼生 prompt。一份用 AI 生成或憑空想的 prompt 跑出來的漂亮數字,量到的是想像;一份用真實意圖對標、凍結、公開的 prompt 跑出來的數字,雖然常常難看,量到的是現實。
這也是 GEO is cool 的做法:我們用 Google Suggest、第一方 query 與真實社群提問對標 prompt 集,凍結它、公開它,寧可給你比較難看但真實的數字。因為一個會說謊的感測器,比沒有感測器更危險。
想了解一個指標怎麼從「方向感」變成「可信趨勢」,可以回頭看 模型聲量監測的方法論。
—— Vanessa | GEO is cool
常見問題 FAQ
Q:GEO 報告的數字為什麼不能直接信? 因為數字完全取決於它用哪組問題問 AI,而那組問題(prompt 集)多半沒被揭露、也未必對標真實意圖。換一組問題,數字就不同。
Q:怎麼知道報告的 prompt 有沒有對標真實意圖? 直接問報告方:prompt 清單能不能完整看到、怎麼來的、有沒有涵蓋從廣泛到品牌對決的整個漏斗。
Q:Google Suggest 怎麼幫我找真實 prompt? 在搜尋框打品類詞,看自動補完出現什麼——那是真實高頻的搜尋意圖,常含你想不到的口語問法,可直接轉成測量用的問題。
Q:prompt 越多越準嗎? 不一定。沒對標真實意圖、沒涵蓋整個漏斗的話,再多 prompt 也只是重複同一個偏誤。質比量重要。