📚 知識家圖書館 奇摩知識+ 紀念館

長最快的地方,最沒人想回答

上一篇算出知識+ 的提問結構從「生活疑難」移向「消費決策」,但沒回答一個問題:那又如何? 這一篇是答案。那些成長最快的分類,正是最沒人想回答的分類——問答平台的供給端先垮了。

資料範圍 2021 年 1–4 月 · 樣本 8,121 題 · 涵蓋全部 41 個母分類 · 承接上一篇

你的問題有沒有人理,取決於你問什麼

知識+ 關站前的最後四個月,整體有 43% 的提問從發出到關站都沒有收到任何一則回答。 但這個平均值掩蓋了巨大的落差:

最沒人理 汽車與交通
73%
四題有三題石沉大海(n=392)
最多人回 消費電子產品
19%
五題有四題等到回答(n=109)
2021 年 1–4 月,各分類的無人回答率 僅列入樣本 100 題以上的分類。標示為藍色者,是上一篇中佔比上升的分類。
佔比上升的分類 佔比下降的分類
分母為該分類全部提問,分子為到關站為止未收到任何回答者

成長與冷落,是同一件事

把上一篇的「佔比變化」與這一篇的「無人回答率」放在一起,兩者明顯同向移動。 等級相關係數 rho = 0.64(n=15)。

這裡刻意不附 p 值。這 15 個分類是「兩期都有充分樣本」的全部分類, 不是從某個母體抽出的隨機樣本,對母體做顯著性檢定在方法上說不通。 rho = 0.64 是對這批資料的描述,不是對「所有問答平台」的推論。

佔比變化 × 無人回答率 橫軸為 2005–06 到 2021 的佔比變化(百分點),縱軸為 2021 年的無人回答率。 右上角=越長越大、越沒人回答。
佔比上升 佔比下降
Spearman rho = 0.64,Pearson r = 0.67,n = 15 個分類

四個成長最多的分類——商業與財經、美容與造型、汽車與交通、遊戲與休閒活動—— 無人回答率分別是 64%、49%、73%、63%。而萎縮最多的健康與社會與文化,分別只有 31% 與 29%。

這些成長的主題有個共同點:答案牽涉到花錢。貸款方案、車子怎麼修、遊戲要不要課金、 哪家醫美比較好。這類問題對業者有商業價值,對一般使用者卻沒有回答的動機—— 你不會為了陌生人比較三家車廠的保固條款而花二十分鐘打字。

對照第一篇的另一個發現:清洗這批資料時,光是含聯絡方式的推銷回答就濾掉了 530 則。 也就是說,這些分類不是完全沒有回答,而是剩下的回答有相當比例來自業者

平台是這樣死的

問答網站靠一個不對稱的交換活著:提問只要三十秒,回答卻要花二十分鐘,而且沒有報酬。 維持這個交換的是社群感——有人願意為了「知道答案」這件事本身花時間。

當提問結構往商業主題傾斜,這個交換就斷了。想問的人還在,願意答的人不在了。 2021 年那 43% 的沉默,不是使用者離開的結果,而是離開的過程本身—— 每一個沒有得到回答的人,都少了一個再回來的理由。

方法與限制

  • 為什麼只用 2021 年:這是本資料集中唯一涵蓋全部 41 個母分類的時期, 且來自同一次爬取、同一套抽樣機制,分類之間可以直接比較。 其餘年份僅涵蓋 20–23 個分類,跨年比較會得到假結論(詳見上一篇)。
  • 右設限已檢驗:爬蟲在 2021 年 4 月執行,較晚發問的題目觀察期較短。 只保留「發問後至少被觀察 30 天」的 5,168 題重算,前三名排序不變 (汽車與交通 76%、商業與財經 65%、遊戲與休閒活動 64%)。 唯一明顯移動的是娛樂與音樂(50% → 38%),該分類的數值請保守看待。
  • 相關不等於因果:rho = 0.64 說明兩者同向,不能推論是成長「造成」冷落。 更可能的解釋是兩者共有一個原因——商業意圖高的主題同時吸引業者提問、也天然缺乏義務回答者。
  • 一個我無法檢驗的問題:這些分類是否一直都沒人回答, 還是到末期才變成這樣?答不了。舊年代的資料看不到無人回答的題目—— 2005–2010 的無人回答率算出來是 0%,這在真實平台上不可能, 證明爬蟲循分類串流探索舊題時,冷門題根本不會被發現。

附記:一篇沒能寫成的文章

這一篇原本要寫的是另一個題目。初步統計顯示首答等待時間逐年拉長—— 2005–2010 的中位數是 0.6 小時,到 2021 年變成 3.8 小時。 「全盛期問完四十分鐘就有人回,關站前要等快四小時」,是個很好用的說法。

它是錯的。

首答延遲是「所有回答時間的最小值」,而回答數越多,最小值自然越早。 各年代的回答數組成差很多:2005–2010 的題目回答數中位數是 2,只有 26% 的題目僅得一則回答; 到 2021 年中位數降為 1,65% 的題目只有一則。 所以那個「趨勢」大部分是在比較「三次抽樣的最小值」與「一次抽樣的最小值」。

控制回答數之後——只看恰好得到一則回答的題目——趨勢就消失了:

年代未分層中位數僅 1 則回答者回答數中位數僅 1 則回答佔比
2005–2010 0.6h 3.9h 2 26%
2011–2015 1.7h 8.1h 3 27%
2016–2020 1.8h 1.8h 1 65%
2021 3.8h 6.5h 1 65%

分層後的數列是 3.9 → 8.1 → 1.8 → 6.5,不是遞增,是雜訊。 而 2005–2010 的中位數從 0.6 小時跳到 3.9 小時——混淆效果比訊號本身還大。

寫出來會很好看,而且大概沒有人會去查。但它不成立,所以它在這裡,不在標題上。