長最快的地方,最沒人想回答
上一篇算出知識+ 的提問結構從「生活疑難」移向「消費決策」,但沒回答一個問題:那又如何? 這一篇是答案。那些成長最快的分類,正是最沒人想回答的分類——問答平台的供給端先垮了。
你的問題有沒有人理,取決於你問什麼
知識+ 關站前的最後四個月,整體有 43% 的提問從發出到關站都沒有收到任何一則回答。 但這個平均值掩蓋了巨大的落差:
成長與冷落,是同一件事
把上一篇的「佔比變化」與這一篇的「無人回答率」放在一起,兩者明顯同向移動。 等級相關係數 rho = 0.64(n=15)。
四個成長最多的分類——商業與財經、美容與造型、汽車與交通、遊戲與休閒活動—— 無人回答率分別是 64%、49%、73%、63%。而萎縮最多的健康與社會與文化,分別只有 31% 與 29%。
這些成長的主題有個共同點:答案牽涉到花錢。貸款方案、車子怎麼修、遊戲要不要課金、 哪家醫美比較好。這類問題對業者有商業價值,對一般使用者卻沒有回答的動機—— 你不會為了陌生人比較三家車廠的保固條款而花二十分鐘打字。
對照第一篇的另一個發現:清洗這批資料時,光是含聯絡方式的推銷回答就濾掉了 530 則。 也就是說,這些分類不是完全沒有回答,而是剩下的回答有相當比例來自業者。
平台是這樣死的
問答網站靠一個不對稱的交換活著:提問只要三十秒,回答卻要花二十分鐘,而且沒有報酬。 維持這個交換的是社群感——有人願意為了「知道答案」這件事本身花時間。
當提問結構往商業主題傾斜,這個交換就斷了。想問的人還在,願意答的人不在了。 2021 年那 43% 的沉默,不是使用者離開的結果,而是離開的過程本身—— 每一個沒有得到回答的人,都少了一個再回來的理由。
方法與限制
- 為什麼只用 2021 年:這是本資料集中唯一涵蓋全部 41 個母分類的時期, 且來自同一次爬取、同一套抽樣機制,分類之間可以直接比較。 其餘年份僅涵蓋 20–23 個分類,跨年比較會得到假結論(詳見上一篇)。
- 右設限已檢驗:爬蟲在 2021 年 4 月執行,較晚發問的題目觀察期較短。 只保留「發問後至少被觀察 30 天」的 5,168 題重算,前三名排序不變 (汽車與交通 76%、商業與財經 65%、遊戲與休閒活動 64%)。 唯一明顯移動的是娛樂與音樂(50% → 38%),該分類的數值請保守看待。
- 相關不等於因果:rho = 0.64 說明兩者同向,不能推論是成長「造成」冷落。 更可能的解釋是兩者共有一個原因——商業意圖高的主題同時吸引業者提問、也天然缺乏義務回答者。
- 一個我無法檢驗的問題:這些分類是否一直都沒人回答, 還是到末期才變成這樣?答不了。舊年代的資料看不到無人回答的題目—— 2005–2010 的無人回答率算出來是 0%,這在真實平台上不可能, 證明爬蟲循分類串流探索舊題時,冷門題根本不會被發現。
附記:一篇沒能寫成的文章
這一篇原本要寫的是另一個題目。初步統計顯示首答等待時間逐年拉長—— 2005–2010 的中位數是 0.6 小時,到 2021 年變成 3.8 小時。 「全盛期問完四十分鐘就有人回,關站前要等快四小時」,是個很好用的說法。
它是錯的。
首答延遲是「所有回答時間的最小值」,而回答數越多,最小值自然越早。 各年代的回答數組成差很多:2005–2010 的題目回答數中位數是 2,只有 26% 的題目僅得一則回答; 到 2021 年中位數降為 1,65% 的題目只有一則。 所以那個「趨勢」大部分是在比較「三次抽樣的最小值」與「一次抽樣的最小值」。
控制回答數之後——只看恰好得到一則回答的題目——趨勢就消失了:
| 年代 | 未分層中位數 | 僅 1 則回答者 | 回答數中位數 | 僅 1 則回答佔比 |
|---|---|---|---|---|
| 2005–2010 | 0.6h | 3.9h | 2 | 26% |
| 2011–2015 | 1.7h | 8.1h | 3 | 27% |
| 2016–2020 | 1.8h | 1.8h | 1 | 65% |
| 2021 | 3.8h | 6.5h | 1 | 65% |
分層後的數列是 3.9 → 8.1 → 1.8 → 6.5,不是遞增,是雜訊。 而 2005–2010 的中位數從 0.6 小時跳到 3.9 小時——混淆效果比訊號本身還大。
寫出來會很好看,而且大概沒有人會去查。但它不成立,所以它在這裡,不在標題上。