知識+ 的最後十六年,資料只肯告訴我們這麼多
一份 18,162 則提問的爬蟲存檔,記錄了奇摩知識+ 從 2005 到關站前夕的樣貌。 但它不是普查,而是一次抽樣不均的搶救。這篇分析先說明哪些數字不能用,再說明剩下的數字說了什麼。
結論先講
把 2005–2006 年與 2021 年這兩個抽樣可靠的時期放在一起比,提問結構發生了一次明顯位移: 從「生活疑難」移向「消費決策」。健康、教育、電腦這些早期支柱全數萎縮, 商業財經、美容、汽車則明顯膨脹。
本文所有比較都只在「兩個時期都有充分樣本的 16 個分類」內進行,且刻意跳過 2007–2020 年。 原因不是懶,是那些年份的資料無法支撐年度比較。 任何看到這份存檔就直接畫出「十六年趨勢線」的分析,都是錯的。
各分類的結構位移
位移的方向相當一致。下降的清一色是「有人幫我解答就好」的類型——健康、社會與文化、 教育與參考、電腦與網際網路,這四類合計掉了 13.7 個百分點。 這正好是後來被 Google 搜尋、專業論壇與社群社團逐步接管的領域。
上升的則集中在帶有消費意圖的主題:商業與財經、美容與造型、汽車與交通、遊戲與休閒。 這類問題有個共同特徵——答案牽涉到花錢,因此也最容易吸引業者進場經營。 這與存檔裡另一個現象吻合:清洗資料時,光是 467 題的樣本就濾出 86 則含聯絡方式的推銷回答。
為什麼只能比這兩個時期
這批資料是 2021 年 4 月、關站前一個月做的搶救式爬取,不是平台的完整匯出。 爬蟲逐分類抓取串流、由新往舊翻頁,因此每一年被抓到多少題、抓到哪些分類,取決於爬蟲翻了幾頁, 而不是當年真的有多少人在問。
判斷一個年份能不能用,用兩個門檻:該年樣本須達 300 題,且須涵蓋 41 個母分類中的 55% 以上。 結果只有三個年份過關。
2021 年的 8,567 題全部集中在 1 至 4 月,且涵蓋所有分類——那是爬蟲對「當時最新內容」的一次完整掃描, 品質最好。2005–2006 年各有約 1,100 題、涵蓋 23 個分類,是舊資料裡最厚的一段。 中間那十四年樣本隨年份遞減,到 2019 年只剩 37 題。
一個差點被寫成頭條的假發現
初步跑出來的結果裡,漲幅最大的是「家庭與人際關係」,從 0.4% 暴增到 5.9%。 這個數字很有故事性——聽起來像是台灣人越來越願意在網路上談感情問題。
但 0.4% 換算回去只有 9 題。查證後發現,這個分類在 2005 年的分類體系裡根本還沒獨立出來, 當年的同類問題被歸在「社會與文化」底下。所謂的暴增,是 Yahoo 改了分類架構,不是台灣人改了行為。
因此本文設下「兩期樣本皆須達 30 題」的門檻,排除了 8 個分類。 它們的變化幅度可能很大,但無法區分是真實變化還是分類調整,一律不採用。
2012 至 2016 年,美容相關提問的佔比從 1% 一路升到 44%,方向一致且跨越五年, 不太像隨機雜訊,很可能反映了平台末期被行銷內容佔據的過程。 但 2016 年全年樣本僅 231 題,44% 這個數字本身不可引用。 可以說的是趨勢方向,不是百分比。
方法
- 資料來源:2021 年 4 月對 tw.answers.yahoo.com 公開頁面的爬取存檔,共 18,162 則具備有效時間戳的提問。
- 分類歸屬:每題只採計第一個母分類。原始資料的母分類欄位是陣列,直接用聚合統計會把同一題重複計入多類——實測會讓 2005 年從 1,169 題膨脹為 1,482 題。
- 年份門檻:樣本須達 300 題,且分類涵蓋率須達 55%(41 個母分類中的 23 個)。
- 分類門檻:僅比較兩期樣本皆達 30 題的分類,以排除分類體系調整造成的假變化。
- 比較基準:佔比以「納入比較的 16 個分類」為分母重新計算,而非全體樣本,確保兩期基準一致。
這份分析不能拿來做什麼
- 不能推論知識+ 的實際提問總量或成長曲線——樣本量反映爬蟲行為,與平台活躍度無關。
- 不能推論 2007–2020 年間的任何年度變化。
- 不能推論台灣網路使用者的整體行為——知識+ 的使用者從來不是全體網民的代表性樣本。