📚 知識家圖書館 奇摩知識+ 紀念館

知識+ 的最後十六年,資料只肯告訴我們這麼多

一份 18,162 則提問的爬蟲存檔,記錄了奇摩知識+ 從 2005 到關站前夕的樣貌。 但它不是普查,而是一次抽樣不均的搶救。這篇分析先說明哪些數字不能用,再說明剩下的數字說了什麼。

資料範圍 2005–2021 · 樣本 18,162 題 · 涵蓋 41 個母分類

結論先講

把 2005–2006 年與 2021 年這兩個抽樣可靠的時期放在一起比,提問結構發生了一次明顯位移: 從「生活疑難」移向「消費決策」。健康、教育、電腦這些早期支柱全數萎縮, 商業財經、美容、汽車則明顯膨脹。

漲幅最大 商業與財經
+5.1pp
7.3% → 12.4%(166 → 999 題)
跌幅最大 健康
−4.4pp
17.0% → 12.6%(384 → 1,015 題)
但這個結論有嚴格的適用範圍

本文所有比較都只在「兩個時期都有充分樣本的 16 個分類」內進行,且刻意跳過 2007–2020 年。 原因不是懶,是那些年份的資料無法支撐年度比較。 任何看到這份存檔就直接畫出「十六年趨勢線」的分析,都是錯的。

各分類的結構位移

2005–2006 年 → 2021 年,各分類佔比變化 單位為百分點(pp)。僅列入兩期樣本皆達 30 題以上的 16 個分類。
佔比上升 佔比下降
早期樣本 2,260 題、晚期樣本 8,037 題

位移的方向相當一致。下降的清一色是「有人幫我解答就好」的類型——健康、社會與文化、 教育與參考、電腦與網際網路,這四類合計掉了 13.7 個百分點。 這正好是後來被 Google 搜尋、專業論壇與社群社團逐步接管的領域。

上升的則集中在帶有消費意圖的主題:商業與財經、美容與造型、汽車與交通、遊戲與休閒。 這類問題有個共同特徵——答案牽涉到花錢,因此也最容易吸引業者進場經營。 這與存檔裡另一個現象吻合:清洗資料時,光是 467 題的樣本就濾出 86 則含聯絡方式的推銷回答。

為什麼只能比這兩個時期

這批資料是 2021 年 4 月、關站前一個月做的搶救式爬取,不是平台的完整匯出。 爬蟲逐分類抓取串流、由新往舊翻頁,因此每一年被抓到多少題、抓到哪些分類,取決於爬蟲翻了幾頁, 而不是當年真的有多少人在問。

判斷一個年份能不能用,用兩個門檻:該年樣本須達 300 題,且須涵蓋 41 個母分類中的 55% 以上。 結果只有三個年份過關。

2004 18 題 · 11 類 ✗ 樣本過少
2005 1,169 題 · 23 類 ✓ 可用
2006 1,091 題 · 23 類 ✓ 可用
2007 900 題 · 22 類 ✗ 涵蓋不足
2008 1,110 題 · 21 類 ✗ 涵蓋不足
2009 1,148 題 · 22 類 ✗ 涵蓋不足
2010 919 題 · 22 類 ✗ 涵蓋不足
2011 727 題 · 21 類 ✗ 涵蓋不足
2012 548 題 · 22 類 ✗ 涵蓋不足
2013 501 題 · 20 類 ✗ 涵蓋不足
2014 408 題 · 20 類 ✗ 涵蓋不足
2015 319 題 · 21 類 ✗ 涵蓋不足
2016 231 題 · 20 類 ✗ 樣本過少
2017 179 題 · 20 類 ✗ 樣本過少
2018 100 題 · 21 類 ✗ 樣本過少
2019 37 題 · 11 類 ✗ 樣本過少
2020 190 題 · 20 類 ✗ 樣本過少
2021 8,567 題 · 41 類 ✓ 可用
每年的樣本數與分類涵蓋度 2021 年涵蓋全部 41 個分類,其餘年份僅 20–23 個。兩者的抽樣機制根本不同。
通過檢定,可用於比較 未通過,僅供瀏覽
縱軸為對數刻度,因 2021 年樣本量與其餘年份差距達兩個數量級

2021 年的 8,567 題全部集中在 1 至 4 月,且涵蓋所有分類——那是爬蟲對「當時最新內容」的一次完整掃描, 品質最好。2005–2006 年各有約 1,100 題、涵蓋 23 個分類,是舊資料裡最厚的一段。 中間那十四年樣本隨年份遞減,到 2019 年只剩 37 題。

一個差點被寫成頭條的假發現

初步跑出來的結果裡,漲幅最大的是「家庭與人際關係」,從 0.4% 暴增到 5.9%。 這個數字很有故事性——聽起來像是台灣人越來越願意在網路上談感情問題。

但 0.4% 換算回去只有 9 題。查證後發現,這個分類在 2005 年的分類體系裡根本還沒獨立出來, 當年的同類問題被歸在「社會與文化」底下。所謂的暴增,是 Yahoo 改了分類架構,不是台灣人改了行為。

因此本文設下「兩期樣本皆須達 30 題」的門檻,排除了 8 個分類。 它們的變化幅度可能很大,但無法區分是真實變化還是分類調整,一律不採用。

同樣待查證:美容類問題在末期的異常上升

2012 至 2016 年,美容相關提問的佔比從 1% 一路升到 44%,方向一致且跨越五年, 不太像隨機雜訊,很可能反映了平台末期被行銷內容佔據的過程。 但 2016 年全年樣本僅 231 題,44% 這個數字本身不可引用。 可以說的是趨勢方向,不是百分比。

美容相關提問佔比,2012–2018 灰底區域為樣本不足 300 題的年份,其數值僅供參考,不應作為結論引用。
各年樣本數:2012 年 548 題、2013 年 501 題、2014 年 408 題、2015 年 319 題、 2016 年 231 題、2017 年 179 題、2018 年 100 題

方法

  • 資料來源:2021 年 4 月對 tw.answers.yahoo.com 公開頁面的爬取存檔,共 18,162 則具備有效時間戳的提問。
  • 分類歸屬:每題只採計第一個母分類。原始資料的母分類欄位是陣列,直接用聚合統計會把同一題重複計入多類——實測會讓 2005 年從 1,169 題膨脹為 1,482 題。
  • 年份門檻:樣本須達 300 題,且分類涵蓋率須達 55%(41 個母分類中的 23 個)。
  • 分類門檻:僅比較兩期樣本皆達 30 題的分類,以排除分類體系調整造成的假變化。
  • 比較基準:佔比以「納入比較的 16 個分類」為分母重新計算,而非全體樣本,確保兩期基準一致。

這份分析不能拿來做什麼

  • 不能推論知識+ 的實際提問總量或成長曲線——樣本量反映爬蟲行為,與平台活躍度無關。
  • 不能推論 2007–2020 年間的任何年度變化。
  • 不能推論台灣網路使用者的整體行為——知識+ 的使用者從來不是全體網民的代表性樣本。

本頁所有百分比均可由公開的分析腳本重現,判定門檻寫在腳本中,非事後調整。