可以。最簡單的理解是:
Distant reading 不是「不讀文本」,而是先把閱讀尺度拉遠,找出 corpus 裡的 pattern,再回到局部 close reading。
Voyant Tools 正好是一個很好的入門環境,因為它能讓您在「遠看整體」和「近看句子」之間來回切換。Voyant 官方也正是這樣設計:Cirrus 看宏觀、Trends 看分布、Contexts 回到詞語出現的具體上下文。
最基本操作
進入 Voyant Tools 後,您可以直接貼文字、貼一組網址,或上傳檔案;支援 TXT、HTML、XML、PDF、RTF、Word 等,也可以一次上傳多個文件,甚至用 zip 打包。
最理想的是:不要把五十萬字全部塞成一個文件。若要做 distant reading,應該先把 corpus 切成有意義的單位,例如:
第1講.docx
第2講.docx
……
第16講.docx
甚至更好:
2025-06-01_第一講.txt
2025-06-08_第二講.txt
……
因為 Voyant 的很多功能,本質上是在比較「文件與文件之間的差異」。
載入之後,預設畫面通常有五個主要窗格:
Cirrus、Reader、Trends、Summary、Contexts。而且這些窗格會互相連動:例如在 Cirrus 點一個詞,Trends 和 Contexts 會跟著變。
第一招:Cirrus —— 先問「這批文字在談什麼?」
Cirrus 就是 word cloud。
字越大,代表在 corpus 中出現越頻繁。您可以調整顯示詞數,預設大約 50 個詞,也可以自訂 stopwords。
假設把《自體的心理學 2025》十六講丟進去,第一眼可能看到:
自體
關係
治療
主體
歷史
自然
心理
世界
存在
他者
這還不算研究結果。
真正的第一步,是問:
哪些字太常見,因此沒有區辨力?
例如「就是」「我們」「意思」「所以」「一個」等,都要加入 stopword list。
這一步非常重要。因為 word cloud 最常見的錯誤就是:
頻率高 = 重要。
並非如此。
頻率只是告訴您:
這個詞值得進一步問。
第二招:Corpus Terms —— 不看漂亮圖,看真正的數字
我通常會建議很快離開 Cirrus,進到 Corpus Terms。
這裡會真正列出:
- term
- raw frequency
- relative frequency
- distribution
- TF-IDF 等
Voyant 的 Corpus Terms 可以排序、搜尋,也能設定 stopword list。
例如您發現:
這只是第一層。
真正開始 distant reading,是問:
「歷史」集中在哪幾講?
「自然」是不是後期突然增加?
「主體」是不是逐漸被「生成」取代?
於是就進入下一步。
第三招:Trends —— 看思想在「時間/章節」中的移動
這是我認為對您的材料最有價值的一個工具。
搜索:
自體
關係
歷史
自然
Trends 就會畫出這些詞在每一份文件中的相對頻率。
所以您可能得到:
第一至四講:「自體」極高
五至八講:「關係」升高
九至十二講:「歷史」突然上升
十三至十六講:「自然」「物」「AI」出現
這時 distant reading 開始有真正的人文意義。
因為您看到的可能不是「詞頻」,而是:
思想重心的遷徙。
甚至可能發現一件作者自己不知道的事:
我原本以為「回到自然」從頭到尾都很重要,結果 corpus 顯示,它其實到第十二講以後才真正進場。
這才是 distant reading 的力量。
第四招:Contexts —— 馬上回去 close reading
這一步非常關鍵。
假設您發現「自然」在第十三講暴增。
不要立刻寫:
「作者後期發生自然轉向。」
應該點進 Contexts。
Contexts 是 KWIC——keyword in context,會把每一次出現的關鍵詞,連同左右的文字列出來。預設上下各看幾個詞,也可擴展到更大的窗口。
例如:
……回到自然並不是回到山林……
……自然不是人的療癒資源……
……人必須重新在自然之中退位……
您才會發現:
「自然」雖然都是同一個字,概念可能已經轉變:
nature as environment
→ nature as therapeutic resource
→ nature as ontology
這就是我所謂:
遠讀 → 發現異常 → 近讀 → 解釋異常。
而不是「電腦告訴我答案」。
第五招:Collocates / Links —— 看「一個概念跟誰一起出現」
這是更加有趣的一步。
Voyant 可以找 collocates:某個詞附近經常共同出現哪些詞。官方定義就是:在關鍵詞附近,比較頻繁出現的 terms。
例如查:
自體
可能得到:
關係
治療
疾患
主體
Kohut
再查:
自然
可能得到:
物
世界
動物
人
生態
再查:
AI
可能得到:
演算法
人
主體
技術
後人類
於是您可以開始畫一個概念世界:
自體 ←→ 關係
自體 ←→ 治療
自然 ←→ 物
AI ←→ 演算法
人 ←→ 自然/AI/物
Links 會把這些共現關係視覺化。
這時候我們已經從「詞頻」進入:
conceptual ecology
這一層其實非常接近您所謂「碎片之間互相認識」。
第六招:Phrases —— 看您反覆說哪些「句塊」
這對個人長期 corpus 特別好用。
不是只找:
自體
而是找 recurring phrases,例如:
意思是說
你要理解
回到歷史
回到自然
人的退位
物的歸位
單詞分析常把思想拆得太碎;phrase analysis 反而更接近一個人的思考習慣。
某些短語可能其實是您的「conceptual operators」:
「意思是說」=轉折/展開裝置
「你要理解」=建立教學場景
「回到」=思想運動
「一二三」=分類機器
這就開始進入 style / rhetoric,而不只是 topic。
一個真正的 distant-reading workflow
若由我操作一個五十萬字 corpus,我不會一上來就跑所有功能,而會依這個順序:
① Corpus → ② stopwords → ③ Corpus Terms → ④ Trends → ⑤ Contexts → ⑥ Collocates → ⑦ 回原文。
可以濃縮成:
COUNT → COMPARE → LOCATE → CONTEXTUALIZE → INTERPRET
這才是完整的 distant reading。
有一個極重要的觀念:不要只看 raw frequency
比如:
第1講 20,000 字,「自然」100 次。
第16講 100,000 字,「自然」200 次。
如果只看 raw count:
200 > 100
好像第16講比較重要。
但換成 relative frequency:
第1講:5 / 1,000 words
第16講:2 / 1,000 words
結論反而相反。
Voyant 的工具本身就提供 relative frequency、文件分布等數值,因此跨不同長度文本比較時尤其重要。
我更建議您做的一個實驗
先不要拿五十萬字。
只拿十六講,每講一個檔案。
輸入 Voyant 後,只追蹤十個詞:
自體
關係
主體
歷史
自然
物
人
治療
AI
生成
然後看 Trends。
我猜很可能會出現一條相當漂亮的思想遷移圖:
Self → Relationality → History → Nature → Thing → Posthuman
若真的出現,那就不只是漂亮圖。
它會提出一個非常具體的研究假說:
《自體的心理學 2025》表面上是十六個主題,
實際結構也許是一個「人的中心性逐步下降」的運動。
然後我們再用 Contexts 去驗證它。
這就是 Moretti 意義下真正有意思的 distant reading:圖不是答案;圖讓一個原本不容易被問出的問題浮現。
Voyant 的另一個優點是 corpus 與目前工具配置可以匯出成連結,方便之後回到同一批文本繼續分析。
如果您願意,我下一步可以直接替您設計一個 「《自體的心理學 2025》Voyant distant-reading 實驗」:包括應該如何切 16 個檔案、20–30 個關鍵詞、中文 stopword 清單,以及第一輪應該驗證的 5 個假說。