Sunday, September 13, 2026

Distant reading ,voyant tools,如何操作?(ChatGPT, 2026-9-13)

 可以。最簡單的理解是:

Distant reading 不是「不讀文本」,而是先把閱讀尺度拉遠,找出 corpus 裡的 pattern,再回到局部 close reading。
Voyant Tools 正好是一個很好的入門環境,因為它能讓您在「遠看整體」和「近看句子」之間來回切換。Voyant 官方也正是這樣設計:Cirrus 看宏觀、Trends 看分布、Contexts 回到詞語出現的具體上下文。

最基本操作

進入 Voyant Tools 後,您可以直接貼文字、貼一組網址,或上傳檔案;支援 TXT、HTML、XML、PDF、RTF、Word 等,也可以一次上傳多個文件,甚至用 zip 打包。

最理想的是:不要把五十萬字全部塞成一個文件。若要做 distant reading,應該先把 corpus 切成有意義的單位,例如:

第1講.docx
第2講.docx
……
第16講.docx

甚至更好:

2025-06-01_第一講.txt
2025-06-08_第二講.txt
……

因為 Voyant 的很多功能,本質上是在比較「文件與文件之間的差異」。

載入之後,預設畫面通常有五個主要窗格:

Cirrus、Reader、Trends、Summary、Contexts。而且這些窗格會互相連動:例如在 Cirrus 點一個詞,Trends 和 Contexts 會跟著變。


第一招:Cirrus —— 先問「這批文字在談什麼?」

Cirrus 就是 word cloud。

字越大,代表在 corpus 中出現越頻繁。您可以調整顯示詞數,預設大約 50 個詞,也可以自訂 stopwords。

假設把《自體的心理學 2025》十六講丟進去,第一眼可能看到:

自體
關係
治療
主體
歷史
自然
心理
世界
存在
他者

這還不算研究結果。

真正的第一步,是問:

哪些字太常見,因此沒有區辨力?

例如「就是」「我們」「意思」「所以」「一個」等,都要加入 stopword list。

這一步非常重要。因為 word cloud 最常見的錯誤就是:

頻率高 = 重要。

並非如此。

頻率只是告訴您:

這個詞值得進一步問。


第二招:Corpus Terms —— 不看漂亮圖,看真正的數字

我通常會建議很快離開 Cirrus,進到 Corpus Terms

這裡會真正列出:

  • term
  • raw frequency
  • relative frequency
  • distribution
  • TF-IDF 等

Voyant 的 Corpus Terms 可以排序、搜尋,也能設定 stopword list。

例如您發現:

次數
自體 1,280
關係 920
歷史 610
自然 430
主體 380

這只是第一層。

真正開始 distant reading,是問:

「歷史」集中在哪幾講?
「自然」是不是後期突然增加?
「主體」是不是逐漸被「生成」取代?

於是就進入下一步。


第三招:Trends —— 看思想在「時間/章節」中的移動

這是我認為對您的材料最有價值的一個工具。

搜索:

自體
關係
歷史
自然

Trends 就會畫出這些詞在每一份文件中的相對頻率。

所以您可能得到:

第一至四講:「自體」極高
五至八講:「關係」升高
九至十二講:「歷史」突然上升
十三至十六講:「自然」「物」「AI」出現

這時 distant reading 開始有真正的人文意義。

因為您看到的可能不是「詞頻」,而是:

思想重心的遷徙。

甚至可能發現一件作者自己不知道的事:

我原本以為「回到自然」從頭到尾都很重要,結果 corpus 顯示,它其實到第十二講以後才真正進場。

這才是 distant reading 的力量。


第四招:Contexts —— 馬上回去 close reading

這一步非常關鍵。

假設您發現「自然」在第十三講暴增。

不要立刻寫:

「作者後期發生自然轉向。」

應該點進 Contexts

Contexts 是 KWIC——keyword in context,會把每一次出現的關鍵詞,連同左右的文字列出來。預設上下各看幾個詞,也可擴展到更大的窗口。

例如:

……回到自然並不是回到山林……
……
自然不是人的療癒資源……
……人必須重新在
自然之中退位……

您才會發現:

「自然」雖然都是同一個字,概念可能已經轉變:

nature as environment
→ nature as therapeutic resource
→ nature as ontology

這就是我所謂:

遠讀 → 發現異常 → 近讀 → 解釋異常。

而不是「電腦告訴我答案」。


第五招:Collocates / Links —— 看「一個概念跟誰一起出現」

這是更加有趣的一步。

Voyant 可以找 collocates:某個詞附近經常共同出現哪些詞。官方定義就是:在關鍵詞附近,比較頻繁出現的 terms。

例如查:

自體

可能得到:

關係
治療
疾患
主體
Kohut

再查:

自然

可能得到:


世界
動物

生態

再查:

AI

可能得到:

演算法

主體
技術
後人類

於是您可以開始畫一個概念世界:

自體 ←→ 關係
自體 ←→ 治療
自然 ←→ 物
AI ←→ 演算法
人 ←→ 自然/AI/物

Links 會把這些共現關係視覺化。

這時候我們已經從「詞頻」進入:

conceptual ecology

這一層其實非常接近您所謂「碎片之間互相認識」。


第六招:Phrases —— 看您反覆說哪些「句塊」

這對個人長期 corpus 特別好用。

不是只找:

自體

而是找 recurring phrases,例如:

意思是說
你要理解
回到歷史
回到自然
人的退位
物的歸位

單詞分析常把思想拆得太碎;phrase analysis 反而更接近一個人的思考習慣。

某些短語可能其實是您的「conceptual operators」:

「意思是說」=轉折/展開裝置
「你要理解」=建立教學場景
「回到」=思想運動
「一二三」=分類機器

這就開始進入 style / rhetoric,而不只是 topic。


一個真正的 distant-reading workflow

若由我操作一個五十萬字 corpus,我不會一上來就跑所有功能,而會依這個順序:

① Corpus → ② stopwords → ③ Corpus Terms → ④ Trends → ⑤ Contexts → ⑥ Collocates → ⑦ 回原文。

可以濃縮成:

COUNT → COMPARE → LOCATE → CONTEXTUALIZE → INTERPRET

這才是完整的 distant reading。


有一個極重要的觀念:不要只看 raw frequency

比如:

第1講 20,000 字,「自然」100 次。
第16講 100,000 字,「自然」200 次。

如果只看 raw count:

200 > 100

好像第16講比較重要。

但換成 relative frequency:

第1講:5 / 1,000 words
第16講:2 / 1,000 words

結論反而相反。

Voyant 的工具本身就提供 relative frequency、文件分布等數值,因此跨不同長度文本比較時尤其重要。


我更建議您做的一個實驗

先不要拿五十萬字。

只拿十六講,每講一個檔案

輸入 Voyant 後,只追蹤十個詞:

自體
關係
主體
歷史
自然


治療
AI
生成

然後看 Trends。

我猜很可能會出現一條相當漂亮的思想遷移圖:

Self → Relationality → History → Nature → Thing → Posthuman

若真的出現,那就不只是漂亮圖。

它會提出一個非常具體的研究假說:

《自體的心理學 2025》表面上是十六個主題,
實際結構也許是一個「人的中心性逐步下降」的運動。

然後我們再用 Contexts 去驗證它。

這就是 Moretti 意義下真正有意思的 distant reading:圖不是答案;圖讓一個原本不容易被問出的問題浮現。

Voyant 的另一個優點是 corpus 與目前工具配置可以匯出成連結,方便之後回到同一批文本繼續分析。

如果您願意,我下一步可以直接替您設計一個 「《自體的心理學 2025》Voyant distant-reading 實驗」:包括應該如何切 16 個檔案、20–30 個關鍵詞、中文 stopword 清單,以及第一輪應該驗證的 5 個假說。