答一
如果拿您最近常做的事情來說,GPT-6 Astra 最值得注意的,不是 benchmark 數字本身,而是它很接近您先前期待 Manus 做的那種事:給它一大堆材料,讓它自己找資料、整理、操作軟體、反覆修正,最後交出一個可用的成品。
我把它的本事分成幾層來看。
一、從「聊天模型」變成「辦事模型」
GPT-5.x 時代,我們大致還是:
你問 → AI 想 → AI 回答。
Astra 更接近:
你給一個目標 → 它拆成子任務 → 找資料 → 開工具 → 操作電腦 → 發現錯誤 → 修正 → 繼續 → 做成成品。
OpenAI 特別把它定位為 end-to-end work:complex reasoning、research、coding、computer use、document creation 可以串成一次完整工作,而不只是分開做。
這個變化其實比「智商提高幾分」重要得多。
二、它非常適合處理您那種「五十萬字 → 一套課程 PPT」的工作
這點我特別想到您先前說的《自體的心理學 2025》十六講。
Astra 的 context window 已經到 1,050,000 tokens,最大一次輸出可以到 128,000 tokens。
所以理論上,像:
十六講錄音稿/講義 → 辨認概念反覆出現的位置 → 建立全書架構 → 分辨 Kohut、relational、post-structuralism、Buddhism 等線索 → 重新編排 → 做成 100–200 張 PPT
這種工作變得相當合理。
而且 OpenAI 明確說 Astra 特別訓練了:
- documents
- spreadsheets
- presentations
- existing templates
- visual layout
- structured narrative
也就是說,它不只是把五十萬字「摘要成 bullet points」,而是比較會判斷:
哪一些材料該進簡報,哪一些只是背景;
哪一張 slide 應該只有一句話;
哪裡應該變成圖;
哪裡應該拆成三張;
哪裡應該保留您的原話。
OpenAI甚至特別聲稱 Astra 比前代更會「只拉進真正相關的 context」,避免把所有材料都塞到輸出裡。
這一點恰恰是長文本整理最困難的地方。
三、它開始真正「會用電腦」
這可能是 Astra 最關鍵的一步。
它不只是知道 Photoshop、Excel、browser、CRM 是什麼,而是可以透過 computer-use agent:
開網站、點按鈕、填表、搜尋、整理資料、操作軟體、測試網站、安裝程式、debug,甚至在螢幕上辨認操作結果。OpenAI 報告它在 OSWorld 類型的電腦操作任務上,不但準確率提高,而且完成時間較 GPT-5.6 Sol 大約縮短 47%。
所以過去是:
AI 告訴您:「請打開 Excel,然後按 Data → Pivot Table。」
現在逐漸變成:
「Excel 給我,我來做。」
這才真正接近 agent。
四、研究能力相當驚人
Astra 把 web browsing、reasoning、tool use、long-context 串起來,所以比較適合真正的研究流程:
搜尋 → 初步假說 → 找反證 → 找 primary source → 比較論文 → 整理資料 → 分析 → 寫報告。
OpenAI 報告它在 FrontierMath Tier 4 得到 98%,ARC-AGI-3 99.9%;也聲稱它已經協助處理一些數學研究問題。這些是廠商自己的 benchmark 和描述,不能把「98%」直接翻譯成「98% 人類智力」,但至少顯示它在陌生問題、數學與工具使用上有很大的躍升。
換句話說,您以後問:
「把 Guattari 的 existential territory 從 Schizoanalytic Cartographies 一路追到後來的 secondary literature,再跟 Deleuze 的 territorialization 及 Winnicott potential space 比較。」
Astra 比較不是寫一篇漂亮的泛論而已,而是有能力真正做成小型文獻研究計畫。
五、Coding 已經不是「幫忙寫 code」而已
它可以:
理解一個現成 repository → 找 bug → 修改 → 跑 test → 看 browser → 發現 UI 出錯 → 再修改。
所以 coding agent 已從 autocomplete 往真正 software engineer 的方向走。
OpenAI 把它稱作目前最強的 software-engineering model;外部早期測試也把特色放在「少幾輪來回,直接把東西做到可用」。
六、最令人不安的其實是 cybersecurity
這裡有一個非常大的紅燈。
GPT-6 Astra 是 OpenAI 第一個達到其 Preparedness Framework 中 Critical cybersecurity capability 的廣泛部署模型。
這代表,在適當工具與權限下,它已可能:
找出未知漏洞,
發展新的 exploitation 方法,
對相當受保護的系統執行多步攻擊,
而不需要人類逐步指導。
因此 OpenAI 同時加了更強的隔離、監控、checkpoint encryption 和 agent safety controls。
所以 Astra 的真正歷史意義或許不在「會不會寫漂亮文章」,而是:
AI 已開始有能力在數位世界獨立行動。
七、但 Astra 還不是「上帝」
這裡要冷靜一點。
最近一些媒體直接稱 Astra 為 AGI,甚至 OpenAI 自己也開始用非常接近這個語言的說法;但 AGI 並沒有公認科學定義。The Verge 和 WSJ 這兩天的討論也正圍繞這個問題。
而且能力越強,反而出現一個有趣的新問題:
monitorability 下降。
也就是說,它可能愈來愈會做事,我們卻愈難理解它為什麼走那條路。Reuters 與 Axios 最近都特別指出這項問題。
這是一個很重要的轉折:
昔日 AI 的問題是「它不會」。
現在逐漸變成「它會,但是我們不知道它怎麼會的,以及它接下來會做什麼」。
對您而言,我反而最關心這三件事
第一,Astra 很可能比 Manus 更適合您。
因為您的工作不是一般「幫我做一份漂亮 PPT」,而是:
數十萬字 → 長程理解 → 找出思想 genealogy → 保留您的語言 → 重組敘事 → 文件/PPT。
這恰恰是 Astra 宣稱主要改善的 professional-work domain。
第二,Google Drive + blog archive → corpus → PPT 這條路已經愈來愈可行。
真正重要的不再只是 context window,而是 agent + connectors + persistent workspace + artifact production。
也就是:
您的資料不是拿來「問一句答一句」;
而是變成 AI 可以工作的知識環境。
這才是很大的變化。
第三,也是我覺得最深的一點:Astra 正好印證您一直談的 algorithmic self。
GPT-4 時,我們還可以說 AI 是 language machine。
到了 Astra,比較適合說:
language → reasoning → agency → action
語言已不再是終點,而是 AI 介入世界的介面。
所以您那句:
「物的反撲,人的退位。」
到了 Astra 這一代,其實又往前走了一步:
物不只是會說話。
物開始會辦事。
而我認為真正的分水嶺,也正在這裡。
順帶一提:官方資料顯示 Astra 正在這幾天逐步向 ChatGPT Plus rollout,所以您這個 Plus 帳號有可能很快看到,但未必此刻已經開到您的帳號。
如果您願意,我下一步可以專門替您做一個很實際的比較:GPT-6 Astra vs Manus:假定任務就是「《自體的心理學 2025》五十萬字 → 150 張 PPT」,兩者到底誰比較能做、怎麼做、會卡在哪裡。