返回博客

Grok 4.7 擅長知識工作嗎?用真實資料檢查

SpaceXAI, Grok and MuseWork marks in three equally sized square tiles for a knowledge-work evaluation article.

榜單說模型進步了,採購團隊卻更在意它會不會漏掉供應商的交期限制。SpaceXAI 於 9 月 21 日推出 Grok 4.7,主打較長時間的複雜任務與自我檢查。要把這項進展帶進工作,最好的起點是一組已知正確答案的資料。

新版本與評測各說了什麼

SpaceXAI 將 Grok 4.7 定位於程式與知識工作,表示它更能持續處理難題、檢查結果並管理較長的內容。這是廠商對模型的描述,不能直接當作採購或財務結果的保證。

哪些測試與辦公工作有關

SpaceXAI 的官方表格涵蓋程式、電機工程、多小時辦公工作、法律和臨床推理。各項測試回答不同問題,程式得分不能證明採購條款一定正確。AA Briefcase v1.1 中 Grok 4.7 為 1,657、Grok 4.6 為 1,546,同表另有模型達到 1,678。專業工作指標 GDPval 裡,新版本是 1,695 Elo,上一代為 1,605。Artificial Analysis 獨立評估也觀察到長流程知識工作進步,但其他項目變化較小;對照時仍要留意推理設定。

這些分數可以幫團隊選擇優先測試的任務,卻不能替代自己的驗收標準。內部比較宜固定相同檔案、相同指令與相同評分項目,並把查找出處及修正錯誤的時間算進去。如果附件中的例外條款可能讓採購結論翻轉,是否抓到這一條就比摘要讀起來流不流暢更重要。

拿採購備忘錄當試題

某團隊有三份報價:一家單價較低但交貨較晚;一家有運費折扣,但訂購量得超過門檻;第三家的退貨規定寫在附件。需要交給主管的,是符合交期與毛利要求的一頁建議,附上來源與可能改變結論的待確認事項,而不是三份摘要。

可挑一組經核准使用、已有標準答案的專案檔案,先寫驗收條件:價格及幣別、交期、運費條款、原始頁碼、明確區分事實與假設。用相同資料比較現有流程和 Grok 4.7,記下遺漏、錯誤及人工修正時間。敏感內容先去識別化,依團隊資料分享規範處理。上下文容量大,不等於每筆數據都讀對。

如果關鍵條件的遺漏確實減少,再擴大到其他任務;如果文字只是更有自信卻漏了運費門檻,反而該保留原本的審核方式。

進一步測試時,可要求每份成果依「建議、對應條款、待確認問題」三部分呈現,再逐項對照報價原文。這樣團隊更容易看出價格、運費與交貨條件是否被混在一起,也知道哪些問題必須在下單前由人確認。

例如 A 廠單價最低,但運費尚未確認,就不能把「總成本最低」當作事實。B 廠折扣若有最低訂購量,應按本次實際數量重新計算;報價日期、有效期限與交貨地點也要放在同一套比較條件下。試驗紀錄除了答對幾題,更應留下漏讀的條款、錯引的頁碼、仍需向廠商確認的問題,以及人工修正時間。這些紀錄才能幫團隊判斷下一輪是否值得擴大使用。

讓採購摘要能回查

把單價與幣別、最低訂購量、運費、交期及退貨條件列在同一張表。若運費未定,就不應先寫某個方案「總成本最低」。主管能從每項結論返回原始頁碼或資料列,並看見下單前要問供應商的問題。

SpaceXAI 公布的渠道包括 Cursor、Grok Build 和 API;GitHub 也宣布 Copilot 提供。官方 API 起始價格為每百萬輸入/輸出 Token 2/6 美元,快速版本另有計費;實際開銷依使用渠道和設定而定。

讓測試結果成為決策依據

MuseWork 可依您提供且獲准使用的報價、公開發布資訊與獨立評測,整理驗證計畫及附出處的決策簡報。可這樣開始:「對照三份報價、11 月交期與至少 25% 毛利要求,引用每項條款,區分事實與假設,列出待詢問供應商的問題並寫成一頁建議。」

將報價整理成採購建議

把自己的報表、專案檔案與來源交給 MuseWork,整理成能繼續審閱的摘要。開始研究任務,或先了解深度研究

外出時也能從手機接著看:下載 MuseWork iPhone 或 Android 版。若需使用電腦中的檔案,可在授權後下載 MuseWork 桌面版

資料來源

下載 MuseWork 桌面版

經你授權後,MuseWork Desktop 可以跨瀏覽器和本機檔案工作,為你完成任務。

MuseWork 桌面版工作區預覽