點擊上方藍字關注我,加個??標不迷路。
大家好,我是 cxuan。
7 月 19 號,Qwen 發了一條消息,宣布 Qwen3.8 即將推出并開源,而且這是個 2.4 T 的參數,他們認為這是當今最強大的模型之一,可與領先的前沿 AI 模型媲美。

而且我看到官推的鏈接也確認了這件事情。

這里有直達鏈接 :https://platform.qianwenai.com/pricing/token-plan
Lite 套餐我感覺輕度用量就夠夠的了,Standard 套餐的額度就相對來說充裕不少。

昨天我發了一篇 Qoder CLI + Qwen-3.8-Max Preview 的測試,說實話昨天測試的重心有點放在了工程任務很重的地方,比如 /goal 和 /subagent 多代理并行,我實測的過程中感覺 Qwen-3.8-Max Preview這次 2.4 T 的模型用起來確實不錯,于是我就又測了一下其他地方。
我們先來試一下 Qwen-3.8-Max Preview 的 Coding 能力如何,這是我最看重的,因為阿里在工程化能力這塊我認為還是很不錯的。
就拿新能源老三家蔚小理來試一下, 2025 年報,財年一致,三份共 928 頁,比較適合測試長文檔理解和數據核對。
另外準備了三份官方全年業績公告,用于最后核對答案,測試前不喂給模型,最后核對一下。正好同時也測試一下長程任務的能力。
這三份年報均來自香港交易所披露的。

Prompt 如下
請讀取當前目錄中的三份 2025 年年度報告:
- 蔚來 2025 年報
- 理想汽車 2025 年報
- 小鵬汽車 2025 年報
請連續完成資料分析、產品設計、代碼開發和測試,中間不需要向我確認普通的技術選擇。遇到無法確認的數據時標記為 N/A,不允許自行補全或推測。
最終交付一個可運行的“新能源汽車公司經營對比工作臺”,具體要求如下:
1. 提取三家公司 2024—2025 年的核心數據,包括:
- 汽車交付量
- 總收入
- 汽車銷售收入
- 毛利潤
- 毛利率
- 車輛毛利率
- 研發費用
- 銷售、一般及管理費用
- 經營利潤或虧損
- 凈利潤或凈虧損
- 年末現金及現金等價物或現金頭寸
2. 每個數據必須保留:
- 公司
- 財年
- 原始數值
- 統一后的數值
- 幣種和單位
- GAAP 或 non-GAAP
- 年報文件名和來源頁碼
3. 自動生成一份分析報告,說明:
- 三家公司收入和交付量的變化
- 毛利率和車輛毛利率差異
- 研發投入變化
- 盈利情況
- 各自披露的主要經營風險
- 哪些數據不能直接橫向比較,以及原因
4. 根據分析結果設計并開發一個 Web Dashboard,至少支持:
- 公司和年份切換
- 核心指標對比
- 趨勢圖和排行榜
- 風險提示
- 點擊指標查看原始出處
- 桌面端和手機端適配
- 加載、空數據和錯誤狀態
5. 自主檢查提取結果,識別季度與全年、人民幣與美元、GAAP 與 non-GAAP、現金及現金等價物與現金頭寸之間的區別。
6. 使用 Playwright 完成功能測試,檢查主要交互、頁面異常和移動端顯示。發現問題后繼續修改,直到達到可交付狀態。
最終提供:
- 數據文件
- 分析報告
- 可運行的產品
- 測試報告
- 頁面截圖
- 運行方式
- 完成度
- 未完成內容
- 總耗時、工具調用次數和人工介入次數
任務交付了。

整個過程它自己拆成了幾個階段:先把三份年報從頭到尾過一遍,按我列的 11 個核心指標逐項提取,每個數據都帶上了公司、財年、原始數值、統一后的數值、幣種單位、GAAP/Non-GAAP、還有年報文件名和來源頁碼;
然后基于提取出來的數據生成分析報告,收入變化、毛利率差異、研發投入、盈利情況、各自披露的經營風險都過了一遍,還主動標注了哪些數據不能直接橫向比較;最后才動手寫 Dashboard,寫完用 Playwright 自己跑功能測試,發現問題再回頭改。
然后我用報告結果來讓它自己分析,是否達到了驗收標準。

它自己說已經達到了驗收標準。

說實話我是有點存疑的。928 頁的年報,光是把數據提全就已經是個體力活,更別說還要保證幣種、GAAP、季度和全年這些細節了。
而且我用 GPT-5.6 Sol 核對了數據報告,確實能證明 Qwen-3.8-Max Preview 擁有自主調用工具完成數據收集、產品設計、功能開發、自主測試、連續執行到交付的工程能力,而且準確率竟然達到了 100% ,這是我沒想到的。

然后我們來看一下前端的效果。

這是 Dashboard 的主界面。三家公司可以切換,核心指標能橫向對比、排行榜、風險提示都在,點任何一個指標都能溯源到年報里的具體頁碼這一點是我特意要求過的。
我給大家錄了個視頻,更直觀的感受下。
第二個任務,做一個塔防游戲,叫做 《Prompt 防線》,Prompt 如下
請在當前項目中從零開發一款可運行的瀏覽器塔防游戲,游戲名稱為《Prompt 防線》。
游戲背景:
玩家需要守住從 Input 到 Output 的生成通道。Bug、幻覺、超時和上下文溢出會沿固定路線進攻,玩家通過部署測試、檢索、緩存和代碼審查等防御塔阻止它們到達終點。
請自主完成玩法設計、界面設計、開發、調試和測試。
核心要求:
1. 游戲必須包含完整的開始、進行、勝利、失敗和重新開始流程。
2. 至少提供:
- 10 個普通波次
- 1 個 Boss 波次
- 4 種機制不同的防御塔
- 防御塔放置、升級和出售
- 金幣和生命值系統
- 暫停、繼續、1 倍速和 2 倍速
- 下一波敵人預覽
3. 敵人至少包含:
- 普通 Bug
- 高速 Timeout
- 高血量 Hallucination
- 能影響防御塔的 Context Overflow Boss
4. 防御塔必須有不同作用,例如單體攻擊、范圍攻擊、減速和輔助增益,不能只替換顏色和數值。
5. 頁面需要有完整的視覺效果:
- 清晰的移動路徑
- 攻擊動畫
- 命中特效和粒子效果
- 金幣、傷害和狀態提示
- 游戲說明和新手引導
- 音效開關
6. 游戲需要保存最高分和設置。刷新頁面后設置不能丟失。
7. 不使用付費素材,不把外部游戲截圖當成游戲畫面。可以使用 Canvas、CSS、SVG 或自行生成的簡單素材。
8. 為傷害計算、金幣結算、波次生成、升級和勝負判斷補充單元測試。
9. 實際運行游戲并試玩。檢查控制臺錯誤、卡死、無法點擊、敵人不移動、金幣異常和重新開始失敗等問題,發現后繼續修改。
任務完成交付了一版。

第一版覺得不滿意,沒達到我想要的結果,不過這也正常。主要問題出在美術風格上,第一版偏正經,防御塔和敵人的造型沒什么辨識度,看著像個 demo 而不像個游戲。
我重新修改了一輪,改成漫畫風格了。

這一輪它理解得挺快,沒有把第一版的玩法邏輯推倒重來,而是在原有機制上重做了視覺:路徑、防御塔、敵人、特效全部重新畫過,配色也調得更鮮亮一些。等于只換了一層皮,但整盤棋的觀感完全不一樣了。
做出來的效果還是挺卡通可愛風的。
第三個任務,是做了一個旅行 web 頁面的復刻。
我先是做了個設計圖,然后讓 Qwen-3.8-Max Preview 給我復刻了一下。

這一步是有意為之的——我想測的不僅是能不能照著圖做,而是能還原到什么程度。所以設計稿里專門留了一些細節:圓角大小、卡片間距、地圖標記和景點卡片的聯動狀態,這些地方最容易看出來一個模型到底是真看懂了圖,還是只是大致搭了個架子。
Prompt 如下
請根據附件設計稿,開發一個可運行的旅行行程規劃 Web App。
還原原圖的布局、顏色、字體、圓角和間距。
頁面包含行程日期切換、景點卡片、分類篩選和右側路線地圖。
點擊景點卡片時,地圖標記需要同步高亮,并顯示景點簡介;
使用模擬數據即可,不接真實地圖 API。完成后實際啟動項目,修復控制臺錯誤。

已完成效果如下。
布局、配色、圓角這些大框架基本一比一還原,景點卡片和右側地圖的聯動也做出來了。
作為一鍵圖片復刻,我認為這次也是達標的。
說實在的,看到這個視覺效果。。。。我有點想搞個旅游網站了。。。
另外說一句:
上述測試是基于 Qwen-3.8-Max Preview 的測試版,我現在比較期待正式版發布時候的效果了,估計會更上一層樓。
這次三個任務覆蓋了三個完全不同的方向:長文檔理解加數據核對、游戲工程、設計稿視覺還原。跑下來我對 Qwen-3.8-Max Preview 的整體評價如下。
工程執行能力是最大亮點。 說實話,928 頁年報那一關最能說明問題——從數據提取、產品設計、代碼開發,到 Playwright 自動化測試,全鏈路一次跑通,中間不需要我插手確認技術選型,最后用 GPT-5.6 Sol 反查數據,準確率 100%。
長文檔不掉鏈子。 三份港股年報共 928 頁,幣種、GAAP 與 Non-GAAP、季度與全年這些容易混淆的地方,它都能自己識別并標注。
視覺還原在線。旅行 Web 頁面那一段,從設計稿到可運行頁面的還原度我自己是滿意的,布局、顏色、圓角這些細節確實做的比較到位。
不足也說一下:
不過這畢竟只是 Preview。2.4 T 的參數量加上阿里在工程化上一直以來的積累,我對正式版的預期更高。
而且現在 Qwen3.8-Max Preview 還有限時活動:白天Credits消耗1折,個人版Token Plan 夜間在此基礎上再享2折,額度這次很顯誠意。
如果這篇文章你覺得還不錯,謝謝你的三連,也希望可以轉發給同樣關注 AI / 科技 / 開發效率的朋友。 我是 cxuan,我們下期再見。