跳到主要內容

用 100 萬個虛擬用戶幫你測產品:開源項目 MatrAIx-Persona-8B 拆解


在香港或台灣做產品、跑用戶調研,最頭痛的永遠是找人。找真實用戶做訪談或 A/B 測試,招募成本高、耗時間,樣本數太少又怕偏頗。

但如果改用 AI 模擬?大部分人的經驗都不太好。直接給 ChatGPT 一段 Prompt 叫它「扮演一個 25 歲、注重 CP 值的大學生」,生出來的答案通常滿嘴客套話、邏輯過度完美,甚至在填問卷時前後矛盾。這是因為 LLM 底層的安全機制與語氣訓練,早已把真實人類那種偏執、無耐心跟複雜性給過濾掉了。

最近 GitHub 上出現了一個開源項目 MatrAIx-Persona-8B,提出「Simulate Before Reality」(在面對真實前,先完成模擬)的構想。它不是另一個提示詞模板,而是一整套人口級別(Population-Scale)的 Persona 測試基建,甚至在 Hugging Face 上直接釋出了 100 萬個經過數據錨定的 Persona 數據集。

為什麼過去的 AI Persona 像是在家家酒?

過去用 AI 做用戶測試,主要有三個硬傷:

  1. 標籤太過扁平:只給了職業跟年齡,模型運算時依然帶著原本的語氣。它不會因為「角色沒耐心」而按錯按鈕,也不會因為「看不懂專業術語」而放棄操作。

  2. 行為前後不一致:在問卷第一頁選了 A,到第三頁就忘記前面的設定。

  3. 只能做純文字問答:現實中的用戶會滑手機、點網頁、操作桌面軟體,但多數 AI Persona 只能留在對話框裡填選擇題。

MatrAIx 怎麼解決這些問題?

MatrAIx 把這件事拆得非常細,核心架構由三個部分組成:

1. 1,290 個類別維度的 Persona 數據集

他們建立了一個包含 1,290 個維度的 Schema,涵蓋背景、心理特質、認知能力到具體行為偏好。這些數據結合了合成分析與真實人類資料(Evidence-Aware Human Grounding),確保生成的角色不會出現邏輯矛盾。

2. 四大真實操作環境

這套系統支援四種任務場景:

  • Survey:問卷調查與多選評估。

  • AI Chatbot:對話體驗與客服對應。

  • Web:透過 Playwright 在真實網頁上瀏覽點擊。

  • OS App:支援 Linux、macOS、iOS 等原生系統操作。也就是說,AI 代理可以像真人一樣去操作實際的軟體介面。

3. 可重複驗證的評估流程

內建 Playground 與 CLI 工具。你可以挑選特定的 Persona Cohort(群體),跑完測試後直接看歸因分析,找出產品在特定族群眼中真正的盲點。

本地部署與快速上手

部署需要 Docker 與 uv(Python 3.12)。

1. 安裝環境

Bash
git clone https://github.com/MatrAIx-ai/MatrAIx-Persona-8B
cd MatrAIx-Persona-8B

uv venv --python 3.12
uv pip install -e .
uv pip install pytest pytest-asyncio httpx
uv pip install -e packages/playground

2. 下載 Persona 1M 數據集

如果想測試他們釋出的百萬資料庫,可以用 Hugging Face CLI 下載:

Bash
huggingface-cli download MatrAIx2026/MatrAIx_Persona_1M_Public_Release \
  --repo-type dataset \
  --local-dir persona/datasets/matraix-persona-1m/release

3. 開啟 Playground 介面

後端與前端分開啟動,開好後前往 http://localhost:5173 即可看到操作面板:

Bash
# Terminal A:啟動 Backend
VENV=.venv bash application/playground/backend/run_dev.sh

# Terminal B:啟動 Frontend
cd application/playground/frontend && npm ci && npm run dev

結語:產品驗證的防線

對資源有限的新創團隊或開發者來說,招募 50 個真實用戶做深訪可能要花上好幾週。

MatrAIx 不是要完全取代真人測試,項目團隊自己也在 README 中強調了這點。但把這套系統當作產品上線前的第一道防線,先拿 500 個不同性格的虛擬用戶去衝撞你的介面跟流程,把顯而易見的邏輯漏洞與體驗痛點掃掉,再把資源留給最後的真實用戶驗證,能大幅提升產品迭代的效率。

留言

這個網誌中的熱門文章

Cloudflare Kitesurf 實測:用自然語言讓 AI 幫你操作瀏覽器與抓資料

我最近在玩 Cloudflare 推出的實驗性工具 Kitesurf 。簡單來說,它把 Cloudflare 的 Browser Rendering(無頭瀏覽器服務)跟 LLM 結合在一起,讓你用講話的方式就能指揮 AI 幫你操作網頁或抓取資料。 Kitesurf 解決了什麼問題? 以前寫網頁自動化或爬蟲,得打開 Playwright 或 Puppeteer 慢慢找 CSS Selector。只要網站改版,腳本往往就壞掉。Kitesurf 的做法是直接讓 AI 看懂網頁結構,根據你的指令自己決定點擊哪裡、輸入什麼文字,減少了維護腳本的時間成本。 簡單上手教學 想直接體驗的話,可以參考以下步驟: 開啟平台: 直接前往 Kitesurf 網站 。 輸入目標 URL 與任務指令: 在輸入框貼上你要處理的網頁,並用自然語言說明目標(例如:「幫我找出首頁前五篇熱門文章標題與連結」)。 設定 API Key: 根據提示填入相應的模型 API Key(如 OpenAI 或 Claude),讓 Agent 具備推理能力。 觀察執行過程: 按下執行後,畫面會展示無頭瀏覽器當前的步驟,包含截圖、分析節點與點擊動作。 取得輸出結果: 任務完成後,可以直接複製輸出的結構化文字或 JSON 資料。 使用體驗與小結 實測幾個簡單的頁面資料提取,因為背後有 Cloudflare 的邊緣網路加持,整體執行速度算順暢。不過如果遇到極為複雜的動態選單或強烈的人機驗證,AI 偶爾還是會卡住。拿來做輕量級的資料監控、自動填表或探索 AI Browser Agent 的可能性非常合適,有興趣的朋友不妨抽空玩玩看。

探索 Cactus Compute 的 Needle:輕量級 AI 深度學習與運算框架

近期在 GitHub 上發現了 Cactus Compute 推出的開源專案 Needle 。這是一個設計導向明確、強調輕量與可擴充性的深度學習運算框架。如果你想深入了解 AI 框架底層的自動微分機制,或是需要一個乾淨不冗餘的運算庫,這個專案非常值得關注。 Needle 的核心特點 比起現今功能包羅萬象但架構龐大的主流套件,Needle 選擇回歸核心,提供靈活的開發體驗: 結構清晰的自動微分 Engine: 讓開發者能直觀追蹤張量(Tensor)的計算圖建立與梯度傳遞。 靈活擴充運算元: 可以方便地針對 CPU 或 GPU 自訂 Low-level C++/CUDA kernels。 低學習門檻: API 命名與運作邏輯貼近 PyTorch,減少重新適應的時間成本。 簡單上手教學 若要在本地環境嘗試 Needle,可以依照以下步驟進行安裝與測試: 1. 環境準備與複製專案 開啟終端機,將專案複製到本地並安裝必要依賴: git clone https://github.com/cactus-compute/needle.git cd needle pip install -r requirements.txt 2. 基本運算與梯度計算 安裝完成後,可以在 Python 中直接載入並建立張量運算: import needle as ndl # 建立支援求導的張量 x = ndl.Tensor([2.0, 3.0], requires_grad=True) y = x * 3.0 + 1.0 # 執行反向傳播 y.backward() print(x.grad) 結語 Needle 去除了許多商業框架中的複雜包袱,讓程式碼重回好讀、好改的狀態。無論是用作教學研究、理解深度學習引擎的運作原理,或是開發輕量化的運算模組,Needle 都提供了一個相當優質的起點。有興趣的朋友可以直接造訪 GitHub 專案頁面了解更多細節。