Grok Imagine 2.0 生圖評測:中文不亂碼、改圖只動局部,15 個實測案例看它多猛

2026.09.03莊哲昀

你是不是也常常遇到這種事:用 AI 生圖,只是想改一個小地方,結果整張圖的畫風直接被換掉;或者請它打一段中文字,跑出來一堆看不懂的亂碼。這幾乎是每個用 AI 生圖工具的人都踩過的坑。2026 年 8 月,xAI 默默推出了全新的生圖模型 Grok Imagine 2.0,剛好就是衝著這兩個老問題來的——這篇整理我們實測的 15 個案例,看它到底解決到什麼程度。

30 秒概覽:Grok Imagine 2.0 最大的亮點是「區段(Segment)精準編輯」——滑鼠移到圖片上會自動偵測物件,點一下就能單獨換掉某個元素,其他地方完全不受影響;另一個亮點是中文字生成的精準度,四格漫畫、對話截圖、菜單招牌上的中文字都清楚可讀。本文整理基礎操作、精準編輯、中文文字生成、人物一致性、進階排版五大類實測案例,也老實記錄了一次模型偏見的翻車現場。

基礎操作:先感受一下「快」

登入方式跟 ChatGPT、Gemini 大同小異,用 Google 帳號登入後,左側選單找到 Image 功能,就會看到「Introducing Image 2.0」的入口。隨手打了一句「生成一張超寫實的東京街頭攝影」測試,出圖速度非常快——這是我們對這顆模型的第一印象,就是「快」。長寬比可以直接選,16:9 拿來當簡報封面很合適,也支援語音輸入提示詞。

區段精準編輯:改局部,不會動到整張圖

這是這次實測體驗最好的功能。滑鼠移到生成的圖片上,Grok 會自動偵測畫面裡的每一個物件並圈出來,你可以針對單一元素直接下指令修改:

  • 把腳踏車換成紅色重機——點選畫面中的腳踏車,輸入「紅色重型機車」送出,腳踏車消失、原地變成一台重機,畫面其他部分完全沒被動到。
  • 把街道場景換成沙灘——同樣的邏輯,選取背景元素直接置換場景,不影響前景的其他細節。

以前如果要在其他生圖工具做到同樣效果,要嘛得把提示詞寫得極其複雜,要嘛得靠精密的圖層工具手動控制。Grok 的區段編輯把這件事簡化成「點一下、講一句話」。

筆刷編輯:塗一塗,內容就換掉

除了點選元素,Grok 也提供類似筆刷的塗抹編輯——用滑鼠塗過想修改的區域,再告訴它要換成什麼。我們實測把畫面裡的內容整個塗改成一碗泡麵,效果精準,塗的範圍不用抓得很仔細,Grok 自己會判斷該改的邊界在哪裡。

中文文字生成:這是它跟 ChatGPT、Gemini 拉開差距的地方

過去用 AI 生圖工具最容易崩壞的就是文字,尤其是中文字。Grok Imagine 2.0 在這件事上的表現明顯超出預期:

  • 四格繁體中文漫畫——內容是「鄉民在 Threads 上發文戰南北,結果自己大破防」,文字清晰、對話框位置也對,唯一美中不足是內容主題略顯空泛,但文字呈現本身沒有問題。
  • 正面宣導文案圖卡——直接請它生成一段正面宣導文字並排版成圖,中文顯示同樣乾淨。
  • Threads 對話截圖模擬——請它設計一個「完全真實的 Threads 畫面截圖模擬」,討論「《欸那個 AJ》YTP 到底有沒有料」,AI 會自己去發想留言內容並排成介面截圖的樣子。這種社群截圖過去得靠設計師手工模擬,現在只要轉頭跟 AI 講一句話。
  • 深夜食堂風格中文菜單——「凌晨四點的牛肉麵」菜單設計,字體選了有質感的樣式,中文字精準度沒有太大問題,很適合餐飲業者直接拿來練手感。

Search Grounding:先搜尋,再生圖

Grok 支援生圖前先做搜尋、抓取網站內容當作參考資料。我們實測把官網一篇文章的網址丟給它,請它做成社群發文用的懶人包圖卡,Grok 會先讀取文章內容,抓出核心理念,再排版成圖卡——等於是把「讀資料」跟「做圖卡」這兩個步驟合併成一次對話。

簡報大綱轉圖片:跟 NotebookLM 搭配使用

先在 NotebookLM 把資料匯進去,請它把內容整理成 Markdown 格式的簡報大綱(含標題與重點),再把這份大綱丟給 Grok,請它「製作成簡報型態的圖片」。第一次嘗試選了 4 張圖,但 Grok 把四頁內容擠進了一張圖裡,跟預期的版式不同;改用 Agent 模式重新下指令——「將以下內容大綱生成系列圖片的 Storyboard,一張圖生成 Page 1,第二張圖生成 Page 2,依此類推」——這次才真正拆成四張獨立的簡報頁。Agent 模式背後看起來是內建了一個小型的規劃機器人,會把使用者的需求轉譯成更精準的批次生成指令,風格一致性跟內容重點掌握得都不錯。

人物一致性:上傳照片、維持特徵

這一類是我們覺得最實用、也最考驗模型功力的部分:

  • 復古雜誌穿搭拆解圖——上傳一張本人照片,請它生成「直式的復古雜誌人物穿搭拆解圖」,長寬比維持原圖不變。效果不錯,細節上它甚至自己順手換了一雙鞋子。
  • 電商 model 換裝——上傳角色照片,請它讓角色穿上指定的服飾單品、放在乾淨背景,模擬電商銷售的 model 照。接著追加指令要角色「跳起來、轉過去」,測試動作變化下人物一致性還撐不撐得住——結果衣服、鞋子、人臉、頭戴配件都維持得很一致,這對電商賣家來說是可以直接拿來做產品照的等級。
  • 多人合成同一張畫面——把兩張不同人物照片合成進同一張「像手機隨手拍」的畫面裡(模擬與偶像的合照),品質跟細節控制得不錯,但仔細看邊緣還是能看出一點 AI 生成的痕跡。
  • 產品包裝圖——上傳一張產品外觀參考圖(我們用了一碗牛肉麵測試),請它合成電商宣傳用的包裝視覺,適合需要大量素材產出的電商與品牌行銷團隊。

有趣的延伸玩法

  • ASCII 藝術自畫像——請 Grok 搜尋「AJ 莊哲昀」本人,搭配它的認知與訓練資料,用 ASCII 藝術形式做一幅「在你眼中的優點與特色」。因為是剛登入、模型對使用者的理解還不深,內容偏空泛,但 ASCII 呈現本身處理得不錯——這算是近期流行的「AI 眼中的你」玩法的一種變形。
  • 9 宮格 LINE 貼圖包——上傳一張寵物照片,請它做成搞笑動漫風格的 9 宮格貼圖包,設計成「厭世貓咪」的搞怪貼圖,很輕鬆就生成一組可以直接拿去做 LINE 貼圖的素材。

進階應用:整頁排版與空間設計

  • Single Page 網頁式行銷排版——這是模擬群眾募資、電商網站上常見的「一頁式」連續排版素材。用 Agent 模式把實際要宣傳的內容重點丟進去,Grok 會拆成類似可以往下捲動(scroll down)的網頁式版面,適合募資頁與商品介紹頁使用。
  • 空間平面圖轉實景效果圖——上傳一張房間的平面設計圖,請它生成實體風格的空間示意圖,還能再追加指令「用不同角度製作成多個實景的拼貼照片」。對房仲、室內設計從業者來說,這是能直接拿來用的工具。
  • 比例重製與 outpainting——把已經生成的圖片重製成不同比例(例如改成 9:16),同時要求「維持角色姿勢」,Grok 會用 outpainting 的方式把畫面向外延伸補滿,而不是單純裁切變形,長寬比可以隨需求動態調整。

老實講:它也不是完美的

實測「喜劇電影社群話題海報」、主題設定為「家長地獄」時,Grok 生成的畫面裡,所有家長角色清一色都是媽媽——這是訓練資料偏見(bias)在生圖模型上的典型症狀,我們在課堂上也一直提醒學員:模型是從網路上大量資料學來的,資料本身帶有的社會偏見,模型多少會照單全收。這不是 Grok 獨有的問題,但值得每個使用者在拿到成品時多留意一眼,不要照單全收。另外,Grok 也提供一個名為「Spicy Mode」的 18 禁生成模式,是 xAI 產品線上比較特殊的差異化功能,本文不示範也不建議未成年使用者碰觸。

誰該關注這顆模型

如果你平常的工作牽涉到大量素材產出——電商圖卡、社群貼文配圖、行銷簡報封面、房仲物件示意圖——Grok Imagine 2.0 目前展現出來的「中文字精準」跟「局部精準編輯」這兩項能力,會直接降低你做這些素材的時間成本。以前得靠設計師手工模擬的截圖、菜單、電商 model 照,現在很多時候只要轉頭跟 AI 講一句話。這集示範的提示詞我們都整理在影片留言區,有興趣的話可以直接去取用,自己動手玩玩看。

想把這些方法帶進你的團隊?

無論是一場主題講座,或完整的 AI 導入規劃,歡迎與我們聊聊你的需求。

預約課程洽詢