AI 知識
什麼是 AI 即時虛擬人像?鏡頭裡會接話的臉,不一定是真人
你在螢幕上看到一個角色:你問問題,它聽完就接話,嘴型跟著聲音變,還會看你展示的東西。這可能不是事先錄好的影片,也不是另一端有人開著攝影機,而是AI 即時虛擬人像。
它和一般影片、聊天機器人差在哪?
一般影片只能播放錄好的內容;文字聊天機器人會回覆,卻未必有會隨對話改變的影像。即時虛擬人像則把語音對話和持續生成的畫面接在一起:它接收聲音或影像,依當下內容回話,口型與表情配合語音。你看到的是互動中的虛擬角色,不該把它誤認為某位真人正在線上。
Google 於 2026 年 9 月 24 日公布的 Gemini 3.8 Live with Live Avatar,是一個具體例子。Google 稱它能近即時聽、看、說,讓角色的口型、表情及輪流發言跟著對話變化,並支援跨 97 種語言調整口型與表情。這些是Google 對該產品的功能描述,不代表每個 AI 虛擬人像都有同樣能力,也不是「完全沒有延遲」或各語言效果一樣的保證。
「我的分身」和「虛擬角色」不是同一件事
虛擬角色可以是預設形象,不一定長得像任何真人。Google 公告提到預設角色庫,也提到可依參考圖打造客製角色;後者目前只對通過企業 allowlisting 的對象開放。把「有一個會說話的虛擬角色」直接說成「人人都能複製自己的臉」是不準確的,更不能據此認為可以未經本人同意複製他人肖像。
同樣要分清楚產品開放範圍。Google 公告寫的是 Gemini Enterprise 提供 Live Avatar,不等於一般 Gemini App 使用者已經可以直接使用或自由建立客製分身。看到示範影片時,先確認它是哪個產品、哪種帳戶與哪種開放條件。
看到會接話的臉,該問什麼?
假設一個虛構服務用 AI 角色回答問題,觀眾至少應能知道自己是在和 AI 互動。角色越流暢、越像有人在場,越不能只靠長相與表情猜測身分。可先問:這是 AI 還是真人?角色代表誰?它的回答能否另外核對? 這是觀看與設計互動時的判斷原則,不是說任何產品已替每句回答做了事實查核。
Google 說該產品產生的音訊與影片帶有 SynthID 不可見浮水印,提供辨識生成來源的線索。但浮水印不會替對話內容背書,也不能保證網路上每一段影片都可用同一方法判斷。來源、身分與回答是否正確,仍要分開看。
AI 即時虛擬人像最值得注意的不是「臉變得多像真人」,而是我們開始能跟螢幕裡的生成角色對話。先弄清楚它是什麼、開放給誰,以及它是不是在扮演真人,才不會把技術展示誤讀成已普及的功能。
奧微軟體開發企業社撰寫本篇 AI 知識文章;文中互動情境為虛構教學示例,非奧微客戶案例或服務能力承諾。查證日期:2026-09-29。想快速理解,可搭配本篇一分鐘圖解。
一手來源:Google 官方公告:Gemini 3.8 Live with Live Avatar(2026-09-24)。
配樂署名:"Carefree" Kevin MacLeod (incompetech.com),官方作品頁,依 Creative Commons Attribution 4.0 International 授權使用。本片配樂經剪輯、音量調整、淡入淡出及人聲優先混音。
回文章列表