企業導入生成式 AI 前進行資料分類與隱私判斷的概念插圖
企業導入生成式 AI 前,應先分類資料並確認適合的使用流程。

生成式 AI 資料隱私設定指南:資料能不能貼進 AI?企業導入前必做檢核

約 7 分鐘閱讀 更新:2026.09.10

30 秒快速摘要

企業導入生成式 AI 前,最重要的不是先挑模型,而是先決定「哪些資料可以進 AI」。本文用資料分類、用途、留存、外部傳輸與權限五個面向,說明如何檢查生成式 AI 資料隱私設定,避免把「不拿去訓練」誤解為「不會留存或不會外傳」。

生成式 AI 資料隱私設定的第一步,不是尋找某個看似安全的方案,而是先回答一個更具體的問題:這份資料是否適合送進這個帳號、這個工作區、這支 API,或這個已連接外部服務的對話?

「不會用於訓練模型」是重要條件,卻不是全部。資料仍可能涉及服務留存、濫用監控、組織管理、既有檔案權限,以及網路搜尋或第三方工具等額外傳輸路徑。企業應把這些問題拆開檢查,而不是以單一隱私承諾取代整體判斷。

先給結論:高敏感資料先視為不可直接貼入

生成式 AI 導入前的四級資料分類與處理原則資訊圖
資料分類應先於工具選擇;高敏感或受管制資料在完成審查前不應直接輸入未核准流程。

在沒有完成資料分類、核准服務範圍與權限檢查前,建議將下列資料列為不可直接貼入公開個人帳號、未核准工具或未知外部連線流程的內容:

  • 可直接識別客戶、員工、病患或其他個人的完整資料。
  • 未公開的合約、報價、投標內容、財務資料與商業策略。
  • 帳密、存取權杖、私密金鑰與其他驗證資訊。
  • 原始程式碼、系統架構、資安事件細節及弱點資訊。
  • 受產業規範、契約義務或公司保密規則限制的資料。

這不是說所有這類工作都不能使用 AI,而是應先將資料最小化、改用經公司核准的工作環境,並確認該工作流程中的訓練、留存、權限與外部接收方安排。僅刪除姓名,也不能直接視為已完成不可逆的去識別化。

一張導入前資料分類表:先決定可用行為

資料等級 常見內容 導入 AI 前的建議處理
公開 已公開的產品資訊、公開新聞、公開文件 仍應確認輸入內容正確,避免混入未公開補充資訊。
內部 內部流程草稿、一般工作筆記、未公開簡報 確認使用的是公司核准帳號或工作區,並依組織規則決定是否可輸入。
機密 客戶名單、合約、原始碼、報價、營運計畫 先檢查資料最小化、存取權限、留存與外部傳輸;未完成審核前不要直接提交。
高敏感/受管制 身分資料、健康資訊、驗證祕密、重大資安事件內容 預設禁止直接輸入;如有業務必要,應由法務、資安、資料治理與業務權責單位共同確認流程。

資料分類不是一次性的標籤工作。同一份文件可能同時含有公開段落、內部評論與客戶資料;實務上應只摘取完成遮罩或改寫後、確有必要送入 AI 的最小片段。

判斷資料能不能送進 AI:四個問題先問完

  1. 用途是什麼?是潤稿、摘要、程式協助、知識查詢,還是要讓工具存取整個文件庫?用途越廣,應檢查的資料範圍越大。
  2. 真的需要原文嗎?能否改用去除識別資訊的摘要、欄位名稱、虛構範例或局部片段?
  3. 內容是否仍可識別或可拼回?移除姓名不代表其餘欄位、情境或交叉資訊不會辨識出對象。
  4. 有哪些外部接收方?除了主要 AI 服務外,還要查看連接器、代理工具、外掛、瀏覽器擴充功能、API 應用與網路搜尋是否會接觸資料。

個人帳號、企業工作區與 API:不能用同一套想像

個人帳號、企業工作區與 API 的生成式 AI 資料檢查維度示意圖
同一供應商的不同使用方式,也可能有不同的資料路徑與管理方式。

生成式 AI 的資料處理,會隨產品表面、帳號類型、設定與串接方式而變化。即使同一供應商的服務,也不宜把聊天介面、企業工作區與 API 視為相同的資料路徑。

「不訓練」不等於「不留存」

OpenAI 表示,ChatGPT Business 的組織資料預設不用於訓練或改進模型。Google Workspace with Gemini 的說明也指出,提交內容不會用於訓練模型。

但這類承諾不能直接推論為資料完全不會保存、沒有組織層級的管理需求,或永遠不會傳送至其他服務。例如,OpenAI API 的資料控制文件指出,API 預設會產生濫用監控日誌,最長保留 30 天;在法律要求,或為保護服務或第三方免受傷害時,可能保留更久。

因此,採購或啟用前應分別確認:資料是否用於模型改進、提示與檔案保存多久、是否存在監控或稽核紀錄、誰可在組織內檢視紀錄,以及哪些功能會建立應用程式狀態。不要將任何服務的資料保留選項概括理解為所有端點與功能都不會留存狀態。

個人活動設定關閉後,仍要看留存說明

以 Gemini 個人帳號為例,關閉 Keep Activity 後,未來對話仍會與帳戶關聯保存最多 72 小時。這提醒使用者:活動或訓練相關設定的意義,必須搭配該服務對對話處理與留存的說明閱讀,不能自行推論為資料從此不再被處理或保存。

對員工而言,最安全的做法是先確認目前登入的是個人帳號、公司管理的工作區,還是內嵌於內部系統的 API 應用;三者的管理方式與資料路徑可能不同。

Claude 商用使用情境也要看例外

Anthropic 對商用聊天與程式設計工作階段的說明,原則上是不用於訓練模型;但參與 Development Partner Program、明確回報素材,或明確選擇加入時,可能構成例外。企業制定政策時,應將回饋、資料分享與參與計畫的行為獨立列入審查,不要只以「商用」二字作判斷。

生成式 AI 資料隱私設定:上線前必查的 6 個項目

  • 帳號與工作區:使用者是否在公司核准的身分與工作區內操作?是否有人以個人帳號處理公司資料?
  • 模型訓練用途:確認所用服務、帳號類型與資料分享選項,而非只看產品名稱。
  • 對話、檔案與日誌留存:分開看聊天紀錄、上傳檔案、API 濫用監控、應用程式狀態與稽核紀錄。
  • 回饋與分享:建立規則,避免員工把含敏感內容的對話以回饋、分享連結或其他方式送出。
  • 記憶與個人化:若服務提供記憶或個人化功能,應確認其是否適合處理工作資訊,以及組織內的使用界線。
  • 外部工具:逐一檢查第三方 GPT、Gem、agent、MCP server、外掛與瀏覽器擴充功能的現行條款與資料處理方式,不要以主要 AI 服務的設定替它們背書。

連接器、代理與網路搜尋:最容易漏掉的資料出口

生成式 AI 連接器、企業資料庫與網路搜尋的資料出口示意圖
檢查 AI 工作流程時,除了聊天輸入,也要確認可讀取的資料範圍與外部接收方。

AI 助理若能讀取雲端硬碟、郵件、知識庫或專案系統,風險不只在「你貼了什麼」,也在「它被允許讀到什麼」。連接器與代理工作流程應先確認可存取資料範圍、授權對象,以及輸出內容是否可能帶出不該顯示的資訊。

Microsoft Copilot 只能摘要或參照使用者已獲授權存取的內容。這項限制也代表,既有 SharePoint 與 OneDrive 的存取控制會影響 Copilot 可發現與參照的內容;購買企業方案不會自動修正原本過度分享的檔案或權限設計。

網路搜尋更應單獨看待。依Microsoft 的企業資料保護說明,Copilot 的網路搜尋查詢不同於 Microsoft Graph 查詢,會傳送至 Bing;提示會被濃縮為數個字詞,並移除使用者與租戶識別碼。即使如此,團隊仍應避免將機密句子直接寫成搜尋式提問,並在工作流程中界定何時可以啟用網路搜尋。

企業控制面:先修權限,再擴大 AI 使用

企業可把 AI 導入視為一次資料治理健檢。重點不是蒐集越多控制項越好,而是讓資料等級、存取權限與使用情境能對應起來。

  • 盤點誰能存取哪些文件庫、共享資料夾與知識庫,優先處理過度寬鬆的群組或連結分享。
  • 最小權限原則設計 AI 可讀取的資料範圍,並讓敏感度標籤與資料外洩防護規則反映實際分類。
  • 建立核准工具清單、可使用資料等級與禁止行為,讓員工知道何時要改用遮罩後內容或人工流程。
  • 規劃稽核與保留政策,讓資安、法務與資料所有人能在事件發生時釐清使用範圍。
  • 針對高風險流程先做小範圍測試,檢查提示注入、不正確授權與輸出含敏感資訊等情境。

資料疑似外洩時:先停用、再保全、後復盤

  1. 立即停止擴散:暫停相關帳號、連接器、分享連結或自動化流程,避免持續提交或讀取資料。
  2. 保全必要紀錄:保留可用的提示、輸出、時間、帳號、資料來源與存取紀錄,避免在未釐清前任意覆寫。
  3. 界定影響範圍:確認送出的資料內容、接收服務、是否啟用網路搜尋或第三方工具,以及可能受影響的對象。
  4. 依公司程序通報:交由資安、法務、資料保護與業務權責人員評估後續處置;受特定產業規範者,應另行確認適用的通報要求。
  5. 復盤並修正控制:檢討是資料分類、帳號使用、權限、工具核准或員工流程哪一環失效,將修正措施納入政策與教育訓練。

結語:先決定資料邊界,才能放心擴大 AI 效益

好的生成式 AI 資料隱私設定,不是一個開關,而是一套可重複執行的判斷流程:先分類資料,再確認必要性;接著分開檢查訓練用途、留存、外部傳輸與存取權限;最後以測試、稽核與事件處理流程持續修正。

只要把「資料能不能貼進 AI」變成每位員工都能理解的日常判斷,企業就能在維持效率的同時,降低把敏感資訊帶入不適當流程的風險。

Comments

No comments yet. Why don’t you start the discussion?

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *