拿到一份 AI 搜尋或 Deep Research 報告,看到段落後方附了引用、來源按鈕或一長串連結,最重要的判斷不是「它有沒有引用」,而是:這些原始頁面是否真的支持它寫下的結論?
這就是 Deep Research 事實查核的核心。引用是追溯線索,不是證據本身;AI 的摘要、推論與措辭,仍需要人回到原文核對。OpenAI 指出,ChatGPT 搜尋結果與引用可能不完整、過時或不正確;OpenAI 也表示,ChatGPT 可能產生捏造的引言、研究、引用,或指向不存在來源的參考資料。NIST 則將生成式 AI 自信呈現錯誤或虛假內容的現象稱為 confabulation,並指出這個問題特別關係到開放式長篇回應,以及高度脈絡或專業知識領域。
以下流程不要求你先成為某個領域的專家,而是協助你把 AI 報告變成一份可稽核的工作底稿:先找出它說了什麼,再確認原文到底說了什麼。
先記住:引用、證據與結論是三件不同的事
| 層次 | 你看到的是什麼 | 核查時要問的問題 |
|---|---|---|
| 主張 | AI 寫出的結論、數字、排名、日期或引言 | 這一句是否清楚、可被逐條驗證? |
| 引用 | 腳註、連結、Sources、相關來源 | 連結是否存在?是否是合適的來源? |
| 證據 | 來源原文中的段落、表格、文件、研究方法或資料期間 | 原文是否直接支持主張的每個關鍵部分? |
常見錯誤是把「有連結」直接等同於「內容是真的」。一個連結可能只提到相同關鍵字,沒有支持 AI 所下的結論;也可能頁面是真的,日期卻已不適用;甚至多個新聞頁面都只是轉述同一份公告或同一則初始報導。
因此,查核的單位不是整篇報告,而是一條可驗證的主張。例如,把「某項措施已經生效、影響範圍為 X、數值為 Y」拆成生效狀態、影響範圍、數值與時間點,再分別找原文支持。
開始研究前的防呆:先定義問題與證據邊界
很多查核困難不是出在最後,而是問題一開始沒有設定清楚。送出研究任務前,先把下列條件寫進提示詞或研究計畫:
- 研究問題:要回答的是事實、比較、歷史沿革,還是政策或產品現況?
- 時間範圍:你要的是某個日期以前的資料,還是目前有效的資訊?
- 適用範圍:主張適用於哪個國家、地區、機構或對象?不要把特定範圍的規則泛化。
- 證據標準:數字、規格、法規、生效狀態與直接引言,優先要求原始文件或權威機構資料。
- 來源清單:若主題有明確的一手來源,先列出官方網站、主管機關、原始研究發布單位或資料庫。
- 輸出格式:要求每項主張附上來源名稱、原文定位、發布或更新日期,以及不確定性說明。
ChatGPT Deep Research 會先提出研究計畫,使用者可在研究開始前檢閱與修改。若你只想讓研究使用特定網站或網域,也可在 Sites 中輸入網站或網域來限制來源。這些功能有助於縮小搜尋範圍,但它們是來源控制與報告審閱的輔助,不是人工核查的替代品。
Deep Research 事實查核 SOP:逐條從 AI 結論回到原文

以下流程可作為快速初篩與深入核對的共同骨架,不代表所有報告都能在固定時間內完成可靠查核。主張愈重要、愈專業或牽涉愈多條件,愈應保留足夠時間逐條確認。
- 圈出高風險主張:優先處理可能影響決策的數字、百分比、排名、日期、法律或規範狀態、產品規格、研究結論與直接引言。
- 把複句拆成小主張:避免只確認其中一部分,就誤以為整句成立。
- 開啟引用原文:不要只看搜尋摘要、網頁標題或 AI 顯示的摘錄。
- 定位支持位置:在頁面內找關鍵詞,確認具體段落、表格、頁碼或文件章節。
- 比對支持關係:原文是直接陳述、有限條件下的描述,還是只是背景提及?AI 有沒有把條件、省略語或不確定性拿掉?
- 檢查日期與版本:確認發布日、更新日、事件發生日與生效日沒有被混為一談;文件若有版本,也要確認引用的是哪一版。
- 判斷來源層級:對關鍵事實,優先回到發布資料的人、機構或原始研究,而不是只停留在轉述頁面。
- 追查來源譜系:若有多篇新聞或部落格寫同一件事,找出它們共同引用的原始公告、資料集、訪談或研究。
- 尋找反例與限制:用不同關鍵字、相反立場或限制條件搜尋,測試結論是否過度概括。
- 留下核查紀錄:標記「原文直接支持」、「部分支持」、「不支持」、「過時」、「無法開啟」或「仍待確認」,而不是只做真假二分。
怎樣才算「原文真的支持 AI 的結論」?
可用下面四個問題快速判斷:
- 主詞相同嗎?原文談的是同一個產品、機構、人群或地區嗎?
- 條件相同嗎?原文是否限定特定時間、版本、使用情境或範圍?
- 強度相同嗎?原文說「可能」、「部分」或「正在逐步推行」,AI 是否改寫成「一定」、「全部」或「已完成」?
- 數字相同嗎?百分比的母體、統計期間、單位與計算方式是否一致?
只要其中一項不一致,就不要把引用視為對整句結論的完整支持。較好的做法是改寫主張,使其符合原文的範圍與保留條件,或標示為仍待確認。
引用品質怎麼分級?先看它離事實有多近
| 來源層級 | 常見形式 | 適合核對的內容 | 注意事項 |
|---|---|---|---|
| 第一手官方或原始資料 | 官方公告、主管機關文件、原始研究、資料集、正式技術文件 | 政策內容、產品說明、原始數據、研究方法與正式立場 | 仍要看日期、版本、適用條件與原文措辭。 |
| 權威資料庫或機構資料 | 公開資料庫、專業組織或研究機構發布資料 | 可追溯的統計、文獻與機構性資料 | 確認資料期間、定義與更新狀態。 |
| 可靠二手報導 | 新聞採訪、專題報導、分析文章 | 事件脈絡、訪談、即時資訊線索 | 追查它引用的文件、受訪者或原始消息。 |
| 部落格與社群貼文 | 個人文章、貼文、討論串 | 線索、關鍵字、爭議點與待查問題 | 不宜只憑此類來源支撐高風險結論。 |
這不是一套保證真假的排名表。原始文件可能已過時,二手報導也可能提供尚未找到的脈絡;差別在於,對關鍵主張而言,愈接近原始證據,愈容易核對定義、日期、條件與完整語境。
看到很多新聞引用,不等於已完成交叉驗證
多個引用只代表報告列出多個頁面,不能單獨證明它們彼此獨立。要判斷是否只是轉載循環,可以做「來源譜系」檢查:
- 查看每篇文章的「來源指出」、「根據某報導」或連結出處。
- 記錄它引用的是官方公告、新聞通訊社、訪談、研究報告,還是另一篇媒體文章。
- 若多篇內容最後都回到同一則初始消息,將它們視為同一條證據鏈,而不是多條獨立證據。
- 回到最上游來源後,再核對原文是否真的包含 AI 所說的細節。
在編輯實務中,為高風險主張尋找獨立、合適的補充來源,是有用的核查 SOP;但本次核對的 OpenAI 與 NIST 文件並未訂定「至少一個」獨立第二來源的通用固定門檻。重點不在湊來源數量,而在於每一條證據的來源、獨立性與支持關係。
最常見的 AI 引用幻覺與失真模式
- 假連結或不存在的來源:連結無法開啟、頁面不存在,或來源資訊無法對應。
- 真連結,但不支持結論:頁面提到同一主題,卻沒有說出 AI 宣稱的數字、因果或結論。
- 過時資料:舊版文件、舊統計或已變動的狀態,被寫成目前資訊。
- 標題與內文不符:只根據標題下結論,沒有閱讀正文中的條件、例外或限制。
- 斷章取義:將原文的假設、引述他人觀點或保留語,改寫為作者的確定結論。
- 轉載循環:多個頁面看似很多來源,實際共同依賴同一則未被充分驗證的消息。
- 數字、單位或日期錯置:把不同母體的比例混用,或把公告日誤當事件發生日、生效日。
對於看似流暢、細節很多的長篇報告,反而應提高警覺。NIST 所稱的 confabulation 提醒我們:自信的表達方式不能取代可追溯的證據。
數字、引言、論文與產品資訊:最低限度核對哪些欄位?
數字、百分比與排名
- 數字的原始表格、圖表或資料頁在哪裡?
- 統計的對象與母體是誰?樣本、使用者、企業、地區還是其他定義?
- 資料期間是何時?是否被 AI 寫成現在式?
- 單位與計算方式是百分比、百分點、金額、估算值,還是排名名次?
- 排名是否說明評比範圍、方法與日期?
直接引言
- 找到引言的完整原文,而不是只看 AI 的引號。
- 確認說話者、發言場合、日期與前後文。
- 檢查 AI 是否刪除了「可能」、「如果」、「目前」等關鍵限定語。
論文與研究結論
- 確認研究標題、作者、版本與可辨識資訊。
- 定位摘要、方法、結果表格與限制段落。
- 分清楚研究測得的結果、作者的解釋,以及 AI 額外延伸出的推論。
產品規格、政策與規範
- 優先找正式說明頁、官方公告或主管機關文件。
- 確認產品或文件版本、更新日期與適用範圍。
- 分開記錄公告日、生效日、更新日與事件發生日,避免用單一日期涵蓋不同含義。
把 AI 當成反向稽核助手,而不是最後裁判
AI 可以協助整理大量文字、暴露缺口與產生反查方向,但輸出仍要回到原始頁面檢驗。以下提示詞可用於建立較容易人工核對的報告格式:
請先列出本報告所有可驗證主張,一條一列。每條請提供:1. 主張原句;2. 來源名稱與連結;3. 支持該主張的原文摘述或可定位段落;4. 來源類型;5. 發布或更新日期;6. 適用範圍、版本或條件;7. 證據強度與未確認之處。若來源沒有直接支持,請明確標示「未直接支持」,不要補推論。
完成初稿後,再做一次反向提問:
請以反證搜尋的方式檢查上述結論:列出可能相反的證據、例外條件、定義差異與可能過時之處。請把「來源提到主題」與「來源直接支持結論」分開標示;不確定時請說明不確定性。
這類提示詞不能保證輸出正確,但能促使報告把主張、來源與不確定性拆開,讓人工審閱不必只面對一段難以追溯的總結。
ChatGPT 與 Gemini 的來源控制功能,能幫什麼、不能幫什麼?

平台功能的價值,在於讓你更容易設定研究範圍與追查報告生成過程;其限制是,它們無法自動判定每個主張已經被原文充分證實。
ChatGPT Deep Research:先審研究計畫,再追溯來源
ChatGPT Deep Research 會在研究開始前提出研究計畫,使用者可以檢閱及修改。當研究題目只應依賴特定機構資料時,可利用 Sites 輸入網站或網域,限制研究只使用指定來源。完成輸出包含 citations 或 source links,並提供 sources used 區段與 activity history。
實務上,你可以在研究計畫階段補上日期、適用範圍、文件版本與來源清單;閱讀完成報告時,則從 sources used 與引用連結回到原文,檢查每項重要主張的支持關係。請注意,來源限制與引用顯示仍不等於結論已完成驗證。
Gemini Deep Research:設定來源後仍要逐頁確認
Gemini Deep Research 預設將 Google Search 納入研究來源;在選取其他來源時,可取消選取 Google Search,將研究限於其他已選取的來源。這有助於在你已具備合適資料來源時,減少不相關網頁進入研究範圍。
無論使用哪一種來源設定,仍應逐頁確認來源的日期、版本、內容與支持關係。實際可用功能請以你的介面與官方說明為準。
查核工具箱:把工具當成找線索的入口
- 官方網站站內搜尋:適合回找正式公告、說明文件、更新紀錄與政策頁面。
- 政府或監管資料庫:適合查核規範、登錄資料、正式統計與公開文件;核對時要保留資料期間與適用範圍。
- 學術資料庫:適合追溯論文版本、研究資訊與原始研究脈絡;不要只以標題或摘要推斷全部結論。
- 既有查核資料:可作為尋找待查線索的入口,但查不到結果不代表一項主張因此為真或為假。
查不到某個說法的結果,只表示你尚未透過目前使用的方法找到可用的查核線索,仍需回到原始資料、權威文件與具體語境繼續查證。
可複製的 AI 研究報告核查表

將以下欄位整理成一份逐條核對紀錄即可。每一列只放一項可驗證主張,會比保存整段 AI 回答更容易追蹤。
| 欄位 | 填寫方式 |
|---|---|
| 主張編號 | 例如 C-01,方便回查。 |
| AI 主張原句 | 原樣貼上,不先自行修飾。 |
| 主張類型 | 數字、日期、引言、研究結論、規格、政策或其他。 |
| AI 提供來源 | 記錄來源名稱與連結。 |
| 來源層級 | 原始官方或原始研究、資料庫、二手報導、部落格或社群等。 |
| 原文定位 | 段落、頁碼、章節、表格或可搜尋的關鍵句。 |
| 日期與版本 | 發布、更新、資料期間、生效或事件日期,依情況分欄。 |
| 支持關係 | 直接支持、部分支持、不支持、無法確認或過時。 |
| 限制與反證 | 記錄條件、例外、相反資料或待查問題。 |
| 發布決定 | 可使用、需改寫、需補證或不採用。 |
高風險主張發布前清單
只要內容涉及投資、健康、法規、選舉或其他可能造成重大影響的決策,不宜直接依賴 AI 報告作出判斷。至少先逐項確認:
- 我是否已看到原始來源,而不是只看 AI 摘要或搜尋摘要?
- 原文是否直接支持這個主張的主詞、範圍、日期與強度?
- 數字是否有清楚的母體、單位、資料期間與計算脈絡?
- 日期是公告、更新、生效還是事件發生的日期?
- 多個來源是否其實共用同一個上游消息?
- 是否存在原文中的限制、例外或反向證據沒有被納入?
- 若仍有不確定性,內容是否已改為保留表述,或暫不發布?
Deep Research 最有價值的用途,是加速你找到問題、整理候選來源與建立核查清單;最終可靠度仍取決於你是否逐條回到原文,確認證據、日期、條件與來源譜系。把「引用不是證據本身」變成固定習慣,才能讓 AI 研究真正成為可用、可審閱的工作流程。
延伸閱讀:OpenAI:Searching the web with ChatGPT、OpenAI:Does ChatGPT tell the truth?、OpenAI:Deep research in ChatGPT、Google:Use Deep Research in Gemini Apps、NIST Generative AI Profile。


Pingback: DeepSeek V4 Flash Vision Exp 權重可下載:168GB、305B、MIT 與 1M Context 重點