A Counter-Example
一小時寫完論文的
指令,錯在哪裡
從一份網路流傳的提示詞彙編出發,拆解通用型 AI 用在學術研究上的結構性風險。
研究者基地|deck.researcher.tw
Vista
研究者基地主理人|學術 AI 工作流講師
長期在校院與研究機構教 AI 怎麼進研究流程,也教它什麼時候該被擋在門外。主張工具會換,判斷不會,所以課上花最多時間的不是操作,是驗證。
今天走五段路
前兩段拆一份反例,中間一段看真實代價,後兩段動手練,最後給一套能帶走的流程。
這不是一堂反 AI 的課
我每天都在用 AI 做研究。今天要處理的不是該不該用,而是一個更具體的問題:同樣一個工具,為什麼放在某些位置會讓研究變快,放在另一些位置會讓你被撤稿。
我們要找的不是禁令,是位置。
一份流傳很廣的講義
它看起來很實用,這正是它值得被拆開的原因。
你大概在某個群組裡收過它
- 形式四頁 PDF 或一疊擷圖,標題承諾用一小時寫完一篇論文。
- 內容九組編號的提示詞,每一組配一個填空範本與一個示範例句。
- 涵蓋從選題、找理論、列大綱、寫文獻回顧,一路到潤稿與致謝。
- 來源沒有作者署名、沒有日期、沒有出處,轉寄到你手上時已經過了很多手。
- 傳播在研究生社團、實驗室群組與短影音裡反覆出現,幾乎是同一份。
為了避免著作權爭議,今天全程只重述它的架構與主張,不重製它的原文,也不會標任何人名。
問題不在那九條,
在標題那一行
一小時寫完論文。這句話要成立,只有一種可能:論文是一份文件,寫完就是把每個章節的空格填滿。
但論文不是文件,是一個需要被辯護的主張。
用我自己的話,把那九組歸成三類
歸類的目的是讓你看見它們的共通結構,不是為了複述原文。
要 AI 提供事實
三組
推薦參考文獻並附書目欄位、推薦可用的研究理論並附出處、依摘要代寫文獻回顧。
要 AI 替你決定方向
三組
給我十個題目、幫我擬一份章節大綱、幫我想論文整體該怎麼優化。
要 AI 動你已經寫好的字
三組
潤飾這段文字、優化這個句子、依我給的名單寫一段致謝。
三類的風險完全不同,但那份講義把它們並列編號,讀起來像是同一種東西。這是它最大的設計缺陷。
它為什麼騙得過那麼多人
它做對的地方
- 結構完整。九組指令蓋住論文的每一個章節,看起來沒有漏。
- 可直接複製。每組都有填空範本,不用自己想怎麼問。
- 有示範。附上例句,降低第一次使用的門檻。
- 回應真實焦慮。寫不出來是真的,deadline 也是真的。
它藏起來的地方
- 沒有任何一條處理驗證。拿到輸出之後要做什麼,全篇沒寫。
- 沒有任何一條處理證據。你的資料、你的訪談、你的實驗數據都不在流程裡。
- 沒有任何一條處理揭露。投稿時要怎麼說明,隻字未提。
- 沒有任何一條問你想講什麼。它假設你已經有結論了。
論文被退的原因,它一條都沒碰到
左邊是那份講義處理的層次,右邊是審稿意見實際會出現的層次。
講義處理的層次
›
斷層
›
審稿人真正問的層次
把左邊做到滿分,右邊一題都不會自動變好。那份講義加速的是表層,卡住你的是深層。
一個容易被忽略的訊號:它自己的品質
- 掃描辨識沒校對內文出現大量光學辨識殘留的錯字,人名、專有名詞與關鍵動詞都有缺漏。
- 示範例句自相矛盾用來示範潤稿的那段原文,本身就是一段沒讀通的機器翻譯。
- 章節編號對不上目次列了十一項,正文只寫到九項,後兩項憑空消失。
- 術語停在舊版本通篇假設模型不會連網、不會讀檔、只能單輪對話。
- 沒有任何版本資訊沒有日期、沒有作者、沒有修訂紀錄,無法判斷它適用於哪一代工具。
這些不是吹毛求疵。一份沒有人實際跑過一遍的教材,你沒有理由拿自己的論文去試。
它的做法停在三年前
| 面向 | 那份講義的做法 | 現在該有的做法 |
|---|---|---|
| 對話輪次 | 寫一段長指令,收一份成品 | 多輪往返,每一輪都帶進新的證據 |
| 角色設定 | 先命令模型扮演某某專家 | 直接給任務與判斷標準,角色扮演的邊際效益已經很低 |
| 資料來源 | 靠模型記得的內容 | 接上自己查證過的文獻庫與真實索引 |
| 輸入材料 | 只餵標題與摘要 | 餵全文、餵原始資料、餵逐字稿 |
| 模型定位 | 寫手 | 審稿人、反方、檢查者 |
| 輸出處理 | 拿到就用 | 逐筆查證,留下可回溯的紀錄 |
它加速的是「寫出來」
卡住你的是「想清楚」
如果你已經知道自己要主張什麼、證據在哪裡、反方會怎麼打,那份講義裡有幾條確實能幫你省下時間。問題是,會去找那份講義的人,通常正好卡在前面那三件事。
所以它在最需要幫忙的地方,剛好什麼都沒給。
三個可遷移的判斷標準
今天真正要你帶走的不是那九條哪條爛,是這三個問題。
記住哪一條爛,
下個月就會過期
明年會有新的指令彙編在群組裡流傳,換了封面、換了排版、換了模型名稱。如果今天只教你這九條的毛病,那份新的你依然檢查不出來。
所以我們練的是判斷標準,不是答案。
判斷標準一:它要 AI 產出可查證的事實宣稱嗎
如果答案是要,這件事就不能用生成來做,只能用檢索加驗證來做。
屬於事實宣稱
- 書目資料。作者、篇名、年份、期刊、卷期、頁碼、數位物件識別碼。
- 理論出處。誰在哪一年、哪一本書裡提出這個概念。
- 統計數字。盛行率、樣本數、效果量、引用次數。
- 法規與條文。條號、版本、生效日期。
- 引述。某人說過的那句話,一字不差。
不屬於事實宣稱
- 改寫。把你已經寫好的句子換一種說法。
- 提問。針對你的草稿列出可能的反駁。
- 分類。把你提供的二十篇文獻按主題分組。
- 檢查。指出你這段論證裡沒有被證據支撐的那一句。
- 格式。把你提供的正確欄位排成指定引用格式。
那份講義最危險的一條,
是叫 AI 推薦文獻並附上書目欄位
它要模型交出標題、作者、出版年份、摘要與關鍵詞。這五個欄位全部都是可查證的事實宣稱,也全部都是語言模型最擅長編得像真的的東西。
同樣踩線的還有另外兩條:推薦研究理論並附出處、依摘要代寫文獻回顧。
判斷標準二:輸入的層級,撐得起輸出的層級嗎
當要求的輸出比提供的輸入高一層,中間那一層就是模型自己補的。
| 你給的輸入 | 你要的輸出 | 中間被補掉的是 | 判定 |
|---|---|---|---|
| 二十篇摘要 | 一份文獻回顧 | 各研究的樣本、測量、分析與結果分歧 | 不成立 |
| 一個主題關鍵詞 | 十個研究題目 | 研究缺口、可行性、你的場域可近性 | 不成立 |
| 章節標題 | 一段完整論述 | 你的資料與你的主張 | 不成立 |
| 二十篇全文 | 一張研究設計對照表 | 沒有,全部都在輸入裡 | 成立 |
| 你寫好的一段 | 改寫版本與修改理由 | 沒有,原意由你把關 | 成立 |
| 你的訪談逐字稿 | 初步編碼建議 | 沒有,但編碼決定權仍在你 | 成立 |
為什麼摘要永遠撐不起文獻回顧
摘要裡有什麼
研究目的、一句話方法、主要結論、幾個關鍵詞。這是一份給人決定要不要點開全文的廣告。
它的功能是吸引閱讀,不是承載證據。
文獻回顧需要什麼
各研究的樣本從哪裡來、變項怎麼測量、用什麼分析、控制了什麼、結果彼此在哪裡打架、為什麼打架。
這些資訊全部只存在於方法與結果兩節,摘要一個字都沒提。
所以用摘要餵出來的產物,一定是文獻堆疊而不是文獻對話。它會把每篇講一遍,但說不出來誰反駁了誰。
更麻煩的是,這個流程會讓你系統性地引用自己沒讀過的東西,而這在多數學校的學術倫理規範裡站不住腳。
判斷標準三:它要 AI 替你思考,還是替你檢查你的思考
同一個模型、同一個主題,只差在動詞,責任歸屬就完全不同。
替你思考(判斷權交出去)
- 給我十個研究題目
- 幫我選一個適合的理論
- 幫我寫這一節
- 告訴我這個結果代表什麼
- 幫我決定要不要投這本期刊
替你檢查(判斷權留下來)
- 論證我這個題目為什麼不值得做
- 這個理論解釋不了我資料裡的哪一塊
- 指出這一節哪一句沒有證據支撐
- 列出這個結果的三種替代解釋
- 用這本期刊的審稿標準挑我的毛病
右邊那五句,你依然要自己做決定。差別在於你做決定之前,多看到了一輪反方。
口試委員問的不是
「你怎麼得到這個答案」
他問的是「你為什麼認為這個答案是對的」。第一個問題可以外包,第二個問題不行。如果你的方向是模型選的、理論是模型挑的、詮釋是模型給的,那第二個問題你一句都答不出來。
能外包的是勞動,不能外包的是為結果負責的能力。
拿到任何一條指令,照這個順序問
從這裡開始
三關任何一關沒過,都不代表不能用 AI,只代表這條指令要改寫。後面第四章會練怎麼改。
那九組,各自踩中哪一關
課堂做法:把九組打散發給各組,讓他們自己對號入座,比講二十分鐘有效。
代寫文獻回顧
刪 · 判斷標準二
只餵摘要,撐不起回顧需要的方法層資訊。
推薦參考文獻
刪 · 判斷標準一
要求模型生成可查證的書目欄位,風險最高的一條。
推薦研究理論
改 · 判斷標準一
理論名稱多半對,出處與核心主張常張冠李戴。
給我十個題目
改 · 判斷標準三
會得到十個像題目的片語,沒有研究缺口。
擬論文大綱
改 · 判斷標準二
回你一份通用章節範本,不是你這篇的骨架。
整體優化提問
改 · 判斷標準三
問法太空泛,與選題那條高度重複。
潤飾修改
留 · 三關皆過
原意由你把關,是全篇真正省時間的一條。
句子層優化
留 · 三關皆過
要求附上修改理由,可直接檢查它改得對不對。
代寫致謝
留 · 無風險
零風險也幾乎零價值,而這段本來就該親手寫。
九條裡,只有三條該原樣留下
而那三條全部屬於同一類:動你已經寫好的字。這不是巧合。凡是你已經產出、你看得懂、你能當場判斷對錯的東西,交給 AI 處理都相對安全。
安全與否,看的不是任務難度,是你能不能當場驗證。
已經有人付出代價
接下來的每一個案例都有公開紀錄可查,不是假設。
幻覺不是故障,是這個工具的運作方式
這也是為什麼再怎麼提醒它「不要編造」都沒有用:編造不是它違反指令,是它完成指令的方式。
這個比例高到會嚇到人
模型生成的文獻回顧裡,參考文獻是捏造的比例。
早期模型GPT-3.5 世代
55%
次世代模型GPT-4 世代
近 2 成
模型換新確實會降低比例,但降到近兩成不等於可以不查。五筆引用裡有一筆是假的,放在一本論文的參考文獻清單上,仍然是撤稿等級的風險。
數據引自研究者基地〈研究生該怎麼用 AI 才不踩線〉一文所整理的實測研究:https://researcher.tw/articles/grad-students-use-ai/
一本學術倫理期刊,自己刊出了假引用
19/29
參考文獻查無實據
29 筆參考文獻裡,至少 19 筆被查出是捏造的。
18
個連結點開是空的
附上的學術搜尋連結,點進去查無該篇。
1
個被省略的動作
作者不是不懂倫理,是少做了逐筆查證。
出事的期刊是 Springer Nature 旗下的《Journal of Academic Ethics》,由學術誠信追蹤網站 Retraction Watch 於 2025 年 12 月揭露。黑色幽默的地方在於,這是一本專門討論學術倫理的期刊。
https://retractionwatch.com/2025/12/02/fake-references-chatgpt-journal-academic-ethics-springer-nature-whistleblowing/
Certainly, here is a possible
introduction for your topic
這是一篇 2024 年 3 月發表於 Elsevier 旗下《Surfaces and Interfaces》的鋰金屬電池論文,引言的第一句話。它不是研究背景,是聊天機器人回答問題時的制式開場白。
作者把整段輸出複製貼上,連招呼語都沒刪,一路通過同儕審查正式刊出,直到讀者發現。
同年五月底,這篇論文正式撤稿
官方撤稿聲明列出兩個理由,順序值得注意。
重複發表
論文的圖一與圖二,跟同一批作者幾乎同時投到另一本期刊的論文幾乎一模一樣。期刊調查後認定為刻意分投,時間點挑得很接近。
使用生成式 AI 卻未揭露
才輪到那句留在引言裡的開場白。出版商的政策其實寫得很清楚:只要投稿時揭露,用模型協助草稿寫作是可以的。
請注意這個順序傳達的訊息:真正致命的從來不是「用了 AI」,是「用了卻不說」,以及底下那些原本就存在的研究誠信問題。
撤稿聲明:https://www.sciencedirect.com/science/article/pii/S2468023024007077
一句這麼突兀的話,
怎麼會沒有人發現
從投稿、同儕審查、編輯核稿到排版印出,理論上至少有好幾雙眼睛經過那段引言。它卻一路過關。最合理的解釋只有一個:整個流程裡,可能沒有任何一個人真的把這篇論文從頭到尾讀完。
包括作者自己在內。
這件事離你沒有那麼遠
- 香港大學2025 年 11 月,某學者與博士生合著的人口學論文被揭發大量引用 AI 虛構的幽靈文獻,校方介入調查並於 12 月公布懲處結果。
- 臺灣據報導,有學者發現碩士論文引用了他根本沒有寫過的著作。被冒名的不只是文獻,還有真實存在的研究者。
- 共同點這些人都不是想造假。他們只是把該自己扛的那個判斷,外包給了模型。
請特別記住第二條。你引用一篇不存在的文獻,傷害的不只是自己的論文,還有那位被掛上假著作的研究者。
規模比想像中大
2024 年發表論文帶有 AI 協助寫作痕跡
13.5%
部分領域比例最高者
約 4 成
這份研究追蹤了超過 1,500 萬篇 PubMed 摘要。另外有一套名為「問題論文篩檢器」的系統,專門搜尋正常研究者不可能寫出來的句子,至今掃過超過 1.6 億篇論文,光靠它就讓 3,000 多篇正式撤稿。
留下痕跡不等於造假,這個數字本身不是罪證。但它說明一件事:檢測方已經在大規模掃描了。
AI 只是加速器,
而不是引火物。
真正的引火物,是不發表就淘汰的升等壓力。問題從來不是 AI 本身,是那套逼人一定要生出論文的評鑑制度,讓一些人把最後一道把關的責任也外包給了機器。
Ivan Oransky|Retraction Watch 共同創辦人,引自《化學與工程新聞》報導
最誠實的一種出錯:腳註直接貼對話連結
實際發生的事
- 正式文件的腳註裡,出處寫的是一個 AI 對話的分享連結。
- 連結沒有清理,模型版本與對話建立時間都留在網址裡。
- 它以「參見某某現況」的語氣被寫進正文,讀起來像是引用了一份權威資料。
為什麼這比假書目更值得討論
- 假書目是被模型騙了,這個是自己知道出處是對話,還是放上去了。
- 它暴露的是一個更普遍的習慣:把 AI 的回答當成可以引用的來源。
- 你的文獻回顧裡,可能藏著同一種偷懶,只是沒有留下連結這麼明顯的證據。
案例與三個自檢問題出自:https://researcher.tw/articles/dont-copy-ai-citations/
「可是它現在會連網搜尋了」
會連網確實降低了風險,但沒有解決結構問題。
- 抓錯東西它抓的是一般網頁:新聞稿、部落格、內容農場的轉述,不是書目資料庫的結構化欄位。
- 過程黑箱你看不到它下了什麼檢索式、檢索了哪些來源、排除了什麼,所以無法重現,也無法在方法一節交代。
- 沒有驗證迴圈它不會回頭確認自己抓到的那筆資料是否真的支持它接下來寫的那句話。
- 覆蓋率不明你不知道它漏掉了什麼。文獻回顧最怕的不是找錯,是不知道自己漏了整個學派。
- 行為不穩定同一句話問兩次,它可能一次連網、一次直接從記憶回答,而你分不出來是哪一次。
延伸閱讀:https://researcher.tw/articles/ai-agent-literature-search/
進階陷阱:
那個編號是真的,論文卻是別篇
很多人學會了查數位物件識別碼,於是養成一個新習慣:看到有編號、點得開,就當作查證完畢。但模型有時候會給你一個格式完全正確、也真的存在的編號,只是它指向的是另外一篇文章。
所以不能只確認編號存不存在,要確認它對應到的,是不是你要引的那一篇。
通用型聊天機器人缺的四件事
這四件事都不是加一句提示詞就能補上的,它們屬於系統設計,不屬於用法。
權威索引
沒有接上正式書目資料庫,就沒有辦法保證每一筆都真的存在。
驗證迴圈
沒有一道回頭檢查的程序,錯誤不會在流程內被攔下來。
可追溯紀錄
檢索式、來源、篩選條件都留不下來,方法一節寫不出來。
可重現性
同一個問題問兩次結果不同,這在研究上是致命的。
這四件事恰好就是學術檢索工具存在的理由。所以問題不是「聊天機器人不好」,是你拿榔頭在鎖螺絲。
同一件事,兩種工具的差別
| 面向 | 通用型聊天機器人 | 學術索引與文獻工具 |
|---|---|---|
| 資料來源 | 訓練資料加一般網頁 | 正式書目資料庫的結構化紀錄 |
| 每筆是否真實存在 | 不保證 | 保證 |
| 檢索式可否交代 | 看不到 | 可完整複製到方法一節 |
| 同題重問結果 | 可能不同 | 一致 |
| 覆蓋率 | 未知 | 可查收錄範圍 |
| 它真正擅長的 | 改寫、分類、比較、挑毛病 | 找齊、查準、追引文網絡 |
正確的組合不是二選一,是檢索與驗證交給索引,思辨與改寫交給模型。第五章會把這條動線走一遍。
揭露不是道德加分題,是投稿欄位
普遍被接受
語言潤飾、文法修正、格式排版。多數期刊視為工具使用,通常仍要求說明。
灰色地帶
協助起草段落、整理架構、翻譯。可以用,但必須揭露,且內容由你重寫並負責。
紅線
生成引用、代寫實質內容而不揭露、把模型列為作者、用它產生未實際執行的資料。
那份講義裡的代寫文獻回顧與生成參考文獻兩條,同時落在灰色地帶與紅線上,而它全篇沒有提過揭露這兩個字。
揭露怎麼寫、六道倫理自檢:https://researcher.tw/articles/ai-disclosure-ethics/
四條紅線,記起來就好
- 不引用沒讀過的文獻沒有點開原文、沒有確認它真的說了那句話之前,那筆引用還停在線索階段。
- 不讓模型產生資料訪談內容、實驗數值、問卷回應,一個字都不能是生成的。
- 不把判斷外包研究問題、方法選擇、結果詮釋,這三件事必須由你決定並能為它辯護。
- 不隱瞞使用依所投期刊或所屬學校的規定據實揭露,不確定就問,不要自己猜。
這四條之外的事情,大多可以放心用。紅線的意義不是限制範圍,是讓你在剩下的範圍裡放手。
所有案例的失敗點,
都在同一個位置
不是模型太笨,不是提示詞不夠好,也不是用了 AI。是輸出到送出之間,那道本來應該有人把關的程序,被省掉了。省下來的通常只有幾十分鐘。
AI 產出的是草稿,不是成品。這句話是整場的分水嶺。
四題演練
每題先自己判一次,下一頁給提示,再下一頁給解答。
怎麼練
四題的難度是遞增的。第一題最多人答錯,而且錯的方式幾乎一模一樣。
演練一|題目
以下四筆是 AI 給的參考文獻,哪幾筆有問題
- 1Halvorsen, P., & Ruiz, M. (2021). Self-regulation and motivation in remote learning contexts. Journal of Educational Psychology, 113(4), 200-220.頁碼 200-220|卷期 113(4)
- 2Okonjo, B. (2023). The effect of blended learning on undergraduate engagement. International Journal of Marine Biology, 47(2), 88-104.頁碼 88-104|卷期 47(2)
- 3Stelling, A. (2022). Interaction design and learning outcomes in digital platforms. Retrieved from an AI chat share link.出處為一段對話視窗,非期刊或出版單位
- 4陳怡君、王大維(2020)。線上課程中的同儕互評機制研究。教育科技研究,18(3),45-67。頁碼 45-67|卷期 18(3)
以上四筆均為教學用虛構範例,人名、刊名與頁碼皆為杜撰,請勿引用。
提示:先別回答哪幾筆,
先回答你用什麼方法判斷
如果你的方法是「看哪一筆長得比較怪」,那你已經掉進去了。第三章講過,模型正是被訓練成讓輸出看起來完全合乎慣例。
請重新問一次:這一頁上的資訊,足夠讓你斷定任何一筆嗎?
演練一|解答
正確答案是:光看這一頁,一筆都不能斷定
但四筆的處理方式並不相同。差別在於「需不需要查」以及「查證的優先順序」。
- 3出處是一段對話視窗,不是可查證的期刊、機構或出版品。直接出局,不需要查。它從來就不是一筆引用。
- 2主題是混成學習,刊名卻是海洋生物學期刊。領域錯配是最容易被眼睛抓到的訊號。高度可疑,但仍然要查才能下結論。
- 1刊名、卷期與主題完全相符,頁碼區間合理,作者姓氏組合正常。看不出問題,所以更要查。
- 4中文書目,格式正確,欄位齊全,讀起來毫無破綻。看不出問題,所以更要查。
大多數人會回答「第二筆和第三筆有問題」,然後就停下來。真正的陷阱是第一筆和第四筆:它們最像真的,所以最不會被查。
下筆之前,對每一筆引用問三個問題
- 點得開原文嗎不是點得開某個連結,是點得開一份真的存在、有作者、有出版單位或期刊的文獻本身。
- 出處是機構還是對話如果是一段對話視窗,它就不該以「參見某某現況」的語氣被寫進正文或腳註。它最多只能是你動手查證前的起點。
- 拿掉「AI 說的」還能證明嗎如果不能用別的方式證明這句話是真的,這句話現在還不能出現在你的論文裡。
三題只要有一題答不出來,這筆引用就還停在線索階段。查文獻可以偷快,不能偷查證。
三問出自:https://researcher.tw/articles/dont-copy-ai-citations/
演練二|題目
這條指令踩中第二章的哪幾關
// 一則在研究生社團裡被轉貼很多次的寫法 你是一位資深的教育心理學教授。 我的研究方向是數位學習動機,但還沒有具體的研究問題。 請推薦 8 篇近五年最重要的相關文獻, 附上作者、年份、期刊名稱、卷期頁碼與摘要, 並根據這些文獻幫我寫一段 800 字的文獻回顧, 最後再給我 10 個可以發展的研究題目。
它讀起來很有效率:一次把找文獻、寫回顧、想題目三件事都交代完了。請找出它踩中幾關,以及分別是哪幾關。
提示:把它拆成三個獨立要求
這條指令其實同時下了三個訂單。逐一問:這個訂單要的是事實還是判斷?你給了什麼材料?做決定的人是誰?
另外注意開頭那句角色設定。它在這裡到底起了什麼作用?
演練二|解答
三關全中,而且是同一條指令裡
| 它要求的 | 踩中 | 為什麼 |
|---|---|---|
| 推薦 8 篇文獻附書目欄位 | 判斷標準一 | 作者、年份、期刊、卷期頁碼全部是可查證的事實宣稱,不能用生成取得。 |
| 寫一段 800 字文獻回顧 | 判斷標準二 | 你一份全文都沒給,輸入是零,輸出要 800 字,中間整段都是模型補的。 |
| 給 10 個研究題目 | 判斷標準三 | 研究問題的收斂是你的工作。它不知道你的場域、時間與可近性。 |
| 「近五年最重要的」 | 附帶問題 | 重要由誰認定沒有交代,模型會用自己的偏好回答,而你看不到那個偏好。 |
| 「你是一位資深教授」 | 無效但無害 | 角色設定對新一代模型的邊際效益已經很低。它不會因此變得比較誠實。 |
這條指令的效率是假的。它一次省下三段工,但三段工的結果你一段都不能用。
演練三|題目
假設這四筆引用都查證過了,這段還有什麼問題
某篇論文的文獻回顧片段
關於數位學習動機,已有不少研究。Halvorsen 與 Ruiz(2021)指出自我調節能力會影響遠距學習的動機。此外,Okonjo(2023)發現混成學習能提升大學生的投入度。另外,Stelling(2022)認為互動設計是影響學習成效的關鍵因素。陳怡君與王大維(2020)則探討了同儕互評機制的作用。綜上所述,數位學習動機受到多重因素影響,值得進一步研究。
先排除引用真偽的問題。假設這四筆全部真實存在、也都確實說了這些話,這一段仍然過不了審稿。為什麼?
段落與引用皆為教學用虛構範例。
提示:數一數連接詞
把每一句之間的轉折詞圈出來,看它們表達的是什麼關係。然後問一個問題:這四位研究者之間,有沒有任何一組人意見不合?
如果全部都同意,那這個領域為什麼還需要你這篇論文?
演練三|解答
這是文獻堆疊,不是文獻對話
這一段實際做的事
- 一句一篇。四句話對應四篇文獻,順序可以任意對調而不影響閱讀。
- 轉折詞全是並列。此外、另外、則,表達的都是「還有一個」,不是任何邏輯關係。
- 沒有任何比較。沒說誰的樣本更大、誰的測量更嚴謹、誰的結論適用範圍更廣。
- 沒有任何分歧。四個人全部同意,於是讀不出這個領域在爭什麼。
- 結論是空的。受到多重因素影響、值得進一步研究,這兩句放在任何主題上都成立。
文獻對話該長什麼樣
- 先分群。這四篇分別站在哪兩三個立場上,而不是依時間排隊。
- 指出衝突。A 的結論在 B 的樣本上不成立,可能的原因是測量工具不同。
- 評價方法。誰的設計能支撐因果推論,誰只能談相關。
- 收束到缺口。因為上述分歧尚未解決,所以本研究要處理的是哪一塊。
- 缺口要接得上你的方法。你的研究設計必須正好是用來處理那個缺口的。
回到判斷標準二:這段之所以只能堆疊,是因為寫的時候手上只有摘要層級的資訊。比較、分歧與方法評價,全部藏在方法與結果兩節裡。
演練四|題目
把這條生成型指令,改寫成批判型
// 目標:我想確認我的研究題目站不站得住腳 我的研究題目是「社群媒體使用與大學生學業倦怠的關聯」。 請幫我評估這個題目好不好, 並給我一些改進的建議。
這條指令沒有踩判斷標準一,也沒有明顯踩判斷標準二。它只踩了判斷標準三,而且踩得很隱蔽。
請寫出改寫後的版本。提示:問題不在它問了什麼,在它把哪一個角色分給了模型。
演練四|解答
問題在於,你請它當啦啦隊
// 同一個目標,換一個角色分配 我的研究題目是「社群媒體使用與大學生學業倦怠的關聯」。 請扮演這個領域最嚴苛的審稿人,只挑毛病,不要改寫,不要稱讚。 依序回答四件事: 1. 這個題目最可能被質疑「已經有人做過」的三個理由 2. 因果方向反過來的可能性,以及我要怎麼排除 3. 至少兩個我沒控制、但足以解釋這個關聯的變項 4. 如果結果不顯著,這篇論文還剩下什麼貢獻
改寫前那句「評估好不好」,實際上是在邀請模型附和你。而模型的預設行為,正好就是附和。你會拿到一份讀起來很受用、但完全沒有壓力測試過的回覆。
改寫的四個通用動作
- 換動詞把「幫我寫、幫我選、幫我評估」換成「挑毛病、列反證、指出沒有證據支撐的那一句」。
- 禁止稱讚明確寫出不要改寫、不要稱讚。不寫這句,它一定會先誇你三行。
- 指定題數與面向要三個理由、兩個變項。開放式提問會換回一堆四平八穩的場面話。
- 留一題給最壞情況「如果結果不顯著怎麼辦」這種問題,能提早半年救你一次。
這四個動作可以套用在任何階段:題目、方法、結果詮釋、投稿前自審。唯一不變的是,最後做決定的人始終是你。
更完整的外包判斷與反方審稿人提示詞:https://researcher.tw/articles/claude-thesis-writing/
你剛才用的,就是那三個判斷標準
演練一
四筆書目
判斷標準一
事實宣稱不能生成,只能逐筆查證。最像真的那幾筆風險最高。
演練二
三合一指令
三關全中
效率是假的,因為三段產出你一段都不能直接用。
演練三
回顧片段
判斷標準二
輸入只有摘要層級,所以寫出來必然是堆疊。
演練四
題目自檢
判斷標準三
換掉動詞就換掉角色,判斷權因此留在你手上。
下次在群組裡收到新的指令彙編,不必逐條研究。三個問題問下去,大概五分鐘就知道哪幾條該刪。
回去之後,先做這一件事
如果十筆全對,恭喜,你的流程沒有破洞。如果有一筆對不上,那代表清單上其他每一筆都需要重查一次。
最像真的那一筆,
就是最危險的那一筆
四題演練的共同結構是這個:容易被抓到的錯誤其實傷害有限,因為它會被抓到。真正會讓你出事的,是那些通過了所有目測、所有直覺、所有「看起來沒問題」的東西。
所以流程不能靠感覺,要靠程序。
那,到底該怎麼做
不是換一個工具,是換一個位置。
一套能用的系統有四層
那份講義只做了第三層,而且跳過了第一層。
資料層
材料從哪裡來
真實索引檢索、文獻庫、你自己的原始資料與逐字稿。
提問層
怎麼問
脈絡、任務、限制、格式四件事講清楚,不靠角色扮演。
輸出層
產出什麼
摘要、分類、比較、研究卡片、反方意見、草稿。
判斷層
誰負責
查證、取捨、詮釋、為結果辯護。這一層永遠是你。
少了判斷層,前面三層只會讓你更快產出錯誤內容。這也是為什麼工具越強,這一層越不能省。
四層架構出自:https://researcher.tw/articles/ai-academic-research-copilot-system/
找文獻的完整動線
從研究問題出發,不是從關鍵詞出發
注意 AI 進場的位置:它在倒數第二步才出現,而且它拿到的是你已經查證過、讀過的材料。
檢索與驗證,該去哪裡
找齊
真實索引檢索
OpenAlex、Semantic Scholar、Scopus、Web of Science、各領域專門資料庫。有收錄範圍、有結構化欄位、檢索式可複製。
找全
引文網絡
Research Rabbit、Connected Papers 這類工具,用被引與共被引補上關鍵詞搜尋的結構性盲區。
查準
書目驗證
Crossref 查識別碼、出版商頁面查卷期頁碼、Zotero 從正式頁面保存完整欄位。
這三件事都不該交給聊天機器人,因為它們要的正好是可重現、可交代、可查收錄範圍,而那是索引的專長。
依研究流程七階段整理的工具清單:https://researcher.tw/resources/
每一筆引用進稿之前,過這五關
- 存在這份文獻真的存在,而且我點開了原文本身,不是點開一個搜尋結果頁。
- 對應識別碼指向的就是這一篇。編號是真的不代表它對應到你要引的那一篇。
- 欄位作者、年份、篇名、期刊、卷期、頁碼逐項對過,不是只看起來差不多。
- 語意它真的說了我以為它說的那句話,而且語氣與適用範圍我沒有放大。
- 必要我引用它,是因為論證需要它,不是因為清單看起來太短。
第四關最常被跳過。很多假引用其實是真文獻,只是它根本沒講過你寫的那句話。
一個可以重複用的提問骨架
// 脈絡:你是誰、做什麼、走到哪一步 我是○○領域碩士生,研究問題是○○, 目前手上有已查證並讀過的 12 篇全文,已附在下方。 // 任務:動詞要是檢查型的 請把這 12 篇依立場分群,指出彼此衝突的結論, 並說明衝突可能來自樣本、測量還是分析方法的差異。 // 限制:先把地雷講掉 只能使用我提供的全文,不要補充任何我沒給的文獻。 無法從文本判斷的地方,直接寫「文中未說明」。 // 格式:決定你拿到的東西能不能直接用 輸出成表格,欄位為:立場|代表文獻|樣本|測量|結論
「只能使用我提供的全文」這一行是整段最重要的一句。它把判斷標準一與判斷標準二同時關掉了。
提問鷹架的完整說明:https://researcher.tw/articles/research-prompt-scaffold/
論文的八個環節,哪些能交出去
判斷標準只有一個:你能不能當場驗證它對不對,並為結果負責。
| 環節 | 能否交出去 | 條件與理由 |
|---|---|---|
| 研究問題收斂 | 不行 | 可以請它挑毛病與列反證,但決定要由你下。 |
| 文獻檢索 | 不行 | 交給真實索引,不是交給模型。 |
| 文獻比較與分群 | 可以 | 前提是餵全文,而且你讀過,看得出它分錯。 |
| 研究方法選擇 | 不行 | 口試最常被追問的一題,必須自己能辯護。 |
| 資料產生 | 絕對不行 | 這是造假,沒有條件可言。 |
| 統計與程式輔助 | 可以 | 前提是你看得懂它寫的每一行,並能自己重跑一次。 |
| 結果詮釋 | 不行 | 可以請它列替代解釋,但採用哪一個是你的判斷。 |
| 語言潤飾 | 可以 | 風險最低的一項,仍要依規定揭露。 |
逐項展開:https://researcher.tw/articles/claude-thesis-writing/
揭露怎麼寫才安全
一句話寫得出來的四件事
- 用了哪個工具。名稱與版本,不要只寫「AI」。
- 用在哪個環節。語言潤飾、架構建議、程式輔助,逐項列出。
- 沒用在哪裡。明確聲明資料蒐集與分析未使用生成內容。
- 誰負最終責任。所有內容由作者檢閱並負全責。
三個常見錯誤
- 寫得太模糊。「本研究部分使用 AI 協助」等於沒寫,審稿人會追問。
- 把模型列為作者。幾乎所有出版商都明文禁止,因為它無法承擔責任。
- 先斬後奏。投稿系統有欄位就要填,不要等被問到才補。
規定會依期刊與學校而不同,不確定就直接去看投稿須知,不要照別人的寫法抄。
六道倫理自檢與揭露產生器:https://researcher.tw/articles/ai-disclosure-ethics/
想再往下讀
另外三篇值得一看:撤稿案例全文 /articles/chatgpt-intro-retracted-paper/、腳註貼對話連結 /articles/dont-copy-ai-citations/、六支免費工具動線 /articles/tools-workflow-guide/。
AI 的正確位置,
是審稿人,不是代筆
研究者基地
文章、工具與資源庫|researcher.tw
簡報典藏|deck.researcher.tw