「法源 v. 七法」案近日引發重大關注,本文以此為契機探討編輯著作權、合理使用以及文字與資料探勘(text and data mining, TDM)例外在大型語言模型(Large language model, LLM)訓練中的適用可能性。法院認定,法源公司對法規沿革資料之選錄與編排具有最低程度創意,屬編輯著作,受著作權法第7條保護;七法公司未經授權即全面爬取使用,主張合理使用但遭法院否定。法院理由包括:使用目的具商業性、使用比例達100 %、且直接危及市場,因而不符合合理使用要件。
本文並比較美國Thomson Reuters v. Ross Intelligence案,兩案均認為資料庫或摘要雖僅具有限創意,但仍受保護;被告雖主張轉化性,但法院均認定其商業競爭效果顯著,最終否定合理使用(fair use)。進一步觀察顯示,合理使用四要素在LLM訓練中難以發揮篩選功能:其一,LLM與原作均具商業性;其二,原作性質通常已符最低創意保護,無實質差異;其三,訓練過程必然使用作品全體;其四,市場影響可透過設計「反芻上限」等技術手段降低。由此可見,合理使用並非評價AI訓練合法性的適當標準,應另建新制。
歐盟「著作權與鄰接權之數位單一市場指令」提供TDM例外,其中第3條限於研究目的,適用性有限;第4條則允許商業用途,但須以「合法存取」為前提,並要求權利保留須具「機器可讀」形式,以避免內部市場碎片化。德國著作權法第44b條明文落實此要求,惟Hamburg地方法院在LAION案對「機器可讀」之解釋過於寬鬆,引發批評。相較之下,日本著作權法第30條之4採極為寬鬆的「資訊解析例外」,學者甚至認為即使使用盜版來源,若為資訊解析目的仍可能被允許,因此稱日本為「機械學習天堂」。惟本文認為,日本法同樣設有限度但書:「不得不當損害著作權人利益」,若使用盜版資料訓練LLM,仍可能侵害市場與著作權人權利,值得商榷。我國著作權法對於編輯著作的保護過度依賴「最低創意」標準,建議改以「實質投資」作為立法依據;同時,應建立專門規範AI訓練的制度,而非沿用傳統合理使用四要素,以兼顧創新發展與權利人保障。