生成式人工智慧(Generative AI)的訓練,無可避免地須以既有著作為素材:大型語言模型(Large Language Model,LLM)之所以能生成流暢的文字,係因其事前對數以百萬計的書籍、文章與網頁進行擷取、切分與統計分析,而這些素材絕大多數為受著作權保護之作品。惟此一過程在何種意義上構成著作權法上之「重製」,本身即非無爭議:技術上,訓練固須將著作複製為數位檔,並於運算中生成中間複本(intermediate copies);然有力學說認為,模型所擷取者僅係作品中不受保護之統計結構與事實,其對著作之利用毋寧更近於人類「入館閱讀、學習」,而非對表達之消費性重製。 |