生成式 AI
何謂資料科學? 為何資料科學如此重要?
生成式 AI (GenAI) 會吸收現有的資料並從中學習,然後產生具有相似特徵的新資料,例如,它可以生成文字、圖片、影片、音訊和電腦程式碼。
GenAI 正在改變世界
傳統的 AI 和機器學習系統透過辨識資料中的模式來進行預測,但 GenAI 不僅僅是預測,而是以生成全新的資料作為主要輸出。想像一下,在對聊天機器人(例如 ChatGPT)輸入幾個單詞來描述您的想法後,僅需數秒便能收到完整的演講稿,還可從基於文字的描述生成音樂、藝術作品或圖片,或使用 GenAI 工具進行來回提示的對話式互動,制訂出一套商業策略。根據 Bloomberg Intelligence 的研究,到了 2032 年,GenAI 可能會成為價值 1.3 兆美元的市場。
GenAI 的實際應用
GenAI 將以可預測和難以想像的方式重塑我們的未來。在此說明影片中,您將了解 GenAI 在各產業與商業應用中的真實案例,包括大型語言模型 (LLMs)、合成資料生成和數位孿生的應用。此外,您也將了解採用 GenAI 技術時需注意的重要考量和風險,例如偏見、幻覺、資料隱私以及安全性問題。
生成式人工智慧的演變
儘管 GenAI 已在全球掀起熱潮,但它並非全新的技術,而是基於我們已使用數十年的技術,包括 AI、機器學習和統計方法。GenAI 的起源可以追溯得更久遠,但我們從 1966 年的聊天機器人 ELIZA 開始說起。
ELIZA 是由 Joseph Weizenbaum 所打造,他設計這個系統來模仿羅傑心理治療師,以反映患者的語言為主要特徵進行互動。ELIZA 使用模式匹配技術來實現這項成就,它是最早嘗試圖靈測試(Turing Test)的程式之一。圖靈測試是一種模擬遊戲,用來檢驗機器是否能展現出類似人類的智慧行為。
隨著分析非結構化文本資料的方法進化,1970 年代到 1990 年代的語義網絡、本體學、循環神經網絡等都有增長。 從 2000 年到 2015 年,語言建模和文字嵌入程序改進,並且 Google 翻譯器出現。
2014 年,Ian Goodfellow 與其團隊開發了生成式對抗網絡 (GAN),該技術讓兩個神經網絡互相競爭(即進行訓練)。一個網絡負責生成資料,而另一個網絡則試圖判斷這些資料是否為真。Transformer 模型於 2017 年推出。它們引入了自注意力機制(self-attention mechanism),使模型在進行預測時能夠判斷輸入資料中不同部分的重要性。此外,BERT 和 eLMO 等架構也變得流行。
接著,生成式預訓練轉換器(Generative Pre-trained Transformer, GPT)模型登場,第一款 GPT 模型於 2018 年問世。這種生成式模型以大量網路文字資料進行訓練,透過 1.17 億個參數,它開始生成風格與內容類似於訓練資料的文字。到了 2023 年,大型語言模型(GPT)已發展到能熟練應對高難度考試的程度,例如律師資格考試。
當今世界中的生成人工智慧
誰在使用生成人工智慧?
生成式 AI 在全球各行各業和商業功能中都有廣泛應用,隨著其受歡迎程度不斷提高,以及各類專門 AI 助理的開發熱潮,這項技術同時引發了個人、企業和政府機構的興奮與憂慮,不妨了解部分產業目前如何運用 GenAI。
生成人工智慧的結果在其核心上是我們人類的反映。 ...消費者必須在與對話式 AI 互動時繼續應用批判性思維,並避免自動化偏見(認為技術系統比人類更準確和真實)。Reggie Townsend VP of the SAS Data Ethics Practice
生成人工智慧如何運作
生成人工智慧技術的一些流行範例包括 DALL-E,這是一種從文字輸入創建圖像的圖像生成系統,ChatGPT(文本生成系統),Google Bard 聊天機器人以及微軟的人工智慧支持的 Bing 搜索引擎。 另一個例子是使用生成式 AI 來創建系統、業務流程甚至一個人的數位表示,例如對某人目前和未來的健康狀況的動態表示。
產生技術有三種主要類型(數位孿生,大語言模型和合成數據生成)。
許多其他技術啟用和支持生成人工智慧:
一個演算法是一個旨在完成特定任務或解決問題的逐步指示列表。許多計算機程序是以計算機可以理解的方式編寫的一系列算法。 當算法開始補充或取代人類決策時,我們必須探討其公平性,並要求對它們的開發方式進行透明度。
人工智慧使機器可以從經驗中學習,適應新的輸入並執行類似人類的任務。 人工智慧通常很依賴於深度學習和 NLP。 通過這種技術,可以訓練計算機以通過處理大量資料和識別模式來完成特定任務。
資料管理對於確保可信、具倫理且無偏見的輸出至關重要,這對於 AI、機器學習任務以及在大量資料集上訓練後用來理解和生成內容的 LLM 特別關鍵。
深度學習是機器學習的一個子集,可訓練電腦執行類似人類的任務,如語音識別、圖像辨識和預測,它提升了利用資料進行分類、識別、檢測和描述的能力。深度學習模型,如生成對抗網路(GANs)和變分自編碼器(VAEs),在大量資料集上進行訓練,並能生成高品質的資料。較新的技術,如 StyleGANs 和轉換器模型(Transformer models),擅長打造逼真的影片、圖片、文字和語音。
機器學習 是一種數據分析方法,可建構自動化分析模型。它是一個人工智慧的分支,它訓練機器如何學習。 機器學習基於系統可以從數據中學習,識別模式並在最小的人工干預下做出決策的理念。
自然語言處理 是人工智慧的一個分支,可幫助電腦了解、解釋和操縱人類語言。NLP 從許多學科,包括計算機科學和計算語言學,以填補人類溝通和計算機理解之間的差距。
神經網絡 是具有互聯節點的計算系統,工作類似人類大腦中的神經元。神經網絡使用演算法來識別原始數據中的隱藏模式和關聯,將其集成並分類,並隨著時間的推移持續學習和改進。
強化學習是一種機器學習模式,是當算法通過試驗和錯誤,發現哪些動作產生最大的獎勵時, 它逐漸學習最佳(或最有獎勵)的政策或目標,也就是說它的反饋機制依賴獎勵信號。 它經常用於機器人,遊戲和導航。
實作 GenAI 模型
運行 GenAI 的成本高昂,需耗費大量的運算資源和資料。在導入 GenAI 模型之前,應謹慎評估投資報酬率 (ROI),並考量不同模型之間的差異,例如基礎模型與領域模型的特性。此外,還有倫理方面的考量,例如:資料來自何處?所有權屬於誰?內容是否可信?您是否清楚了解該模型的建構過程?
微調模型的 5 個步驟
生成式 AI 仰賴許多不同的 AI 演算法和技術,來產生具有類似機率分佈和特徵的資料,這些資料與其學習來源的資料相似。 您不必從零開始建立,而是可依照以下五大步驟微調預先訓練好的基礎大型語言模型。
1. 定義任務
選擇合適且預先訓練好的大型語言模型,並明確定義您要進行微調的任務。例如文字分類(即實體辨識)或文字生成等等。
2.準備資料
收集並預先處理特定任務的資料 — 用於標籤、格式化和標記化等任務。 創建訓練和驗證(並可能測試)資料集。
3. 微調模型
使用特定任務的資料對修改後模型進行訓練,透過訓練資料集來更新模型的權重。同時,監控模型在驗證集上的表現,以防止過度配適。
4.評估和測試
訓練完成後,使用驗證集評估微調後的模型,根據結果進行必要的調整。當對結果感到滿意時,再使用測試集來測量模型的表現,以獲得一個客觀的性能評估。
5.部署
當你對模型的表現有信心時,就可以將它部署到實際應用中。例如:將模型整合到 AI 應用程式、網站或其他平台中。
