生成式 AI

何謂資料科學? 為何資料科學如此重要?

生成式 AI (GenAI) 會吸收現有的資料並從中學習,然後產生具有相似特徵的新資料,例如,它可以生成文字、圖片、影片、音訊和電腦程式碼。

GenAI 正在改變世界

傳統的 AI 和機器學習系統透過辨識資料中的模式來進行預測,但 GenAI 不僅僅是預測,而是以生成全新的資料作為主要輸出。想像一下,在對聊天機器人(例如 ChatGPT)輸入幾個單詞來描述您的想法後,僅需數秒便能收到完整的演講稿,還可從基於文字的描述生成音樂、藝術作品或圖片,或使用 GenAI 工具進行來回提示的對話式互動,制訂出一套商業策略。根據 Bloomberg Intelligence 的研究,到了 2032 年,GenAI 可能會成為價值 1.3 兆美元的市場

GenAI 的實際應用

GenAI 將以可預測和難以想像的方式重塑我們的未來。在此說明影片中,您將了解 GenAI 在各產業與商業應用中的真實案例,包括大型語言模型 (LLMs)、合成資料生成和數位孿生的應用。此外,您也將了解採用 GenAI 技術時需注意的重要考量和風險,例如偏見、幻覺、資料隱私以及安全性問題。

生成式人工智慧的演變

儘管 GenAI 已在全球掀起熱潮,但它並非全新的技術,而是基於我們已使用數十年的技術,包括 AI、機器學習和統計方法。GenAI 的起源可以追溯得更久遠,但我們從 1966 年的聊天機器人 ELIZA 開始說起。

ELIZA 是由 Joseph Weizenbaum 所打造,他設計這個系統來模仿羅傑心理治療師,以反映患者的語言為主要特徵進行互動。ELIZA 使用模式匹配技術來實現這項成就,它是最早嘗試圖靈測試(Turing Test)的程式之一。圖靈測試是一種模擬遊戲,用來檢驗機器是否能展現出類似人類的智慧行為。 

隨著分析非結構化文本資料的方法進化,1970 年代到 1990 年代的語義網絡、本體學、循環神經網絡等都有增長。 從 2000 年到 2015 年,語言建模和文字嵌入程序改進,並且 Google 翻譯器出現。

2014 年,Ian Goodfellow 與其團隊開發了生成式對抗網絡 (GAN),該技術讓兩個神經網絡互相競爭(即進行訓練)。一個網絡負責生成資料,而另一個網絡則試圖判斷這些資料是否為真。Transformer 模型於 2017 年推出。它們引入了自注意力機制(self-attention mechanism),使模型在進行預測時能夠判斷輸入資料中不同部分的重要性。此外,BERT 和 eLMO 等架構也變得流行。

接著,生成式預訓練轉換器(Generative Pre-trained Transformer, GPT)模型登場,第一款 GPT 模型於 2018 年問世。這種生成式模型以大量網路文字資料進行訓練,透過 1.17 億個參數,它開始生成風格與內容類似於訓練資料的文字。到了 2023 年,大型語言模型(GPT)已發展到能熟練應對高難度考試的程度,例如律師資格考試

當今世界中的生成人工智慧

GenAI 的競賽

全球各地的組織正競相部署 GenAI 技術,以追求卓越的商業成果。在這份根據全球 1,600 家企業進行調查所撰寫的 GenAI 報告中,您可以了解不同地區和產業在這場競賽中的發展狀況。

使用 GenAI 的好處和風險

準備好深究 GenAI 的運作原理,以及使用前需考量的事項了嗎?掌握採用 GenAI 工具的實用建議,並深入學習 AI 的開發、治理及部署——包括倫理層面。

處理 AI 生成內容的建議

一般內容使用者能分辨真偽嗎?為減輕潛在風險,有倫理意識的內容創作者應主動承擔標示 AI 生成內容的責任,而使用者也應對這個領域的發展保持警覺與關注。

不真實的現實:生成人工智慧的狀態

產生的影像爆炸能否創造出一種不現實,使人類陷入失敗? 了解「deepfake」一詞的真正含義,了解 deepfake 如何用途,並了解新興技術如何幫助偵測和識別產生的媒體。

誰在使用生成人工智慧?

生成式 AI 在全球各行各業和商業功能中都有廣泛應用,隨著其受歡迎程度不斷提高,以及各類專門 AI 助理的開發熱潮,這項技術同時引發了個人、企業和政府機構的興奮與憂慮,不妨了解部分產業目前如何運用 GenAI。

銀行

銀行和其他金融服務組織可以使用生成人工智慧來改善決策、降低風險並提高客戶滿意度。 當生成式 AI 模型被訓練以學習模式和發現異常時,它們可以實時標記可疑活動。 通過創建模擬資料用於壓力測試和場景分析,生成人工智慧可以幫助銀行預測未來的金融風險並防止損失。 虛擬助理(例如聊天機器人)可以 24/7 提供人類型的客戶服務。

保險

保險公司可以使用合成數據進行定價、儲備和精算模型。 例如,保險公司可以使用類似歷史保單和索償信息的合成資料,來訓練和測試定價模型,幫助他們評估不同的定價策略的表現,而不需使用客戶的敏感個人信息。 合成數據還可以幫助評估低概率事件,例如地震或颶風。

生命科學

生命科學中生成人工智慧有許多有前途的應用。 在藥物發現中,它可以加快識別新潛在藥物候選的過程。 在臨床研究中,生成人工智慧有潛力從複雜資料中取得資訊,以創建合成數據和數位孿生,這些數字是個人代表的(保護隱私的一種方法)。 其他應用包括識別安全信號或尋找現有治療的新用途。

製造業

製造商可以使用生成式 AI 來協助最佳化營運、維護、供應鏈,甚至能源使用量,以降低成本、更高的生產力和更大的可持續性。 生成式 AI 模型將從現有效能、維護和感測器資料、預測、外部因素等中學習,然後提供建議的改進策略。

公共部門

自然語言處理 (NLP) 和聊天機器人可以幫助公共部門工作人員更快地回應公民需求,例如改善災區域的緊急服務,或協助服務不足的社區。 生成式 AI 技術(例如預測模型和模擬)可以分析大量的歷史數據、公眾情緒和其他指標,然後產生建議以減少擁堵、改善基礎架構規劃和微調資源配置。

零售業

在零售中,成功需要了解購物者需求,設計吸引客戶的購物體驗,以及確保可靠穩定的供應鏈執行。 例如,一些零售商正在使用具有數位孿生技術的生成人工智慧,讓計劃者一覽潛在情況,例如供應鏈中斷或資源限制。 通過複雜的 AI 模擬和數據模型實現了這一目標。

生成人工智慧的結果在其核心上是我們人類的反映。 ...消費者必須在與對話式 AI 互動時繼續應用批判性思維,並避免自動化偏見(認為技術系統比人類更準確和真實)。 Reggie Townsend 頭像 Reggie Townsend VP of the SAS Data Ethics Practice

在商業中使用 GenAI 的道德考量

GenAI 作為一項顛覆性技術,其影響被比擬為電力和印刷術的發明。對話式 AI 模型具有大幅提升生產力的潛力,因此迅速普及,同時也引發了對 AI 倫理、資料隱私、準確性、幻覺及偏差的擔憂。由於其不斷進化且模仿人類智慧的能力,GenAI 掀起了AI 焦慮,並引發關於如何使用和管理這項技術的廣泛討論。

了解為何必須採用以人為本、包容性與問責性為設計核心的可靠 AI 系統極為重要。

生成人工智慧如何運作

生成人工智慧技術的一些流行範例包括 DALL-E,這是一種從文字輸入創建圖像的圖像生成系統,ChatGPT(文本生成系統),Google Bard 聊天機器人以及微軟的人工智慧支持的 Bing 搜索引擎。 另一個例子是使用生成式 AI 來創建系統、業務流程甚至一個人的數位表示,例如對某人目前和未來的健康狀況的動態表示。

產生技術有三種主要類型(數位孿生,大語言模型和合成數據生成)。


許多其他技術啟用和支持生成人工智慧:

一個演算法是一個旨在完成特定任務或解決問題的逐步指示列表。許多計算機程序是以計算機可以理解的方式編寫的一系列算法。 當算法開始補充或取代人類決策時,我們必須探討其公平性,並要求對它們的開發方式進行透明度。

人工智慧使機器可以從經驗中學習,適應新的輸入並執行類似人類的任務。 人工智慧通常很依賴於深度學習和 NLP。 通過這種技術,可以訓練計算機以通過處理大量資料和識別模式來完成特定任務。

資料管理對於確保可信、具倫理且無偏見的輸出至關重要,這對於 AI、機器學習任務以及在大量資料集上訓練後用來理解和生成內容的 LLM 特別關鍵。

深度學習是機器學習的一個子集,可訓練電腦執行類似人類的任務,如語音識別、圖像辨識和預測,它提升了利用資料進行分類、識別、檢測和描述的能力。深度學習模型,如生成對抗網路(GANs)和變分自編碼器(VAEs),在大量資料集上進行訓練,並能生成高品質的資料。較新的技術,如 StyleGANs 和轉換器模型(Transformer models),擅長打造逼真的影片、圖片、文字和語音。

機器學習 是一種數據分析方法,可建構自動化分析模型。它是一個人工智慧的分支,它訓練機器如何學習。 機器學習基於系統可以從數據中學習,識別模式並在最小的人工干預下做出決策的理念。

自然語言處理 是人工智慧的一個分支,可幫助電腦了解、解釋和操縱人類語言。NLP 從許多學科,包括計算機科學和計算語言學,以填補人類溝通和計算機理解之間的差距。

神經網絡 是具有互聯節點的計算系統,工作類似人類大腦中的神經元。神經網絡使用演算法來識別原始數據中的隱藏模式和關聯,將其集成並分類,並隨著時間的推移持續學習和改進。

強化學習是一種機器學習模式,是當算法通過試驗和錯誤,發現哪些動作產生最大的獎勵時, 它逐漸學習最佳(或最有獎勵)的政策或目標,也就是說它的反饋機制依賴獎勵信號。 它經常用於機器人,遊戲和導航。

實作 GenAI 模型

運行 GenAI 的成本高昂,需耗費大量的運算資源和資料。在導入 GenAI 模型之前,應謹慎評估投資報酬率 (ROI),並考量不同模型之間的差異,例如基礎模型與領域模型的特性。此外,還有倫理方面的考量,例如:資料來自何處?所有權屬於誰?內容是否可信?您是否清楚了解該模型的建構過程?

微調模型的 5 個步驟

生成式 AI 仰賴許多不同的 AI 演算法和技術,來產生具有類似機率分佈和特徵的資料,這些資料與其學習來源的資料相似。 您不必從零開始建立,而是可依照以下五大步驟微調預先訓練好的基礎大型語言模型。

1. 定義任務

選擇合適且預先訓練好的大型語言模型,並明確定義您要進行微調的任務。例如文字分類(即實體辨識)或文字生成等等。

2.準備資料

收集並預先處理特定任務的資料 — 用於標籤、格式化和標記化等任務。 創建訓練和驗證(並可能測試)資料集。

3. 微調模型

使用特定任務的資料對修改後模型進行訓練,透過訓練資料集來更新模型的權重。同時,監控模型在驗證集上的表現,以防止過度配適。

4.評估和測試

訓練完成後,使用驗證集評估微調後的模型,根據結果進行必要的調整。當對結果感到滿意時,再使用測試集來測量模型的表現,以獲得一個客觀的性能評估。

5.部署

當你對模型的表現有信心時,就可以將它部署到實際應用中。例如:將模型整合到 AI 應用程式、網站或其他平台中。

了解各組織如何使用 GenAI 工具

許多組織已在採用 GenAI,而銀行和保險業在日常業務中的採用率處於領先地位。本資訊圖表展示了一些早期成功案例,例如管理風險、提升員工滿意度、降低營運成本以及提高客戶留存率。


後續步驟

了解 GenAI 解決方案如何強化人類的創造力和心血。

資料與 AI 平台

使用 SAS ® Viya ®,沒有太多資訊。 了解從十億個資料點凝聚成一個觀點的最快捷方式。