QIDS Note
QIDS Note Podcast
EP005: 詳細剖析 InnoData 的 AI 轉型歷程
0:00
-22:02

EP005: 詳細剖析 InnoData 的 AI 轉型歷程

傳統資料工程公司如何成為生成式 AI 以及機器人時代的隱形推手

生成式AI發展速度大幅超越我們的想像,從剛推出時 AI模型還不懂基本的數學運算,現在的生成式 AI模型不僅在各個專業領域超越博士等級的專家,從 OpenAI發表推理模型(Reasoning Model)o1之後,AI模型的能力達到了跳躍式的增長,還可以對各種題目進行深入研究(Deep Research),展現出 AI的高度價值。

許多人也都知道成功的 AI模型必須奠基於高品質的數據來源,不僅僅要有大量的訓練數據,數據的品質也必須非常好,避免 garbage in garbage out,訓練出有偏見及偏誤的模型。這就要提到數據的清洗與標註,這個領域有一些佼佼者,包括美國的上市公司 Innodata以及不久前獲得 Meta鉅額投資的私人公司 Scale AI都是為生成式AI提供高品質數據的領導廠商。我們今天就要談談 Innodata這家公司如何從傳統資料工程公司轉型成為生成式AI快速發展背後的推手。

Innodata Inc.(NASDAQ: INOD)很像是一部關於「重塑」的長篇紀錄:1988 年以內容數位化起家,長年耕耘資料處理與出版支援;在產業版圖重組、技術迭代與商模變遷的壓力下,一步步把深厚的資料工程底子,轉化為今天生成式 AI 時代不可或缺的「智慧數據(Smart Data)基礎設施」。如果要用一句話概括它的變化:從「做資料」到「為 AI 做出可以信任、可訓練、可評估、可落地的資料」


從內容數位化到 AI 數據工程:一條不走捷徑的路

創立初期,Innodata 以內容轉檔、品質審核與出版支援為核心,並在菲律賓、斯里蘭卡、印度建立全球交付中心。2000 年代承接電子書浪潮,將紙本大規模轉為數位格式。2010 年代中期,公司開始「把資料工程往更難的問題推」:設立 IADS,孵化 Synodex(醫療/保險結構化)與 DocGenix(法律合約抽取),再到收購 MediaMiser、Bulldog Reporter 併入 Agility,跨足 PR 與媒體監測。這些看似分散的動作,實際上在為後來的 AI 轉型累積三種資產:大規模資料處理能力、垂直領域知識、可複用的流程與工具鏈

臨界點出現在 2019 年。公司把戰略重心全面轉向 AI/ML 數據工程:導入 human-in-the-loop(HITL) 工作流、嘗試 transformer 模型於文檔理解、把資料工程方法論產品化,最終形成「平台 + 服務」的雙引擎。


產品與平台:從服務到「平台+服務」的雙引擎

Innodata 目前的營運由三個事業核構成,但核心邏輯一致:把複雜、昂貴且風險高的資料任務,做成可規模化、可度量、可審計的能力

  • Digital Data Solutions(DDS):AI 訓練/微調所需的資料準備、標註、策劃、清理與整合,外加落地部署支援。這是近年成長的主要推力,營收佔比逾 86%。

  • Synodex:把非結構化醫療紀錄(EHR、病歷、檢驗報告)轉成可運算的結構化資料,直連保險核保與理賠流程。

  • Agility:PR 與媒體監測平台,內建 AI 輔助寫作(例如 PR CoPilot),把生成式 AI 實用化到公關工作流。

更關鍵的是兩個「隱形引擎」:

  • Goldengate AI:一個低程式碼的文件智慧解析/抽取平台,能混搭自研深度模型與第三方 LLM,做比對校驗與錯誤檢測,降低「幻覺」風險。

  • Generative AI Test & Evaluation:在 NVIDIA 技術堆疊上打造的 LLM 安全/合規/可靠性評測平台,提供幻覺檢測、對抗提示、領域風險基準,協助企業在上線前完成「可交代、可稽核」的驗證。


AI 方法論:HITL、Smart Data 與「把錯誤留在離線」

Innodata 並非只靠模型疊模型;它把**人機協作(HITL)**放在方法論中心,將生醫、法律、金融等主題專家的知識,嵌入資料流程,讓 AI 的可用性與可控性提升。這使公司能長期服務對準確性要求極高的客戶場景,例如把法律文書標註準確率從 80% 拉到 99%。

同時,公司把策略從「賣大量原料」轉為「賣少量但高價值的智慧數據(Smart Data)」:
更高的準確性、更明確的溯源與審計、更貼近模型弱點與任務需求。Goldengate 的比對與校驗、評測平台的合規與穩健性測試,讓錯誤儘量在離線被發現與修補,而不是等到上線才付出成本。


為何是現在?護城河的形狀

在生成式 AI 進入落地階段的 2024–2025 年,Innodata 的「資料工程型護城河」突然變得稀缺。其優勢不在單點技術,而在「系統性把難事做對」:

  • 人機協作流程深度產品化:把 HITL 做成工程能力,而非一次性專案。

  • 垂直領域深耕:醫療、法律、金融等高門檻場景,形成難以複製的 know-how。

  • Smart Data 策略:提供可稽核、可追溯、面向風險控制的高品質數據。

  • 中立第三方身分:在產業資本關係牽動供應選擇時,中立本身變成稀缺資產,帶來轉單效應。

  • 平台 + 服務的雙輪:同時把流程工具化,又保留專業服務的彈性與深度。


財務與經營「質變」(2023–2025)

過去兩年,這套方法論開始被財報驗證。2024 年營收躍至 1.705 億美元(年增約 96%),並轉為顯著獲利;進入 2025 年動能延續,Q2 營收 5,840 萬美元、年增 79%,調整後 EBITDA 1,320 萬美元(佔比 23%),調整後毛利率升至 43%。資本效率同樣亮眼:ROIC(LTM,至 2025 年 Q2)達 263.98%。資產負債表維持健康,無淨負債、現金 5,980 萬美元,另有 3,000 萬美元 循環額度未動用。

一言以蔽之:從量變到質變。營收、利潤率與資本回報率,不僅上去了,而且看起來是被「方法論與結構」推上去的。


成長路徑:Land & Expand、監管紅利與「被動贏家」

Innodata 的獲客與擴張走的是企業級長坡厚雪:先以小單驗證價值,Land & Expand 把同一客戶做深做廣;同時分散客群、降低集中度。近期,與最大客戶簽下第二份獨立預算的大型 SOW,顯示擴張效應在內生強化。

外生條件也在改善。歐美監管要求 AI 系統的透明性、可追溯、數據治理,讓「高品質、可審計的資料服務」走向剛需。再加上競爭對手因資本關係引發的大客戶轉單,Innodata 以中立第三方之姿,意外成為這輪版圖重排的受益者。


下一波:Agentic AI 與機器人,資料工程的第二戰場

公司把目光放到更前方:多代理(multi-agent)系統與機器人(robotics)。當 LLM 能穩定調用工具、規劃子任務、結合長短期記憶並在邊緣設備上執行時,訓練、微調、測試與安全監控的資料需求會再次爆炸,而且品質門檻比純文本更高。Innodata 正在投資客製化標註流程、模擬資料、風險評測與全球交付能力,將現有的「平台+服務」帶進代理與機器人的新工作流。管理層甚至判斷:這個市場的長期規模,可能超越現階段的生成式 AI 後訓練數據生意


風險與觀察清單

  • 執行風險:銷售與交付的規模化需持續投資,如何在快速擴張中維持品質與毛利,是核心考題。

  • 客戶結構:雖持續分散,但企業級收入天然集中,需留意單一客戶波動。

  • 競爭加劇:自動化工具下降本成本,競品可能以價格換量;Innodata 需守住「高品質 + 合規 + 垂直深度」定位。

  • 監管變動:雖短期利多,但合規門檻提高也會增加成本,需要平台化來對沖。


結語:把難事做成能力,再把能力做成結構

Innodata 的成功,並非因為追逐「最新模型」;而是把資料工程這件難而枯燥的事,做成可規模複製、可審計與可度量的能力,並且在醫療、法律、金融等高門檻垂直裡把方法論沉下去。當生成式 AI 進入落地與管制的年代,可靠、可交代、可維運的資料,反而成了最稀缺的基礎設施。
如果把 AI 革命比作淘金熱,Innodata 的角色很清楚:它賣的不是鏟子本身,而是讓鏟子能安全、穩定、符合規範地運作的那套方法與供應鏈。下一段路,會在多代理與機器人的新戰場展開。

Discussion about this episode

User's avatar

Ready for more?