Following Seed and Flow, ByteDance Establishes Another AI Tier-1 Department, Targeting "Data"

華爾街見聞
2026.08.11 12:56

字節跳動近期成立 AI 一級部門 “AI 數據與安全”,負責人為王贏磊。該部門整合了 Global Data、集團數據中台 DMC 及 Flow 下屬 AIDP 等團隊,旨在為字節所有大模型提供跨模態數據服務,覆蓋數據生產全流程。此舉是繼 Seed 和 Flow 後,字節圍繞 AI 業務成立的又一核心部門,目前正進行架構梳理與人員優化。

“智能湧現” 從多個獨立信源處獲悉,字節跳動近期成立了一個新的一級部門——AI 數據與安全,與 Seed、Flow、抖音等部門平行,負責人為王贏磊(Adam Wang)。

這是繼 2023 年底成立 Seed 和 Flow 兩個 AI 一級部門後,字節圍繞 AI 業務成立的又一個一級部門。負責人王贏磊此前為 TikTok 平台責任負責人和 TikTok 直播負責人。“王贏磊負責的直播業務曾是 TikTok 最主要的營收來源之一,在字節內部有過赫赫戰功。” 一位接近字節的人士表示。

“智能湧現” 就上述消息向字節求證,截止發稿,暫無回覆。

在模型、產品之後,字節這一次直指 AI 數據。

據 “智能湧現” 瞭解,這個新部門的前身之一,是由 TikTok 創始團隊成員傅越(花名 Yuyi)於 2023 年成立的數據團隊 Global Data,原來的規模在百人左右。這個精幹的團隊起初為 Dola(豆包海外版)、TikTok 等國際業務服務,而後負責為 Seed 的模型訓練做數據採購和質量管控。團隊內部設有產品經理、數據工程、採購、質檢運營、安全合規等多個職能。

除 Global Data 之外,AI 數據與安全部門還整合了多個此前分散的 AI 數據部門,包括集團數據中台 DMC,以及 Flow 下屬的 AI 數據平台 AIDP 等團隊人員。

多位知情人士對 “智能湧現” 表示,這一部門的整合和正式成立從 2026 年 6 月初開始,而由於涉及多個部門整合,這些部門之間業務又多有重疊,當前字節還在不斷梳理架構,優化人員。

數位接近該部門的人士告訴我們:整合後的新部門,會是一個橫跨基座模型到業務團隊的龐大數據團隊,其核心職能是為字節所有大模型,提供跨模態的數據服務。團隊的職責也覆蓋數據生產全流程:標準制定、尋源採購、合成清洗、質量評測等。

在 7 月底的 Seed 全員會上,久未露面的張一鳴表態:字節在大模型攻堅上 “堅決不蒸餾”。而在 8 月 5 日的字節跳動全員會上,CEO 梁汝波也表示:“字節大語言模型會堅定自研,做好基本功,接受短期落後,堅持優化長期,最重要的是動作不要變形。” 這些決定必將導向,在字節的大模型攻堅中,數據的重要性不斷上升。

跳出字節,我們也看到全球 AI 行業正在發生結構性變化:當公開互聯網數據被窮盡,模型競爭的核心變量正從算法和算力,轉向真實世界的高質量數據。

字節的龐大數據帝國

字節在 AI 數據上的投入,在國內大廠中一直是最堅決的。

一個重要原因是,Seed 從成立之初就定下了 “不做蒸餾” 的原則。字節在幾乎所有模型上的目標都是達到全球第一梯隊甚至 SOTA,這是通過蒸餾難以達到的。如果所有數據都要靠自己合成、採買、清洗,勢必需要一個龐大的團隊來支持。

這個團隊有多龐大?“智能湧現” 曾獨家報道,在字節內部,僅為 Seedance 做模型數據評測的團隊就有上千人。每一位 Seedance 算法工程師的背後,往往都配着十餘位數據同事做支持。

與之形成對比的是,很多視頻領域賽道的頭部創業公司,內部評測團隊達到數十人就已經算比較大的投入。而 Seedance 2.0 的成功,也被多位從業者稱為 “一場數據的勝利”。

這讓字節更加堅定了對數據的投入。

首先是預算層面。“智能湧現” 曾獨家報道,在世界模型和 Coding 模型的訓練上,字節 2026 年初的數據預算已超過千萬美元級別,並且 “如果覺得不夠,可以隨時追加預算”。

“智能湧現” 還了解到,目前字節數據團隊也已經採取賽馬機制,團隊內部按方向劃分——世界模型、代碼、高難學科等。在如今模型的商業邏輯日漸清晰的背景下,字節的每個數據項目,也需要核算 ROI。

字節之外,各大廠都在加強數據投入。從去年開始真正發力大模型的騰訊,近半年來頻繁以高達三倍的薪資從字節的數據團隊挖人。

阿里、騰訊在數據採購上的預算都有明顯增長,且不斷加碼投資。一位數據行業人士告訴 “智能湧現”,大廠目前都有一定的數據排他策略,比如設定數據集獨家期限、或階段性買斷供應商核心人員。

“數據是當下大模型競爭中最具決定性的變量。” 這已經成為大語言模型、具身智能、世界模型、AI4S 等幾乎所有明星細分方向上的共識。

但是,2026 年的數據市場現狀是,AI 公司需求旺盛,從預訓練到後訓練,都面臨高質量數據供給稀缺的瓶頸。

對字節而言,接下來的挑戰是如何讓一個千人規模的數據組織,仍然能夠快速響應模型前沿的變化。畢竟,在模型能力邊界還在快速變化的階段,今天最稀缺的數據,在半年後可能就會失去價值。

全球模型競爭都走向數據軍備賽

過去一年裏,全球的大模型攻堅都面臨一個趨勢:在推理範式緩慢收斂的前提下,算法架構帶來的能力提升趨緩。數據已經成為決定模型能力上限最重要的變量,甚至沒有之一。

跟字節等中國大廠相比,海外大模型公司對於數據的投入還要高出數倍。硅谷頭部大模型公司的外部數據預算正在以每年數十億美元的量級快速膨脹。比如 Anthropic,僅在 2025 年就為 RL 數據撥出了超過 10 億美元的預算。

這使得數據成為了 2026 年硅谷增長最快的賽道之一。最典型的是硅谷明星公司 Mercor,年化收入從去年的 5 億美元漲到今年年中的 20 億美元,其中 91% 來自 OpenAI、Anthropic 等頭部模型公司,估值則飛漲至 200 億美元,這家公司成立僅三年。

為什麼數據突然變得如此重要?根本原因在於,互聯網上的公開數據幾乎已經被窮盡。

過去三年,模型訓練所需的數據經歷了從公域到私域的轉變。公開的互聯網中有大量的報告、文檔,但缺少人類如何產出這些結果的過程,比如如何理解模糊的意圖、尋找上下文、犯錯和修正。

比如,在 Coding 之外,還有醫生、律師、科研等高精尖領域任務,通用模型還沒有解決得很好。當模型要提升能力,像真實專家一樣工作時,它還需要大量自然產生的 “過程數據”。這些數據往往藏在真實的工作流程裏,比如企業內部沉澱的代碼庫、員工日常操作留下的痕跡等等。

AI 所需的數據,正在從公域轉向了私域。而大量私域數據的採集,成了大模型公司新的爭奪點。

風險提示及免責條款

市場有風險,投資需謹慎。本文不構成個人投資建議,也未考慮到個別用户特殊的投資目標、財務狀況或需要。用户應考慮本文中的任何意見、觀點或結論是否符合其特定狀況。據此投資,責任自負。