聚焦科技創新與產業創新 中外媒體走進浙江杭州

文 | AIX財經,作者| 雷晶,編輯 | 金玙璠
今天,2026美加墨世界杯72場小組賽全部結束,世界杯的第一階段落幕。賽場之外,另一場比賽也同步交出了成績單。
聯想與咪咕聯合發起的世界杯預測人機大戰中,12家國產大模型與數萬名人類玩家同臺競猜,目前的結果是:AI整體命中率約61.9%,人類玩家54.6%。
在明確分出勝負的比賽中,AI猜中的概率大,但遇到平局,AI預測20場中僅命中11次。AI的優勢不在于超越常識,而在于比人更穩定地執行,它們可以不受情緒干擾,也能兼顧更多的信息維度。
淘汰賽即將開始,留下來的32支球隊實力更接近,“送分題”沒了,對AI來說,真正的考試才剛剛開始。
更值得關注的問題是,大模型廠商為什么要集體涌入世界杯預測?它們到底是在展示技術能力,還是在借四年一度的流量做一場營銷?當淘汰賽開始、“送分題”消失,這些模型還能保持及格線以上的水平嗎?
01.大模型組團猜球,誰在認真考試?
世界杯歷來是品牌的流量戰場,今年多了一類新玩家。國產大模型廠商以猜球切入,借四年一度的流量窗口,讓用戶直接感受到AI的分析能力。
規模最大的是聯想和咪咕聯合發起的“人機大戰”,召集了DeepSeek、通義千問、Kimi、騰訊混元等12家國產大模型,與數萬名人類選手在同一規則下比命中率。
單獨下場的廠商也不少。千問上線了足球預測AI助手,覆蓋全部104場比賽,用戶與AI同臺競猜,準確率超過千問的人有機會抽取萬元大獎;還同步發起球場***,用戶競猜積分達到一定數額后,千問將為鄉村學校捐建足球場。Kimi搭建了300個Agent,分別負責戰術分析、球員狀態追蹤、賽程計算、***監測等方向,生成了一份224頁的預測報告。
只是活動的側重點各不相同。聯想咪咕做的是能力橫評,用12個模型同場競技提升關注度;千問把預測嵌進用戶互動和公益,走C端獲客路線;Kimi側重展示Agent處理復雜任務的能力,預測只是載體。
三場活動中,只有聯想咪咕的“人機大戰”設置了統一規則、統一評分標準,讓12家模型與人類玩家在同一賽道競爭。因此,我們以它的數據為參照,拆解一下這份成績單。
截至6月28日,72場小組賽全部結束,12家AI整體命中率為61.9%,人類玩家為54.6%,AI領先約7.3個百分點。
圖源 / AIX財經根據咪咕官方預測數據統計計算
從排名看,騰訊混元和中移九天并列第一,命中率68.1%,超過三分之二;百度文心、千問、DeepSeek以63.9%打成平手;墊底的階躍星辰只有43.1%,甚至低于人類選手的平均水平。排名頭尾相差25個百分點,差距并不小。
比起排名,更值得關注的是這些模型贏在哪里、栽在哪里?
AI擅長猜確定性高的比賽。在西班牙對戰沙特的比賽中,12家AI中11家猜對了輸贏;而在德國對戰庫拉索的比賽中,10家模型都給出了正確的判斷。這類比賽的共同特征是強弱分明,模型只要參考世界排名、陣容身價和歷史戰績,就能做出正確判斷。越接近“背公式就能答對”的題,AI做得越好。
某美企AI出海負責人曾小健解釋,大模型預測本質上是一臺“排序機器”,把球隊各項數據加權比較,實力差距越大,排序結果越穩定。
讓AI“翻車”的是平局和冷門,在整個小組賽階段,平局是AI命中率最低的類型,僅命中11次。
最典型的例子是西班牙對陣佛得角的比賽。西班牙是奪冠熱門,世界排名、陣容身價、歷史戰績占優;佛得角則是首次躋身世界杯的非洲新軍。賽前,11家大模型都押注西班牙獲勝,但比賽結果是0-0平局。佛得角門將的多次關鍵撲救化解了西班牙的進攻。一個球員的爆發、一次戰術的執行,都有可能改變比賽走向,而這些恰恰是數據無法提前量化的。
為什么平局這么難猜?在世界杯歷史上,平局的比例大約在20%到25%之間,本身就是一個低概率***。模型把更多概率分配給勝或負,從統計角度來說并非錯誤。
曾小健認為,平局不是排序結果,而是概率分布中的一個特殊區間。大模型天然傾向于輸出一個明確的答案,即便雙方實力接近,它也會選一方做出傾向性判斷。換句話說,模型的機制決定了它必須選邊站。
大模型從業者Hongson則提到,很多時候平局的出現并非偶然,而是強隊進攻受阻、弱隊成功壓縮空間,或者雙方都不愿在某個階段冒險的結果。這些臨場策略選擇本身就很難提前預判。
也就是說,AI猜強弱分明的比賽比較準,預測平局和冷門賽事時表現較差。即便AI猜球的命中率超過50%,但不能把這個數字等同于AI很會預測。
廠商并非不清楚這一點。曾小健認為,預測比賽容易傳播,也容易讓普通用戶感受到AI好像“會分析”。這比單純展示一個抽象榜單更有話題性。它的實際價值在于教育用戶:AI可以做信息整合、情景分析和概率表達。廠商們看中的不是猜球本身,而是世界杯提供了一個***能看懂的場景,讓大模型的能力從抽象的參數變成了具體的表現。
不管包裝成什么樣,核心都是借世界杯的流量,讓AI走進更多人的視野。
02.AI猜球,靠的是什么?
那猜對的模型,到底是怎么猜的?
曾小健認為,AI猜球本質上不是預測,而是復述。它更接近把足球評論員常說的話重新組織了一遍。這也解釋了為什么12家模型的預測結果經常高度一致,它們讀的是同一批公開信息,用的是相似的推理邏輯,得出同一個結論并不奇怪。
但在這層“復述”之下,也有不同的技術路徑。
最輕量的做法是純prompt工程,把球隊信息塞進提示詞,門檻低、傳播快。但模型輸出看上去很像“專家”,經不起統計檢驗。
往上一層是RAG檢索增強,解決了信息新鮮度的問題,但檢索到的信息可能比較片面,模型只會更有條理地得出一個片面的結論。
第三種是多智能體協作,像一個小型分析團隊在協作,但多個Agent的意見匯總不等于預測精度提升,架構復雜了,準確率未必跟著提高。
第四種是先用統計工具算概率,再讓大模型“翻譯”。用Elo評分、泊松進球模型、蒙特卡洛模擬等方式跑出一組概率分布,大模型負責解釋和呈現。曾小健認為這是最合理的方式,足球預測首先是數學問題,其次才是語言表達問題。但這條路門檻也最高,需要獨立搭建概率模型,大多數廠商不會為一次營銷活動做這么重的投入。
圖源 / FIFA世界杯官方微博
Hongson自己搭建的FLUX·10就是走的就是這條路。他把球隊實力、攻防狀態、陣容等十個維度轉化為可計算的變量,先跑出勝平負概率和預期進球,再用大模型將結果轉化為普通人看得懂的分析。截至小組賽第三輪前,預測了64場比賽,命中率約為60.9%。
這四種路徑的門檻和準確性逐級遞增,但市場上大多數廠商仍在前兩層。歸根結底,不管用哪條路徑,模型的目標都是一致的:把已有信息整合成一個看上去合理的判斷。路徑的差異決定了信息的質量,但沒有一條路能夠讓模型真正預見賽場上尚未發生的事情。
它們還面臨共同的短板。一是預測不夠動態,首發陣容公布、核心球員缺陣、***異動,都在實時改變概率。但大多數模型做完一次預測就交卷了,沒有隨著新信息持續更新的機制。
二是缺少概率校準,模型只是在生產看起來合理的數字,而非真正可靠的概率。沒有校準和回測的預測,更像內容產品,不像科學模型。
對大多數廠商來說,優化預測靠的還是數據工程,喂更多信息、寫更好的prompt、接更全的數據源,而不是模型層面的突破。
這也揭示了當前大模型在預測類任務上的一個局限,它們擅長整合已有信息、生成看起來合理的判斷,但缺乏應對未知變量的能力。這也意味著,大模型可以是優秀的事后軍師,但還不是合格的預言家。
03.淘汰賽開始,AI的“送分題”沒了
小組賽結束,對AI來說,“考試環境”發生了變化。
這屆世界杯是參賽球隊數量最多的一屆,48支球隊中不少實力較弱的隊伍是首次登上世界杯舞臺。
這意味著72場小組賽中,相當一部分是強弱分明的對局,區分度高,AI做排序題相對簡單。但淘汰賽留下來的32支球隊經過小組賽篩選,實力差距被大幅壓縮,猜球變得更難。
圖源 / AIX財經根據咪咕官方預測數據統計計算
賽制也不一樣了。小組賽輸一場還有回旋余地,淘汰賽單場定生死。加時賽、點球大戰在歷史數據中樣本極少,模型缺乏足夠的“經驗”。Hongson提到,要想猜球更準,模型需要主動調整策略,小組賽更重視強弱差和進球上限,淘汰賽則提高低***、平局和小差勝的權重,因為強隊進入淘汰賽也會變得謹慎,不會像小組賽那樣放開打。但大多數模型沒有這種主動調整的機制。
那AI預測比賽結果的能力邊界在哪?
Hongson認為天花板不在于算出唯一正確***,而在于把概率、風險和可能的路徑講清楚。AI可以告訴你一場比賽更可能是低***還是開放局,哪些變量會讓比賽偏離預期,但它不能把足球變成確定性問題。
換句話說,AI面對的不是缺數據的問題,而是一個難以解決的不確定性問題。但這并不意味著預測本身沒有意義。
Hongson表示,世界杯預測真正有價值的地方在于它提供了一個高不確定性決策的實驗場,把結構化數據、非結構化信息、歷史經驗等放進同一個閉環里,看模型能否輸出有意義的判斷。這套方法論可以遷移到商業選品、營銷投放、輿情判斷等領域,關鍵不是照搬***模型,而是把影響結果的變量結構化,用概率表達判斷,每次結果出來后再進行復盤校準。
曾小健則認為,AI在這些場景中最合適的角色是決策輔助系統,更快整理信息、識別關鍵變量、生成情景分析、評估不同結果的風險,而不是最終拍板者。將這套預測方法遷移到其他決策場景也一樣,AI可以縮小選項范圍、量化風險,但把AI的輸出直接當結論用,就可能放大模型本身的偏差和盲區。
某種程度上,世界杯是國產大模型的一次公開的大測試。世界杯天然有流量,廠商做預測有營銷成分很正常。營銷是出發點,但結果是透明的。預測本身仍然是一個有價值的測試場景,它考驗的不是參數大小和榜單排名,而是面對真實世界的不確定性時,模型能不能表達得更誠實、清楚、可驗證。
應受訪者要求,文中Hongson為化名。返回搜狐,查看更多
友情鏈接