搜尋此網誌

顯示包含「投資AI」標籤的文章。顯示所有文章
顯示包含「投資AI」標籤的文章。顯示所有文章

2026年6月15日星期一

Space X 上市文件看AI 啟示


從Space X (SPCX)上市文件S1的第一頁顯示的行業分類代碼(Industrial Category Code)是7370,行業類別是屬於computer programming and data processing, 亦即是AI data center 。整篇文件都列出三項業務發展:1)Space發射火箭為業務基礎;2) Connectivity 星鏈Starlink 為業務;3)xAI, 是Space X 於2026年2月從Elon Musk和11個創辦人收購合併而納入Space X旗下。


圖一:



圖二:




除了行業代碼列明SPCX的行業類別是AI data center,從文件中的TMA (Total Addressable Market)潛在可服務市場總額為28.5萬億美元,其中AI的TMA是26.5萬億美元,佔總TMA的92%,實實在在告訴我們SPCX是一間AI公司!



那麼,看星鏈和Space發射火箭業務如何賺錢,都不是SPCX的主菜,SPCX的重點業務是AI, 文件有提及xAI還包括人型機械人的AI應用,但AI的收入主要來自廣告、API和Subscription ,看來應該主要來自Grok的商業應用。


問題來了,如果SPCX是一間AI公司,競爭對手便是OpenAI, Anthropic, Qwen, Deepseek, Gemini, Mistral 等等,1.7萬億的估值⋯⋯🤔


我認為更值得關注的是AI 的Capital expenditure 資本開支於2026年1月- 3月達$7,723 million,是Space和Starlink於2025年全年加起來的總和(Space =$3,832 million + Starlink = $4,178 million),而Space X才只是於2026年2月才併入xAI。AI 基礎設施的燒錢程度可見一斑!




買Space X股票都是在買未來願景,而xAI的基礎建設未來是低軌太空數據中心,莫說射100萬個數據中心上低軌太空可不可行,究竟太空數據中心系統的運作和散熱問題如何解決,YouTuber Yolo街在其影片有所分析:




https://youtu.be/nB6vWo5KIE0?si=bVeZCegzVkYV2EUz


太空數據中心還有很多未解決的難題,能不能夠實踐,真的只能是In Elon Musk, we trust!


觀從Elon擁有93%B股(1股10票),散戶買到的A股(1股1票)只佔12.3%,亦即是Elon 擁有公司的所有話事權、決策權,散戶買SPCX也真的是”In Elon, we trust!” 


筆者在去年的文章指出,AI的資源消耗是跟使用量一同上升,這方面不單止從SPCX文件看到,即使cash cow如Alphabet 都因為AI數據中心而要撲水,Google 母公司Alphabet早前便透過股票發行和股票出售籌集超過850億美元,為其AI基礎設施建設提供資金。 谷歌母公司多年來都是回購股票,而不是發行股票。可想而知AI基礎設施的資金需求很大,而如果AI大規模應用,這方面的開支又更大,除非AI技術出現突破性的改變。


其中一種技術突破,如DeepSeek模型透過增加演算法效率和使用專家混合(MoE) 等架構突破,令人工智能推論成本大幅下降。


另一技術有待突破可能是要摒棄LLM模型,再另開發新的AI技術。又或者NVDA改善晶片,才能真正改變AI行業燒錢的弊病!


2025年11月12日星期三

AI 晶片的生命週期是2-3年定還是6年?




 事先聲明,我只想弄清楚一些理據,而不是在放負。網上資訊很多,孰真孰假,各自判斷。

金融海嘯The Big Short主角Michael Burry大手沽空Nvidia, 其中Burry認為數據中心的GPU/伺服器的生命週期只有2~3年,會計上不應該延長使用年限,認為巨頭們降低折舊金額,從而提高利潤,有做假之嫌。但另一方反駁指出,其實AI 晶片的生命週期不是2~3年,而是6年,兩者差距達一倍時間,究竟誰是誰非?

我認為準確判斷AI 晶片的生命週期長短很重要,因為這反影數據中心的燒錢程度,除此之外,還有電和水的供應限制,經營AI 年代的數據中心,成本可能大幅抵消盈利。

曾跟硬件工程師討論這個問題,他指出AI晶片的生命週期的確可以延至6年,但AI的不斷發展,運算需求和速度不斷增加,因此也會要求晶片轉換至更快、更有效率和減低耗電和減少發熱量,所以一般只會用到2-3年便更換,雖然晶片可用至6年,但這會落後於發展形勢。

另一方面,由於美國現時的電力和冷卻用的水受到限制,地方亦有限,要維持AI的領先地位,一般會選擇2-3年更換新的AI 晶片,以增加效率,減少耗電和減低溫度。但又不至於一次過完全替換,而是分批換,因為替換的成本也不少,不過這批用了2-3年的晶片仍然可以在二手市場出售,計及折舊,還是可以抵消部份更換成本。所以AI晶片週期多於2-3年的說法也是無誤的!

中國方面,由於供電量大,供水也不缺,但欠缺的是技術更佳的AI晶片,那麼沿用晶片至6年也不成問題,甚至疊加使用,來彌補技術的不足。即使有新AI晶片,也未必需要舊換新,而是在旁邊再延伸建設,舊的繼續用。

我打個比喻,例如一個房間的尺數已經限制了,房間放滿了掘Bitcoin 礦機,如果要礦機能夠長期快過對手掘出bitcoin, 一是每兩年更換礦機,一是加多些冷氣機散熱讓礦機可以維持穩定運作和掘出Bitcoin 。這是我想出最佳的表達方式,畢竟我還是比較熟悉crypto運作!🤣

事實上,發展AI的數據中心,也真的與掘Bitcoin礦機相似,礦機算力一旦落後於對手,便會比較難掘出Bitcoin, 礦場盈利便會大減,甚至蝕本!

有說我對投資AI相關股票持保守態度,或者這樣說,我認為自己對crypto 的認知更深,例如Bitcoin的電腦節點是去中心化,營運算力成本也是分散至世界各地的電腦節點,當算力減少的時候,程式困難度下調,令掘出Bitcoin更容易,這樣,bitcoin 的區塊鏈仍可持續運作。

AI競賽中,競爭很大,如果要保持競爭力,便要不斷更新!但環境限制令基建無法擴張,只能透過2-3年更換新的AI晶片,如果經濟衰退,需求減少,算力便會過剩,是一定的風險!


2025年9月16日星期二

Fake It Before You Make It

 



上週看到一宗報道:「Tesla 創辦人 Elon Musk 在 All-In 峰會上重申對人工智能發展的預測,指出 2026 年 AI 智力將超越任何單一人類個體,到 2030 年更會超越全體人類智慧總和。」

AI應用者和開發者有着不同的經歷,因此對以上Elon Musk的講法都有不同感受。

AI應用者用不同的AI來完成手上工作,有了AI幫手,完成工作的時間比未有AI之前快了90%,所以AI對生產力的貢獻是毋庸置疑!這亦很容易令人相信AI很快便能取代人類!

對於新技術開發者,對AI的要求便會提升至另一水平,就是寄望AI能幫忙解決難題,它提供解決方案的能力!

既然講的是「新」技術,開發者好多時會遇到以前未見過的難題,然而,AI的所謂智力,其實只是基於訓練數據有的東西,即是曾經有的,極其量是混合過去的資料再提供方案,因此提供了一堆錯的方向,當然,尋找解決方案,很多時是透過trial and error,所以AI提供錯的方向,又不能說它幫不到手,因為您試完它的方案之後知道是錯的方向,起碼幫忙否決錯的方向,然後自己還是要再思考還可以怎樣做?最終開發者都是靠自己想出解決方案,試完之後成功了。因此當一個開發者同你講,AI取代人類之說其實還有一段很遠的距離,那是因為大家面對不同的難題獲得不同的經驗,應用者需要AI更有效率完成工作,它提升的助力是90%,但對於開發者而言,它提供的助力是10%,就是那些錯的方向!

以copilot 寫program和debug,跟以上說法一至,工作進度是快了,但有些難度的問題,還是由自己解決。

「Musk 警告人類智力正處於停滯狀態」,這些說話,對於一般人的意思是:「你不擁抱AI, 就會被AI取代」這說法的確所言不虛!不過,對於開發者,這些說話等同廣告宣傳!

目前最多的AI使用者是OpenAI的ChatGPT, ChatGPT是現時最多人用的LLM, 佔全球市場的七成,所以我在講AI的主要發展時,暫時主力講ChatGPT。GPT5一直被宣傳為博士級的AI, 但出台不久,便不斷有人指出GPT5比GPT4o並不見得很大進步,AI幻覺仍未解決,甚至劣評如潮至下架。有分析指出,在LLM的基礎上,AI幻覺難以解決,原因是訓練數據是由網絡而來,garbage in garbage out, 而LLM的設定是根據人類語言庫中提取的模式,預測統計學上最有可能的下一個字,這做成LLM即使不知道答案,仍然推段用戶想要的答案,造成AI 幻覺(hallucination),因而一些技術人員認為被教壞了的AI, 即使再增加輸入更多資料和數據、增加更多用電量,其實LLM增長程度不多,這很大的程度顯示LLM已到了天花板!為何LLM發展出AGI是取代人類的重要理程?一陣再講!

在此我舉個例子,如果一個智商大概60跟另一個智商大概70的人比較, 對於一般人而言,智商60和70的分別其實不大,這大概就是GPT5 和GPT4o的比較,亦是現在所遇到的問題! 而要我們清楚地區分智力水平,一個普通人的智商平均是100,智商70和智商100是明顯的分別!轉換是 AI智力,用電量要增加幾多才能令人感覺AI的智力有莫大的差別?直到現在,科技巨頭對AI的用電量仍然是三緘其口!。但MIT 對AI與電力需求進行了分析,他們分析了美國整體公共和私人企業對AI的使用數據量,轉化為對數據中心的具體需求時,研究人員得出了一個明確的結論。 2024年,美國的數據中心使用了大約200兆瓦時的電力,這大約相當於為泰國的一年電力供電量。 據估計,這些數據中心中的人工智能專用伺服器耗電量在53至76兆瓦時之間。 以最高峰估計,這足以為超過720萬個美國家庭供電一年。



國際能源署的特別報告《能源與人工智能》對能源與人工智能之間日益增長的聯繫進行了迄今為止資料最全面的全球分析。 該報告預計,到2030年,全球數據中心的電力需求將增加一倍以上,達到945兆瓦時(TWh)左右,略高於現時日本的全國用電量。 人工智能將佔這一增長的最大部份,預計到2030年,人工智能作為數據中心的主要電力的需求將增加4倍。

雖然AI的形式很多,有AI gen 圖片、影片、AI generate coding、AI翻譯等等,但LLM並不僅僅是聊天機器人,也不只是AI的其中一種!

LLM又稱為大語言模型,當中的「語言」聽起來與視覺AI無關,但實際上,LLM提高了AI對語言上下文的理解、解釋和生成類似人類文字的能力,使複雜的聊天機器人、翻譯、總結、程式生成和內容建立成為可能。在圖片生成的過程中,用戶要用文字寫prompt, AI要先理解用戶的文字prompt,由文字生成圖像。用AI製作影片或程式生成也一樣,用戶首先要以文字表達prompt, AI對用戶的文字理解都是以LLM發展為基礎,可以說AI的發展基礎是語言理解為主的LLM。

Elon Musk認為2030年AI的智力將高於人類智力的總和,智力/intelligence, 如果只以記憶儲存和運算速度來比較,人類肯定被比下去,但人類的intelligence 不止於此,intelligence 還包括創造、passion ,人類透過過去經驗、教育、資訊融匯貫通後想出另一套以前沒有的概念、製造以前沒有的東西來改善生活,我稱之爲創造,我不會說AI不可能創造,但起碼在我現在的經驗,AI未能創造,對以前沒有的東西,還未能提出可行的方案去創造,從無到有!當Musk認為AI的智力超出人類,也即是預計LLM+reasoning將發展出有如人類智商的AGI,但暫時而言仍然不見到AGI的發展勢頭,如果無法發展出AGI, AI的智力如何與人類一較高下?

Elon Musk 認為2030年AI智力超人類總和,我認為解決到用電量和用水量的問題,無限及低供電成本以迎接AGI的耗電來臨,才再講大規模取代人類!

雖然一般而言,對科技需求上升會令成本下降,我也相信AI 硬件的成本會下降、訓練成本也會隨着技術成熟而下降,但運算AI使用的電力需求只會隨着使用量增加, 因為起核數電廠需時和冷卻數據中心和核電廠都需要大量水的供應,如無法追上AI爆炸性需求的增長, 而最終跟人類的需求爭奪資源,從而令服務成本增加,而如果AI發展沒有太大進步,例如達不到AGI, 人們對投資可能會下降!

科技巨頭吹噓AI智力超越人類,因為一間又一間的AI公司…OpenAI、X AI極可能上市以套取更多資金,在創科界有句名句「Fake it before you make it」,Sam Altman 和 Elon Musk等科技巨頭對自己的產品吹捧有餘不足為奇,大可視為「Fake it before you make it」。但我自己作為投資者會查找技術的不足,改變到便飛上枝頭,改變不到便…..





2025年8月24日星期日

AI泡沫像2000年科網泡沫?

 


近日美國傳媒不斷吹風指AI泡沫像2000年科網泡沫,尤其MIT一份報告指出95%的AI startup都沒有盈利,但估值以億計,VC創投公司以數以百億計的資金投入AI startup公司與及科技巨頭以千億計投入數據庫等基建,在上篇文章「投資AI 概念股的風險與迷思 - 4: 商業模式的迷思」,有網友亦提出「Microsoft 正不斷增加 CAPEX 建設同租賃數據中心」,並且指出商業需求大到數據中心應接不下,俗稱「起唔切」以應付商業需求!筆者不想過於執着爭抝數據中心CAPEX是否oversupply, 但我只想指出一些大衆並未提及,並且可能是大衆的盲點!

我經常這樣想:「如果不投入行業內,單是以投資者身份(而且是散戶)投資,單看傳媒的資訊,公司的公開資料,是很難看到行業內的問題,什麼work、什麼唔會work」,此所以我與CTO全身投入區塊鏈加密貨幣行業,一方面是回饋行業,另一方面查找深層次問題。不過,我今日不是講加密貨幣行業內有什麼問題,而是想講我在創科界及AI startup的問題。

好多人以為,只要你的startup 有AI名堂,便會輕易獲得投資者數以百萬美元的投資,其實是不是你們想得那麼美。Startup首要想的問題是:「你的公司可以什麼來交換投資者的資金?」Google、AWS、Microsoft 這些公司不時都有創投比賽,然後贏出獎項便獲得他們的投資,say, 如果你的startup 獲得Google投資後,你估你的startup 是否可以成為AWS的客戶買AWS雲端數據服務?其實這跟OpenAI與Microsoft Azure雲端運算關係一樣,這大概讓你明白生態圈是怎麼一回事! 然後就可以聯繫到95% Startup正面臨「瓜定菜」的命運⋯⋯

再者,現在美國是否因關稅戰、貿易戰將進入衰退週期?並且加上AI大規模取代入門工作,失業率上升,消費下降,然後又loop返去經濟生產總值GDP的七成是來自消費,最終導致企業經營環境惡化,然後又返回那些主要serve 企業客戶的「瓜定菜」AI startup!95%就嚟「瓜定菜」AI startup的命運肯定較科技巨頭脆弱,不過也別以為對它們無影响!

至於數據中心是否oversupply ?

根據ascendixtech.com數據所得,全球有約70,000間AI startup, 其中17500間在美國,而位處美國就有5381間數據中心,或者你可以說每individuals每天都在使用AI,問AI 問題!全球需求龐大!




另一個數據需要注意的是,2025年第二季科技巨頭的CAPEX增長是歷年最大:



 Anyway, 是否泡沫便各自判斷了!泡沫與否,通常是爆了之後才知道,過去咁多次都一樣,1997年亞洲金融風暴、2000年科網泡沫、2008金融海嘯,沒有一次是預知的!



PS. 我有個想法是,AI科技是國與國之間的較勁,誰最快搶佔global market,誰獲得最多人類的數據,進入下一階段發展,即AGI ! 所以就算AGI成本如何昂貴,亦一定會發展出來!因此,即使AI 泡沫也只會是短期的憂慮!  VC其實也是跟國家需要而做事!


2025年8月12日星期二

投資AI 概念股的風險與迷思 - 4: 商業模式的迷思

 


Sam Altman 從一開始的AI發展願景是取代人類工作為目標,這打從他發行加密貨幣Worldcoin作為Universal Basic Income (全世界民基本收入補助金)已經劇透!而打從OpenAI上線之後,排山倒海陸續推出的AI agent產品都以取代人手為目標,因為容易吸引想減成本的企業使用。第一個問題是以程式自動化程序而大量減省人手真的好嗎?第二是這個目標是否正確?第三個是寡頭壟斷巨企真的會賺幾多錢便回饋相等的利益作為UBI給予世界嗎?簡單問心一句:「您會嗎?」

有句說話在網絡上看到,很認同:

No business has become the jewel of their industry by just cost cutting.

簡單而言就是,科技不會因削減成本而成為行業之寶,而是透過改變人類做事的方式,從而令人們生活改善,工作量減少,卻同時能增加收入,才是好的改革,而現時我們在AI發展方面未曾見到的!

生產力對經濟的GDP要有正面影響,除了追求產出增加和每件產品成本下降外,人們的收入有否增加才是推動經濟的重要影響。

儘管很多人每天都在使用AI, 但它的商業模式你了解幾多?

迷思一:現時的所謂Agentic AI, 只是將原本人類做的工作程序改以程式自動化,過程只是減省人手成本,並沒有創造,大幅裁員並不會帶來經濟動力,反而導致消費下降,因此便出現這句說話:No business has become the jewel of their industry by just cost cutting。

迷思二:真正的AI代理,必須要有作出決策能力,然而,AI幻覺仍然間中出現,人們還未能完全信任,即是人類仍然要介入作出決策,實際的經濟貢獻並未如想像中大,這同樣應用於自動駕駛和人形機械人。

迷思三:常聽到人說,以AI的神助力,人們無需認識程式碼也可以寫出一個app, 程式員要失業了,但其實這只是一種宣傳,誇大vibre coding 的好處。我的質疑是,用戶不懂程式碼,只以prompt 寫出應用程式,若他不知道AI寫了什麼,當應用程式出了問題時,他如何修改?當越來越多人用的時候,他懂得如何改進程式碼嗎?最近便發生了以vibre-coding 寫出的app名為TEA, 應用以女性舉報危險男性人物為主,迅速獲得40,000 女性使用,但開發者沒有保安意識,應用程式用戶成為了黑客的外洩資料自助餐!




https://www.youtube.com/live/tiD_7Td7yYQ?si=htBpjhqBdqcBH9tO

迷思四:上篇文章提到,AI的投資大,成本同樣大幅增加,數據中心的用水量和用電量大幅增加,營運數據中心的成本較web2幾間寡頭壟斷企業大幅增加,但科技巨頭對這些數據透明度很低,究竟web2的免費模式和泛濫使用會否令支出成本惡化?

令人更感不安的是,這些數據中心都選址在乾旱地方,原因是要保持儀器乾爽,以達至運作效率良好!又要選址乾旱,又要很多水來冷卻系統,兩者互相矛盾,結果是跟人類爭奪飲用水的資源。有網友指出Microsoft 把數據中心建於深海中以解決冷卻問題,但以最近期的資料看,Microsoft 正在減少數中心,報道指是由於oversupply, 但當中還有沒有其他不為人知的數據便不得而知!因為現時oversupply, 如果預計未來使用量增加,便不會是cut 數據中心了!





https://www.reuters.com/technology/microsoft-pulls-back-more-data-center-leases-us-europe-analysts-say-2025-03-26/

迷思五:當涉及人類寶貴資源,AI的應用便應該寶貴資源寶貴用,而不是用於無聊的事情上,例如傾偈、Gen 一些無聊相片呃like! 我在之前另一篇文章都質疑過,為何用那麼多資源訓練AI抄襲吉卜力風格動畫,而人們的應用只是在社交媒體吹水呃like,排山倒海的YouTube 片呃點擊?對經濟增長有用嗎?一般人都能以尹光的聲音唱歌對樂壇發展有何益處?

迷思六:有種說法是,科技巨頭現在燒錢搶市場份額,但我的質疑是web2式winner takes it all 能夠在AI應用復製嗎?事實上,私人企業是不會想跟這些寡頭壟斷科技巨企分享公司的資料和數據,企業只會投奔向開源LLM和Gen-AI, 允許用戶在自己的電腦上離線運行AI模型。這樣,先行者的OpenAI便沒有優勢,上週Open AI也開放源碼,winner takes it all 的神話已經打破!而且國家與國家之間肯定對個人和企業數據更緊張,web2式壟斷都不會出現的!那麼,投資和使用成本龐大的AI能否一如預期賺得豐厚利潤也是一個謎!

OpenAI本業是建設AI基礎網絡、訓練AI, 現不斷擴張業務,跟Google 和Microsoft 爭飯碗, 顯然是本業不能提供足夠盈利以持續發展。

迷思七:科技巨頭經常說AGI的發展近在咫尺,這其實可能只是以動聽的故事來不斷吸資的伎倆而已,多個硏究報告(包括蘋果公司的”The illusion of thinking “)都指出AI並未真正擁有推理能力,因此何時才可達至AGI仍然是個謎。有網友問了一條重要的問題:「AGI是怎樣定義?」不同的定義引發不同的理解,從而引致很多誤導和誤解,而不作定義的目的當然是方便吸資及龍門任搬吧!

迷思八:蘋果手機的Siri是首個AI助手應用,我記憶中Siri的初期三數年的確表現優秀,口語寫作快而準,但往後數年,Siri 好像越來越蠢,坊間解釋是Siri的主要開發員離開蘋果公司之後,Siri 的營運和保養無以為繼,有沒有感覺開發員出逃的情況有點像現時的OpenAI?另開發人員開發至一個程度會否感覺觸及天花板,發展無以為繼而需要依靠不斷出逃來增加收入?

迷思九:以Siri作為發展助理的前科,蘋果公司在面對競爭對手不段以AI助理作為招徠,它卻選擇跟Google、Perplexity 、千問Gwen合作,而放棄自行開發,當中是否涉及蘋果公司已經掌握了一些有關發展AI的經驗和支出是我們不知道的?換句話說是「I’ve been there!」?!!

以上問題都需要思考。


2025年7月10日星期四

投資AI 概念股的風險與迷思 - 1




我們每天都在用AI寫信、寫文章、編輯 、校對、分析股票、問健康問題、旅遊問題、Gen 圖在TG 谷吹水使用,那麼有用的工具,自己投資都是理所當然,而且大部份的人都認定AI發展是未來,投資AI概念股有買貴,無買錯,對嗎?真的是這樣嗎?有沒有想過現時OpenAI的發展方向可能有問題?

2023年OpenAI開發的ChatGPT推出之後,傳媒及一些行外投資人不斷吹噓AI取代人類工作,尤其低層及中層工種將面臨大規模裁員,引發很多打工一族的疑慮。繼ChatGPT 之後,科技巨頭紛紛推出大語言模型,Claude、Gemini、 Llama、Grok、Deepseek相繼推出,而LLM(Large Language Model)的發展陸續轉向另一里程LRM(Large Reasoning Model),LRM的發展對AGI (Artificial General Intelligence*)尤為重要,科技巨企及VC都大量投資於AGI,AGI是指人工智能擁有有如人類智慧水平的理解、學習、自我改進和應用知識的能力,此為self learning 的AI。這些有如人類的學習能力,理論上像人類般能夠舉一反三,從一個領域的學習與轉移到另一個領域,甚至能夠獨立作出決策,而無需持續的人類指導。由於擁有人類的推理能力,AGI亦應該能夠處理不同專業能力及預見問題。

AGI的不斷自學及不斷自我改良能力,對未來人型機械人和無人駕駛車在路的自主決策能力和發展能否擴大(scalability)起關鍵作用!

然而AI reasoning被受質疑,最被受爭議的是蘋果公司的「The illusion of Thinking 」,很多質疑都針對蘋果公司沒有追上AI發展潮流,現在只能透過與AI 公司合作(包括OpenAI、Perplexity 、千問等),iPhone 才能擁有AI能力。

筆者看罷了兩份正反兩面的報告:「The illusion of Thinking 」和「The illusion of the illusion of Thinking 」,加上CTO使用Copilot寫codes 的經驗,筆者傾向認同蘋果公司的「The illusion of Thinking 」。

蘋果公司的「The illusion of Thinking 」報告中,AI研究人員利用益智遊戲河內塔(Tower of Hanoi ) 和渡河(River Crossing),這些遊戲能在規則保持不變的情況下,可逐步調整困難度來測試LRM的推理能力。

研究以三個階段(簡單、中度、艱難)來調整兩項遊戲河內塔和和河道口的困難度,看看這些模型的思考能力,結果發現:

1. 簡單的問題:標準模型更快、更準確,使用更少資源。

2.中度問題:LRM在這裡做得更好。 他們反思的、一步一步的思考顯示了價值。

3. 艱難問題:兩者都失敗。 問題越複雜,LRM解決它所付出的努力就越少,很早便放棄了。

隨著問題的複雜程度增加,LRM模型會開始減少推理,直至臨界點,它們會完全崩潰,即使增加它們的資源,它們仍然會停止產生準備確的解決方案,甚至完全放棄。

研究指出,最令研究人員驚訝的發現是:即使提前給模型提供了正確的演算法,它仍然很難可靠地執行。

蘋果公司的研究人員透過跟蹤這些LRM模型如何產生中間解決方案來檢查這些模型的內部「思想過程」,從中發現這些LRM 在遇到困難度高的題目時花了很多時間在錯誤的選項中徘徊,出現過度思考的現象。

報告結論是,這些模型並不真正知道他們何時走上了正確的軌道,他們無法從好的推理經驗中辨認出好的推理意識。 這不僅僅是一個技術限制,而是有關基礎問題。這發現很重要,因為這關乎對AI的信任、它的判斷力,以及我們未來如何與機器合作有關,當我們越來越多向AI尋求支援,涉及的範疇在學習、發展、業務戰略和決策方面,我們是否高估了這些系統能做什麼?

蘋果研究團隊在論文的最後指出,儘管很多炒作,但目前的模型可能會觸及一堵牆。 他們認為,僅僅擴大計算和提示技術可能不足以達到真正的推理。

這結果令人重新審視AI的真正推理能力。

另一方面, Anthropic 公司的的報告題為「The illusion of the illusion of Thinking 」 ,對蘋果公司的報告作出了反駁,他們認為測試至艱難程度時,這些模型並沒有足夠token完成任務,因此出現「放棄」情況。

為何會出現token不足的情況?這報告指出,蘋果公司的研究測試要求模型列出每次移動決策過程(這可能是研究人員需要跟蹤模型思考過程),結果造成了多次重複使用token。這情況下,變成每次模型糾錯的解決方案時都逐個評分,這項限制可能會導致錯誤分析。

他們認為不應該忽視模型在解決河內塔問題時明確指出「模式仍在繼續,但為了避免太長,我將到此停止」。 這表明模型理解解決方案模式,但由於實際限制,選擇截斷輸出。結論是模型的失敗是源於實驗設計的問題。

我不想糾纏哪一個測試研究的對錯,只是想列出「The illusion of the illusion of thinking 」的另一面思考。

其實並不只蘋果公司的研究報告質疑AI reasoning ,另一份研究報告「Why Do Multi-Agent LLM Systems Fail?」亦質疑AI執行的準確性。

近日AI agent成為AI另一發展焦點,Multi-AI agent system越來越多涉及不同工作領域,如software engineer 、healthcare、藥物發現、科學模擬等等,初創企業均以開發AI agent 來處理複雜、multi task 任務和不同環境動態互動,然而報告測試發現,multi-AI agent system 處理這些工作的錯誤率為66%,準成度受到質疑,這使得基於LLM的AI agent系統獨立處理現實世界的問題被受質疑。





個人經驗而言,我們的CTO也有使用copilot寫code和debug program, 他的經驗是AI寫program只能是提供一個框架,debug時也只是提供另一個意見,在正確執行上仍然需要程式員完善和完成,更遑論一個不懂程式的人可以靠幾句prompt寫出複雜程式和網站功能出來,而技術門檻低的應用程式和網站功能又要面對激烈競爭。所以大部份吹水評論指程式員會無工做是高估了AI的能力,或許AI能夠取代的只是低級程式員而已!

說到這裏,我們開始重新審視AI獨立決策的未來能否真正執行?這只是問題之一!

問題之二留待下次再談!Stay Tune!