關閉選單

問 AI 選股可靠嗎?八題實測:直接問答對 3 題,先給資料 8 題全對

10 秒看懂

我們拿五家美國上市公司的年報數字出了八題,用兩種方式問同一個聊天式 AI:直接問,它答對 3 題;先把年報數據給它再問同樣八題,8 題全對

原因不是它變聰明了,是它的本質:它在接續最可能出現的下一個字,不是在查資料庫。冷門的精確數字,它會「補」一個最像的給你,而且語氣跟答對的時候一樣肯定。

三個降低風險的做法:先餵資料再問、要求它列出處、重要結論換一個工具再問一次。

文章目錄
  1. 實測怎麼做:八題、兩種問法、答案對年報
  2. 直接問的結果:八題對三題,錯的那五題長這樣
  3. 先給資料的結果:八題全對
  4. 為什麼會這樣:它在接字,不是在查資料
  5. 三個降低風險的做法
  6. 常見問題
    1. 它自己有寫「數字可能有出入」,這樣還不夠嗎?
    2. 哪些問題適合直接問它,哪些不適合?
    3. AI 一直在進步,這篇實測會不會很快過時?
    4. 它推薦的股票名單,可以直接當觀察清單嗎?

實測怎麼做:八題、兩種問法、答案對年報

做法很簡單,你自己在家也能重做一次。我們挑了五家美國上市公司(Skechers、Carter’s、Monster Beverage、達美樂、星巴克),針對年報裡查得到的事實出了八題:某一年的稀釋每股盈餘、某一年的營收、首次配息的年份、哪一年獲利下滑。

然後用兩種方式問同一個主流聊天式 AI(同一個模型、同一天、關掉搜尋功能):第一輪直接問;第二輪先把這幾家公司的年報數據貼給它,再問一模一樣的八題。它的回答逐題拿年報申報的數字對答案。

下面所有答錯的例子都是實際跑出來的回答,不是我們想像的。

直接問的結果:八題對三題,錯的那五題長這樣

第一輪它的開場白就很有意思:「以下根據我的知識直接回答,部分數字可能有些微出入,供參考」。然後八題全部給出了明確的數字,結尾還補了一句「正式引用請以公司年報為準」。聽起來很謹慎,對吧?結果是三對五錯:

題目 它的回答 年報實際 判定
Skechers 2017 年稀釋 EPS 約 1.46 美元 1.14 美元 ❌ 高估近三成
Skechers 哪一年 EPS 下滑 2016 年 2017 年(2016 年其實是上升的) ❌ 年份錯
Carter’s 2018 年營收 約 34.6 億美元 34.6 億美元
Carter’s 2017 年稀釋 EPS 約 5.88 美元 6.24 美元 ❌ 數字錯
星巴克首次配息年份 2010 年 2010 年
Monster 2018 年營收 約 38 億美元 38.1 億美元
達美樂 2015 年稀釋 EPS 約 3.36 美元 3.47 美元 ❌ 數字錯
Carter’s 哪一年開始配息 2014 年 2013 年 ❌ 差一年

最值得看的是第二題。它不只把年份講錯,還替錯的年份編了一個理由:「2016 年(相較 2015 年,因大幅擴大基礎建設投資,EPS 明顯下降)」。實際上 Skechers 2016 年的 EPS 是上升的,真正下滑的是 2017 年。一個錯的答案,配上一段聽起來完全合理的解釋,這就是上一篇說的:它答錯的時候,語氣跟答對的時候一模一樣

再注意一件事:它的免責聲明說「部分數字可能有些微出入」,但它不會告訴你是哪幾題。八題裡有免責,五題是錯的,你不對答案,永遠不知道踩到的是哪五題。

先給資料的結果:八題全對

直接問(憑它的記憶)答對 3 / 8先給年報數據,再問一樣的八題答對 8 / 8同一個模型、同一天、同樣八題。差別只有一件事:有沒有先把資料給它。

第二輪,我們先把這幾家公司的年報數據貼上,再問一模一樣的八題。這次八題全對,連第一輪錯掉的「哪一年下滑」也答對了,還正確算出下滑幅度約 27%。

差別不是模型變聰明了,是工作性質變了:第一輪它在「回憶」,第二輪它在「查表」。回憶會補錯的細節,查表不會。這一個動作,就把它從不可靠的記憶者,變成可靠的整理者。

為什麼會這樣:它在接字,不是在查資料

聊天式 AI 的運作方式,一句話講完:它在預測下一個最可能出現的字,不是在查一個放著正確答案的資料庫。

星巴克哪一年開始配息,網路上被寫過幾千次,它接出「2010」的機率極高,所以答對了。Skechers 2017 年的 EPS 這種冷門的精確數字,它讀過的版本少、雜訊多,它就「補」一個最順的數字出來,補出來的東西格式漂亮、語氣肯定,唯獨可能不是事實。

這也解釋了我們的結果為什麼是這個形狀:它答對的三題,剛好都是網路上被重複最多次的事實;答錯的五題,全是需要翻年報才有的細節。你問得越冷門、越精確,它補字的成分就越高。

三個降低風險的做法

這三個做法都是使用 AI 的通用常識,不是什麼獨門技巧,但實測下來就是有效:

一、先餵資料,再問問題。把公司的財報原文或數據表先給它,再請它整理與回答。我們的第二輪就是這樣做的,三對五錯變成八題全對。

二、要求它列出處。請它註明每個數字的依據。列得出依據的拿去核對,列不出依據的當草稿看待。

三、重要結論換一個工具再問一次。兩個不同的 AI 在同一個冷門數字上補出同一個錯字的機率,比一個低得多。答案不一致,就是你該去翻年報的訊號。

最後把界線講清楚:這三個做法防的是「數字錯」。就算數字全對,該不該買仍然是另一件事,判斷生意、判斷價格、承擔結果,那些只有你能做的事,一件都沒有少。

學員在桌邊討論,表情熱絡
BOS 實體課程現場。工具給的答案,要有能力檢查,才真的是你的。

常見問題

它自己有寫「數字可能有出入」,這樣還不夠嗎?

不夠,因為那句話不會告訴你是哪幾題有出入。我們這次八題裡它有五題錯,免責聲明的措辭卻是「部分數字可能有些微出入」,其中一題還差了近三成。免責是它保護自己的方式,不是保護你的方式。

哪些問題適合直接問它,哪些不適合?

概念與方法類的問題適合直接問:本益比是什麼、現金流量表怎麼看,這些它答得又快又穩。精確的事實數字不適合裸問:某一年的 EPS、某一年的營收、確切的年份,這類問題要嘛先給它資料,要嘛自己查財報。

AI 一直在進步,這篇實測會不會很快過時?

分數會變,性質不會。模型更新後,這八題的對錯很可能不同,這是預期中的事。但「它不會告訴你哪一題錯」這個性質沒有變過,所以先餵資料、要出處、交叉驗證這三個習慣,不管模型多強都不吃虧。

它推薦的股票名單,可以直接當觀察清單嗎?

可以當清單的起點,就像從生活裡找到名字一樣,但起點不是買進的理由。名單上的每一家,還是要自己過兩關:讀財報確認它真的賺錢,算價格確認買得不貴。清單怎麼建、之後要做什麼,我們寫在觀察清單那篇

林修禾 Joshua Lin

本文作者|林修禾 Joshua Lin

投資與教學資歷都超過二十年。教學橫跨三個階段:從兒童理財教育起步,到成人的價值投資,再到近年的量化交易。曾創立三間公司,並以價值投資建立起財務上的獨立與自信,也擔任過台積電的理財培訓師,是價值投資的國際級講師。他始終相信,理財是為了把生活過得更好,而看懂財報、獨立思考,遠比追逐明牌或現成的答案更重要。

延伸閱讀

實測方法:撰寫當日,對同一個主流聊天式 AI(關閉搜尋功能)進行兩輪各八題的測驗;對照答案取自財報資料庫的年度申報數據,與各公司 10-K 一致。文中所有「它的回答」皆為實際輸出的逐字紀錄,完整題目與回答留存於內部檔案。模型持續更新,重測的分數可能不同,但文中討論的性質不隨版本改變。

本文內容僅為教學說明,不構成投資建議。文中公司僅為測驗題材,非推薦標的。

相關條目:聊天式 AI、幻覺(Hallucination)、每股盈餘(EPS)、年報(10-K)、交叉驗證