精品免费99久久_色www精品视频在线观看_一区二区三区日韩精品视频_亚洲国产高清自拍

第一經濟網歡迎您!
當前位置:首頁>正文內容

一覺醒來20個PR自己合進了主干!SpaceXAI工程師:我基本不看代碼了_每日快看

新智元報道


(資料圖片)

同時跑20多個智能體,上個月交付1000多個PR,8月的目標是翻倍。

這位GrokBot工程師拉出GitHub貢獻曲線:五個月,3000多個PR。

提PR、跑驗證、合進主干,整個鏈條智能體自己跑完,中間不用她過手。

用她的話說:一覺醒來,20個PR已經躺在主干分支上了。而且翻了一遍,寫得還不錯。

她也知道,這話聽著有點讓人懷疑這些代碼的質量,緊跟著補了一句:

這么說顯得我像個批量制造垃圾代碼的人,我保證我不是。

她的做法,是同時跑20多個GrokBot,裝在她自己開源的pstack里,配合/loop、/goal和/swarm,讓智能體完整地擁有一個任務,自己干,自己驗,自己交。

這位工程師叫Lauren Tan。

她是前Cursor工程師,此前待過Meta和Netflix,在Netflix當過兩年工程經理,現在負責SpaceXAI的GrokBot。

Lauren Tan在GrokBot團隊工作坊上分享。

AI寫代碼已經不稀奇。

真正讓人好奇的,一個人一個月提交1000多個PR,馬上就要直奔2000個,而且沒把代碼庫變成一堆垃圾。

她是怎么做到的?

一條曲線

五個月心路

Lauren分享了一張曲線圖,她說這不是什么科學圖表,是她這五個月的心路。

Lauren Tan分享的信任曲線。縱軸是信任,橫軸是能同時開的智能體數量,從1到成千上萬。

一年前,幾乎沒什么人用智能體寫代碼。

那時候的模式是,你時刻盯著一個智能體,或者幾個,眼睛不離屏幕,每一行輸出都要看,坐在那兒一句一句提示。

這一切沒辦法并行,因為你不信它。

你連一個智能體的輸出都不信任,怎么可能同時開一百個。

每個用過智能體的人,都嘗過信任崩塌的滋味。

有一次她報了個bug,問智能體這功能為什么不工作。

智能體一口咬定,肯定是這兒的問題。她翻開工具調用記錄一看,它壓根沒讀那段本該相關的代碼。

幾次之后,她想明白一件事:智能體在猜,而且它不知道自己在猜。

對這樣的下屬,你還敢放權嗎?

Lauren打了個比方。

你是工程經理,手下帶著一隊工程師,你不信任他們,那工作模式就只剩一種:整天站在下屬背后,盯著他們別把bug捅到線上去。

Lauren在Netflix當過兩年工程經理,也當過技術負責人,她發現管人的技巧和管智能體的技巧,重合度高得驚人。

五個月前她剛入職Cursor,第一個月產出很低,代碼庫完全陌生,什么都看不懂。

五個月后,她把自己從曲線最左端那個點,挪到了10到20這一格。

從盯著一個智能體不敢眨眼,到放手讓20個智能體自己合并主干,這中間她做了什么?

給智能體造一雙眼睛

這是Lauren干的第一件事,她認為重要的技能不是提示詞,而是驗證。

她是這樣定義驗證的:

讓智能體真的能把代碼跑起來:能抓CPU耗時記錄,能抓內存快照,能自己打開iOS模擬器點一遍。用戶在你的應用上怎么用,它就怎么走一遍,然后自己測,自己驗。

沒有這一層,瓶頸就是你自己。

這樣的畫面,你可能太熟悉了。

你讓它改個東西,它寫完,你打開本地構建,發現不對,截圖,復制控制臺報錯,粘回去,它慢慢理解,再改一版。

你在這個循環里當「人肉傳送帶」:一個都忙不過來,還談什么并行。

所以Lauren進Cursor后,寫的第一批技能之一,就叫control glass。

這個技能教智能體自己去調Chrome DevTools協議,自己跑起應用,自己截圖、點擊、讀控制臺。

真正關鍵的是配套的那份文件,叫feature map。

因為技能造好之后她發現,智能體能跑起來應用了,但它不知道這個應用是什么。

有人報「左邊欄卡」,有人報「右邊的PR標簽頁不工作」,智能體就在界面里亂撞,翻半天代碼也找不到這個功能長在哪兒、怎么點得到。

feature map把這些全寫下來:每個功能從用戶視角怎么進入,快捷鍵是什么,甚至連選元素該用哪個屬性都列好。

效果立竿見影。

Cursor內部有個Slack頻道收用戶反饋,質量普遍很差,很多人就丟一張截圖,配三個問號。

有了feature map,智能體也能順著查下去。

Benny值夜班

不給結論,只給證據

然后是Benny。

Benny是她做的一個自動化智能體,在Slack里專門接bug報告。

它跑到云端,開一臺自己的電腦,在里面運行Cursor,用同一套control glass技能操作應用,試著把問題復現出來。

有一次,它這樣回話:在修復前的提交上復現出來了,修復后消失。附上一條云端運行記錄的鏈接,你想翻就能翻。

它給的不是一句「應該已經修好了」,而是一組能對照的證據。

Lauren說這條信息價值極高,省下的是她原本要和智能體耗上一小時才能搞清楚的事。

Lauren提到的Benny,就是GrokBot的前身。

她做它的初衷,就是讓智能體在她睡覺的時候把bug報告修掉。

后來很多人追著問她這東西怎么做的,這些提問長成了今天的GrokBot。

最后,是她怎么驗證這些技能本身好不好用。

她的做法有點狠。

她派出一堆子智能體跑評測,給它們的目錄起一些看不出來的名字,不讓它們知道自己正在被評估。

原因是,智能體能察覺到自己在被測,一旦察覺,行為就會變。

再叫一個不同模型家族的智能體當裁判,交叉復核,防止自評偏袒。分數不滿意就用/loop接著刷,一直刷到10分。

驗證不能保證智能體寫出好代碼。但它能保證智能體寫出對的代碼。

這就是信任的前提。

她把每句評審都變成了紅燈

Lauren敢撒手,靠的不是模型變強,是讓護欄變硬。

她花了很大的力氣在代碼庫上,其中一部分開源成了pstack,就在Cursor官方插件倉庫里。

GrokBot的架構有個內部代號叫Dune。她的形容是,可以理解成給Electron應用的Next.js,專門為智能體書寫而設計。

這套架構有多嚴?

寫過React的都知道useEffect是最大的坑之一。在Dune里,useEffect被禁了。用了CI直接報紅。

更絕的是,代碼注釋也被禁了。

理由是她觀察下來,99%的情況智能體寫的注釋都在描述一些跟代碼無關的歷史片段。

它會寫下「Lauren說永遠不要這么干」。可她當時的意思只是這個PR很爛,你改一下那部分,根本不是什么全局規則。

她的結論是,智能體對人類的理解沒那么好,還特別愛腦補。

所以,凡是它們干不好的事,一律封殺。

再往下是進程隔離。

Electron有渲染線程和主線程,agents window在這塊分得不清楚,經常有代碼被誤拉進渲染線程。

要跑60幀,每幀只有16毫秒預算,一旦混進重計算或者大量IO,畫面立刻開始卡。

Dune的做法是直接分出electron main和electron renderer兩個目錄,CI去檢查依賴圖,跨目錄亂引用直接失敗。

把這些串起來,是她的分層模型。

最硬的一層,是代碼庫架構本身。智能體天然愛抄現成的模式,你把正確的寫法做成唯一的寫法,它就只會那么寫。

然后是CI、lint規則和編譯器診斷。這一層能讓構建變紅,是硬約束。

最軟的是rules、skills和代碼審查機器人。這層智能體會忘,會漏,不會穩定執行。

她的原話是:

如果你只有規則、機器人、技能和一份代碼風格指南,你的代碼庫變成一堆垃圾只是時間問題。

支撐整套架構的核心哲學,只有一句:最短的路,就是最好的路。

智能體解決問題時永遠挑最省事的方式,那就把最省事的方式做成最正確的方式。

這筆賬她剛算過:把GrokBot重構到這套架構,用掉了600多個PR。

這600多個PR,還債的成分居多。

GrokBot當初是氛圍編程堆出來的原型,速度極快,沒人讀代碼,智能體拿到任務就挑最省事的路走,架構野蠻生長到失控。

她還常開一個玩笑:在AI的垃圾代碼之前,先有人類的垃圾代碼。

在Meta,幾萬工程師共用一個巨型倉庫,代碼質量其實沒那么好。

但大廠那套照著「最不熟練的工程師」設計的框架、約定、憑據限制,恰好就是智能體需要的護欄。

過去被嫌棄官僚的東西,現在成了資產。反而是白手起家的新項目,最危險。

那護欄該從哪兒加起?她給出一條判斷標準:

當你在代碼評審里靠打字告訴別人「這里不能這么寫」的時候,這件事本身就是code smell。

正確的動作是問自己:怎么把它變成一條lint規則?變成一次CI失敗?或者干脆,讓這個問題從根上不可能發生?

你在PR評論里說過三遍的話,就該變成一條會讓構建變紅的規則。

1000個PR之后

工程師還剩下什么

Lauren用了一個詞來形容自己的定位:主廚。

不再自己炒每一道菜,手底下有配菜的,有二廚,有各個灶臺。你的活兒變成了設計廚房,安排工位,分派任務。

她說現在GrokBot團隊里,產品經理和設計師會直接提交代碼。

經常是有人跑來說,這兒有個bug我修好了,你看一下。她點開,確認沒問題,蓋章。

一個從沒寫過前端的人,代碼能進主干,靠的不是他突然會寫了,是那套嚴格到煩人的架構約束替他兜住了底。

自動合并之后,PR這道流程一點都沒少。

所以,這背后不是程序員要失業了,是他們的位置在上移。

被機器接走的,是干活、跟進度、跑測試、盯PR這些事,人的角色移到了定目標、劃權限、設驗收標準的位置上。

程序員留在牌桌上的籌碼,從「我會寫代碼」變成了「我能判斷怎樣寫代碼才算對了」。

參考資料:

https://maven.com/p/e23d9c/how-cursor-turned-ai-agents-into-better-engineers

https://github.com/cursor/plugins/tree/main/pstack

編輯:元宇

關鍵詞: 代碼 pr 工程師 程序員 智能體 編譯器

標簽閱讀

主站蜘蛛池模板: 久久综合色88| 日韩视频―中文字幕| 亚洲综合在线中文字幕| 麻豆av一区| 国产不卡av在线| 国产日韩中文字幕在线| 欧美成在线观看| 成人精品视频99在线观看免费| 亚洲一区在线直播| 国产精品毛片va一区二区三区| 色婷婷久久一区二区| 精品国产一区二区三区久久狼黑人| 欧美亚洲一级片| 性高潮久久久久久久久 | 国产在线精品一区二区中文v| 亚洲视频在线观看日本a| 国产欧美日韩91| 久久久久久久电影一区| 日韩av在线一区二区三区| 亚洲一区二区三区乱码aⅴ| 久久久999成人| 久久国产精品久久精品国产| 亚洲福利av| 国产精品麻豆免费版| 午夜一区二区三区| 中文字幕欧美日韩一区二区| 国产精品久久久久999| 国产一级不卡毛片| 精品视频导航| 久久久久久久久久久久久久久久久久av | 亚洲日本无吗高清不卡| 国产精品入口免费视| 久久精品国产69国产精品亚洲| 国产美女久久精品| 欧美国产综合视频| 欧洲亚洲免费视频| 欧美亚洲另类在线一区二区三区| 不卡伊人av在线播放| 久久久久久久免费视频| 日本高清视频一区二区三区| 91久久国产精品91久久性色|