
DeepSeek-V3.2-Exp ka arritur si një version eksperimental që përqendrohet në efikasitetin në shkallë të gjerë dhe në kontekste të gjata, me një apel të qartë ndaj komunitetit: burim i hapur, bërthama të publikuara dhe një API më i lirë.
Përtej zhurmës, çelësi është se ky model, bazuar në V3.1-Terminus, prezanton një mekanizëm të hollësishëm të vëmendjes së rrallë të quajtur DeepSeek Sparse Attention (DSA) që përshpejton trajnimin dhe nxjerrjen e përfundimeve duke ruajtur cilësinë. Kompania e ka lançuar tashmë atë në Aplikacion, Ueb dhe API, dhe ka ulur çmimet e përdorimit me më shumë se 50%, një veprim agresiv që, sinqerisht, e shtrydh konkurrencën.
Karakteristikat kryesore të reja të DeepSeek-V3.2-Exp
Inovacioni kryesor është DSA, i cili lejon një vëmendje selektive në pjesët përkatëse të kontekstit pa kaluar në mënyrë të plotë nëpër të gjithë sekuencën. Sipas vetë kompanisë, ndikimi në cilësi është shumë i ulët, ndërsa rritje e efikasitetit në kontekst afatgjatë është i prekshëm.
Në dispozicion, modeli është funksional në aplikacion, ueb dhe API që nga dita e parë, e shoqëruar me një rënie të ndjeshme çmimesh (50%+) për të lehtësuar testimin dhe adaptimin. Për ata që duan të krahasojnë, DeepSeek mban një pikë fundore e përkohshme nga V3.1-Terminus deri më 15 tetor 2025 në orën 15:59 UTC.
Performanca dhe testet e performancës së DeepSeek-V3.2-Exp: barazi me V3.1-Terminus
DeepSeek ka kërkuar për barazi me V3.1-Terminus në një gamë të gjerë testesh, pikërisht për të izoluar efektin e futjes së vëmendjes së shpërndarë. Në praktikë, kjo rezulton në metrika të krahasueshme në arsyetim, kodim dhe përdorimin e mjeteve të tipit agjent.
Burime të ndryshme ofrojnë shifra që ndihmojnë në përcaktimin e pritjeve: V3.2-Exp përshkruhet si një model me 685 miliardë parametra dhe performancë të ngjashme ose me ndryshime të vogla në varësi të fushës. Në arsyetimin pa mjete, citohen numra të tillë si 85.0 MMLU-Pro dhe 89.3 në AIME 2025; në skenarët e agjentëve, 40.1 shfaqen në BrowseComp dhe 67.8 në SWE i verifikuarKëto janë rezultate që përputhen me rrëfimin zyrtar të vërtetoni efikasitetin në vend që të ndiqte një hap të madh në saktësi.
Madje ka edhe krahasime të shkëlqyera: në detyrat e kodimit, një rritje në 2121 në Codeforces krahasuar me vitin 2046, ndërsa në testet më humaniste vërehen rënie të lehta (p.sh., 19.8 krahasuar me 21.7 në Provimin e Fundit të Njerëzimit). Në përgjithësi, tabela sugjeron ekuilibërpërmirësime specifike dhe lëshime të vogla, me shpejtësinë si fokusin kryesor.
DSA: Vëmendje e shpërndarë me imtësi, e thënë qartë
Kujdesi klasik bëhet i kushtueshëm me kontekste të gjera; DSA minimizon punën aty ku kontribuon pak. Duke aplikuar rrallësinë me kontroll të imët, modeli përqendron llogaritjen aty ku në të vërtetë gjen sinjalin, duke përmirësuar gjendje latente dhe uljen e konsumit, pa shtrembëruar prodhimin.
Në nivelin e përvojës reale, kjo është e dukshme në detyrat që kërkojnë shumë kontekst: përmbledhje të gjata dokumentesh, analiza e regjistrave, agjentë që mbajnë dialogje të gjata ose kanale që përziejnë rikuperimin dhe gjenerimin. Pikërisht aty, efikasitet Nuk është luks: është ndryshimi midis diçkaje që është e përdorshme në shkallë të gjerë apo jo.
Disponueshmëria, çmimet dhe krahasimet e DeepSeek-V3.2-Exp
DeepSeek ka njoftuar se V3.2-Exp është tani i disponueshëm në Aplikacion, Ueb dhe APIPërveç kësaj, ka ulur çmimin e API-t me më shumë se 50% me efekt të menjëhershëm, një vendim që synon të zgjerojë miratimin dhe të inkurajojë teste krahasuese.
Për ata që duan të krahasojnë me modelin e mëparshëm, V3.1-Terminus mbahet në një pika e fundit i përkohshëm deri më 15/10/2025 15:59 (UTC). Kompania gjithashtu fton dorëzimet reagim përmes një forme publike, duke përforcuar një dinamikë përmirësimi të vazhdueshëm me komunitetin.
Statusi i burimit të hapur: peshat, raporti teknik dhe bërthamat
DeepSeek publikon modelin në Hugging Face, së bashku me një raport teknik që dokumenton ndryshimet dhe rezultatet. Ekziston një angazhim i qartë për transparencë dhe për promovimin e kërkimit të aplikuar afatgjatë me kosto më të ulëta.
Në nivelin e kernelit, ekzistojnë dy mënyra: TileLang për lexim dhe prototipim më i arritshëm dhe CUDA për performancë maksimale. Bërthamat e indeksit Logit (duke përfshirë variantet e faqosura) janë në DeepGEMM, ndërsa ato me vëmendje të shpërndarë publikohen në FlashMLAKjo ndarje ua bën më të lehtë komuniteteve të orientuara drejt kërkimit dhe prodhimit të gjejnë vendin e tyre.
Ekzekutimi lokal i demove të DeepSeek-V3.2-Exp dhe inference
DeepSeek ofron një depo të përfundim me një demo të përditësuar për të filluar shpejt dhe për të inspektuar arkitekturën. Hapi i parë është konvertimi i peshave të Hugging Face në formatin e pritur nga demo, duke përcaktuar numrin e ekspertëve dhe paralelizmin e modelit.
Shembuj komandash për konvertim dhe gjenerim interaktiv (vendosni EXPERTS=256 dhe MP në numrin e GPU-ve): mund të përdoret siç është në një mjedis të përgatitur.
eksportimi i përfundimit cd EXPERTS=256 python convert.py --hf-ckpt-path ${HF_CKPT_PATH} --save-path ${SAVE_PATH} --n-experts ${EXPERTS} --model-parallel ${MP} eksportimi CONFIG=config_671B_v3.2.json torchrun --nproc-per-node ${MP} generate.py --ckpt-path ${SAVE_PATH} --config ${CONFIG} --interactive
Për ata që preferojnë SGLang, ka imazhe të përgatitura dhe një komandë nisjeje. Mbështetja mbulon GPU-të NVIDIA (H200), AMD (MI350) dhe disa NPU-të, me etiketa specifike.
# H200 tërheqje docker lmsysorg/sglang:dsv32 # MI350 tërheqje docker lmsysorg/sglang:dsv32-rocm # NPU-të tërheqje docker lmsysorg/sglang:dsv32-a2 tërheqje docker lmsysorg/sglang:dsv32-a3 python -m sglang.launch_server --model deepseek-ai/DeepSeek-V3.2-Exp --tp 8 --dp 8 --madhësia-e-faqes 64
Nëse preferoni vLLM, ka mbështetje që nga dita e parë. Këshillohet të rishikohen recetat zyrtare për parametrat dhe optimizimet nga hardueri.
API: Pikat e Fundit, Përputhshmëria dhe Skadimet
API e DeepSeek ndjek konventat standarde dhe është i pajtueshëm me SDK-të e njohura. Si parazgjedhje, duke përdorur URL-në bazë https://api.deepseek.com ju synoni V3.2-Exp, e cila thjeshton integrimin fillestar dhe aksesin në normë e zvogëluar.
Për krahasim, ekziston një pikë fundore e përkohshme për V3.1-Terminus: https://api.deepseek.com/v3.1_terminus_expires_on_20251015Mbani mend datën dhe orën e skadimit (15 tetor 2025, ora 15:59 UTC) për të planifikuar standardet.
Përveç kësaj, ekziston përputhshmëria me ekosistemin e AntropikeMund të përdorni bazën https://api.deepseek.com/anthropic për ndërveprimet në stilin Claude, ose variantin e shoqëruar me pikën fundore të përkohshme nëse duhet të krahasoni me modelin e mëparshëm.
Autentifikimi dhe menaxhimi i çelësave
Kërkesat vërtetohen nga bartës në kokën e Autorizimit. Gjeneroni çelësin tuaj nga paneli i kontrollit DeepSeek dhe ruajeni atë në mënyrë të sigurt, për shembull, në variablat e mjedisit ose menaxherët e skedarëve. secretos si Menaxher i Sekreteve të AWS.
Paneli tregon përdorimin dhe faturimin për të kontrolluar konsumin e argumentetEdhe pse çmimet kanë rënë, këshillohet të aplikohet kufizimi i shpejtësisë dhe rrotullimi periodik i çelësave në kompjuterë, përveç revokimit të çdo çelës i kompromentuar Pa vonese.
Përfundimet e bisedave, shabllonet dhe kërkesat themelore
Pika qendrore fundore është /chat/përfundime, i cili përpunon dialogë me shumë kthesa dhe mirëmban kontekstin midis thirrjeve, një skenar ideal për pikat e forta të kontekstit të gjatë të V3.2-Exp. Ekzistojnë dy mënyra tipike të modelit: thelleseek-chat y arsyetues i thellë.
Një trup i thjeshtë kërkese mund të duket kështu, duke përdorur JSON me format të escaped (i përfaqësuar këtu si "për qartësi): përfshin një kërkesë të sistemit dhe një kërkesë të përdoruesit.
{ "model": "deepseek-chat", "messages": [ { "role": "system", "content": "Ju jeni një ekspert teknik." }, { "role": "user", "content": "Shpjegoni vëmendjen e rrallë." } ], "stream": false }
Kur dëshironi përgjigje në kohë reale, aktivizoni rrjedhë = e vërtetëTitujt duhet të përfshijnë Llojin e Përmbajtjes: application/json dhe shenjën e Autorizimit: Mbajtës ${DEEPSEEK_API_KEY}. Nëse po punoni me arsyetim të qartë, mund ta kontrolloni sjelljen me flamurin. arsyetim.i aktivizuar.
Struktura e përgjigjes dhe transmetimi SSE
Përgjigjet jo-transmetuese përfshijnë fusha të tilla si id, objekt, krijuar, model, zgjedhje dhe përdorim. Në zgjedhje, do të gjeni përmbajtjen e gjeneruar (roli: "asistent"), dhe në përdorim, detajet e prompt_tokens, shenjat_e_përfundimit dhe shenjat_e_totalit.
Në modalitetin e transmetimit, API dërgon Ngjarjet e dërguara nga serveriÇdo fragment mbërrin si një ngjarje të dhënash me një delta që duhet ta akumuloni. Ky është opsioni ideal për Interfaces interaktive ose terminale me dalje rritëse.
Thirrja dhe dalja e funksionit në JSON të rreptë
Ju mund të përcaktoni mjete kështu që modeli vendos se kur të thërrasë një funksion, për shembull, për të marrë të dhëna ose për të ekzekutuar veprime. Kjo përshtatet mirë me rrjedhat dhe integrimet e agjentëve. backend.
Nëse keni nevojë për një rezultat të strukturuar, detyroni modalitetin JSON duke përdorur response_format. Kjo është e dobishme për nxjerrjen e të dhënave ose sanksionim automatike në tubacione.
Shembuj Python me SDK në stilin OpenAI
Me Python, kurba e të dhënave hyrëse është shumë e lëmuar. Vendosni api_base si DeepSeek, përcaktoni çelësin dhe kërkesat e nisjes; mund të kaloni midis modalitetit standard dhe atij të transmetimit në varësi të rastit tuaj të përdorimit.
import openai openai.api_base = "https://api.deepseek.com" openai.api_key = "your_api_key_here" response = openai.ChatCompletion.create( model="deepseek-chat", messages=[ {"role": "system", "content": "Ju jeni një asistent kodimi."}, {"role": "user", "content": "Shkruani një funksion Python për të llogaritur numrat Fibonacci."} ], stream=False ) print(response.choices[0].message.content) # Transmetimi i transmetimit = openai.ChatCompletion.create(model="deepseek-chat", messages=[...], stream=True) për copën në transmetim: nëse chunk.choices[0].delta.content nuk është Asnjë: print(chunk.choices[0].delta.content, end="") # Thirrja e funksionit (përkufizimi i mjetit) tools = [ { "type": "function", "function": { "name": "get_weather", "përshkrim": "Merr motin aktual", "parameters": { "type": "object", "properties": { "location": {"type": "string"} }, "required": [ "location" ] } } } ]
Për dalje të rreptë JSON, vendosni formati_i_përgjigjes një {"type": "json_object"}. Dhe nëse do të keni dialogë të gjatë, mos harroni të shkoni ngushtimi i kontekstit për t'ju mbajtur brenda kufijve dhe për të maksimizuar efikasitetin.
Integrimi me Apidog
Apidog përshpejton prototipizim Thirrje mbrapsht: Importoni specifikimet, ruani variablat e mjedisit (siç është çelësi), ndërtoni POST dhe testoni menjëherë. Simulatori i përgjigjes e bën të lehtë testimin e rasteve ekstreme pa kosto shtesë. argumentet.
Gjithashtu gjeneron fragmente kodi në mënyra të ndryshme idioma dhe ofron një pamje kohore për debugging të autentifikimit ose parametrave. Meqenëse V3.2-Exp trajton kontekste të gjera, Apidog është një mënyrë e shkëlqyer për të eksperimentuar me kërkesa të gjata dhe shikoni performancën.
Praktika të mira për të përfituar sa më shumë prej saj
Përcaktoni kërkesat e sistemit i qartë dhe konciz që kufizojnë sjelljen. Për probleme komplekse, mënyra e arsyetimit mund të ndihmojë, duke e kombinuar atë me teknikat e strukturimit të mendimit të përshtatshme për rastin tuaj.
Menaxhoni kontekst me kokë: Edhe pse V3.2-Exp toleron kontekst të gjatë (citohen raste deri në 128 mijë), historia e tepërt mund të penalizojë efikasitetin. Ai zbaton shkurtim inteligjent, i fshehur për pyetje të shpeshta dhe grupe aty ku ka kuptim.
Në siguri, ai dezinfekton të dhënat hyrëse për të parandaluar injeksione të menjëhershme dhe regjistron ndërveprimet për të auditimitRregulloni temperaturën dhe top_p sipas qëllimit tuaj: vlera të ulëta për determinizëm, vlera të larta për kreativitet.
Kryeni teste A/B midis thelleseek-chat y arsyetues i thellë për të zgjedhur mënyrën optimale. Dhe mbani mend limitin e shpejtësisë për të shmangur surprizat në facturación.
Krahasim me V3.1-Terminus
Prezantimi i DSA-së sjell përmirësime në gjendje latente të cilat, në disa skenarë, i afrohen shpejtësisë 3-fish pa sakrifikuar barazinë e përgjithshme të cilësisë. Është një evolucion i fokusuar në marrëdhënien fuqi/efikasitet më shumë sesa në të dhënat e saktësisë.
Rritjet e vogla në kodim dhe uljet e lehta në fushat e shkencave humane pasqyrojnë rregullimin e imët të një modeli që, nga dizajni, është eksperimentalPika përfundimtare kohore V3.1 lejon krahasime të drejtpërdrejta që tregojnë fitimet e DSA-së në planin afatgjatë.
Vendosje lokale e avancuar
Për shpërndarje të ndjeshme ndaj privatësisë ose jashtë linje, shkarkoni pesos nga Hugging Face dhe përdorimi i skripteve zyrtare të konvertimit është zgjidhja ideale. Vendosni numrin e ekspertëve (p.sh. 256) dhe përshtatni paralelizmin e modelit sipas nevojave tuaja. GPU.
Demoja e përfundimit lejon testimin në modalitetin interaktiv, dhe bërthamat në TileLang ose CUDA do t'ju ndihmojë të shtrydhni performancën sipas përparësive: shpejtësia e prototipimit ose rendimenti maksimal në prodhim.
Bërthamat e hapura dhe performanca
TileLang i jep përparësi lexueshmëri dhe dizajn për kërkim, në mënyrë që të mund të përsërisni shpejt idetë e reja. Është perfekt nëse po eksploroni variante të kujdesit. të shpërndara ose optimizime të kujtesës.
Për të shtrydhur çdo milisekondë, hyjnë në lojë bërthamat CUDA: indekset logit (me versione të faqosura) janë në DeepGEMM, ndërsa ata me vëmendje të shpërndarë jetojnë në FlashMLAKy segmentim i lejon secilit ekip të zgjedhë rafte optimale pa ribërë punë.
Licenca DeepSeek-V3.2-Exp, Takimi dhe Kontakti
Depozita dhe pesos Modeli është publikuar sipas licencës MIT. Kjo hap derën për përdorime komerciale me fleksibilitet të madh, duke inkurajuar miratimin dhe risi në ekosistem.
Për t'iu referuar V3.2-Exp në punë, DeepSeek ofron një hyrje takimi të tipit @misc me titullin «DeepSeek-V3.2-Exp: Boosting Long-Context Eficience with DeepSeek Sparse Attention» dhe autorësinë «DeepSeek-AI» (viti 2025). Për pyetje ose incidente, emaili i kontaktit është [email mbrojtur].
Burime zyrtare dhe lidhje të dobishme rreth DeepSeek-V3.2-Exp
Nëse doni ta shkarkoni modelin, e keni aty Përqafimi i fytyrësDokumenti i bardhë është në GitHub, së bashku me detajet e zbatimit dhe vlerësimet.
Për teste krahasuese midis V3.2-Exp dhe V3.1-Terminus, shihni Udhëzues zyrtarDhe nëse doni të dërgoni sugjerime, keni një kanal me reagim publik në https://feedback.deepseek.com/dsa.
Me V3.2-Exp, DeepSeek i jep përparësi një ideje të thjeshtë: efikasitet pa sakrifikuar cilësinëDSA hap rrugën për modele që mbështesin kontekste masive me një kosto të arsyeshme, API-ja e efektshme i sjell këto aftësi më shumë ekipeve, dhe hapja e paketës (peshat, bërthamat dhe dokumentacioni) e bën më të lehtë për komunitetin të hulumtojë, krahasojë dhe ndërtojë produkte të vërteta pa probleme.