FitMyLLM
APPLE· APPLE GPU 5-CORE

Apple A15 GPU 5-core

Running LLMs on the Apple A15 GPU 5-core — the long read: which models fit at which quantisation, and the settings worth changing. · Or what a budget buys

USABLE MEMORY
3 GB
BUDGET
BANDWIDTH
34.1
GB/S
MODELS Q4
81/449
18%
7B Q4 SPEED
~4
SLOW
▸ MODEL COVERAGE @ Q418% OF ALL
▸ ESTIMATED SPEED· BY MODEL SIZE @ Q4

Average speeds at Q4 quantization. Actual performance varies by model architecture and context length.

3B
~10
TOK/S
7B
3.9GB NEEDED
14B
7.9GB NEEDED
32B
18.0GB NEEDED
70B
39.4GB NEEDED
▸ MEASURED RIG REPORTS

We rent the machine and time every model on it: decode, VRAM peak, concurrency, watts and cost per million tokens. Yours may already be one of them — and two are free to read in full.

SEE THE REPORTS
▸ SPECIFICATIONS
USABLE MEMORY
3 GB of 6
BANDWIDTH
34.1 GB/s
FP16 COMPUTE
1.5 TFLOPS
TDP
6W
MEMORY
Shared
ARCHITECTURE
Apple GPU 5-core
27
FAST MODELS · >30 TOK/S
Real-time chat speed
81
USABLE · >10 TOK/S
Comfortable for all tasks
81
TOTAL COMPATIBLE
Fit in usable memory at Q4
▸ DON’T WANT TO BUY?

Test A15 GPU 5-core (or anything bigger) without committing. Pay by the second, cancel anytime.

Spin up in ~60s. Pay by the second. Cancel anytime.

Some links are affiliate links — we may earn a small commission at no extra cost to you. This helps keep FitMyLLM free and independent.

▸ COMPATIBLE MODELS· 81
S
Falcon-H1R Tiny 90M0.09B
FALCON·256K CTX· CHAT· REASONING
337
TOK/S · 18% MEM
S
SmolLM2 135M0.135B
SMOLLM·2K CTX· CHAT
225
TOK/S · 19% MEM
S
nomic-embed-text-v1.5 100M0.14B
EMBEDDING·8K CTX· CHAT
217
TOK/S · 19% MEM
S
GPT-2 124M0.14B
GPT2·1K CTX· CHAT
217
TOK/S · 19% MEM
S
SmolVLM 256M0.256B
SMOLLM·8K CTX· CHAT· VISION
118
TOK/S · 21% MEM
S
Gemma 3 270M0.27B
GEMMA·32K CTX· CHAT
112
TOK/S · 22% MEM
S
Snowflake Arctic Embed M v2.00.305B
EMBEDDING·8K CTX· EMBEDDING· MULTILINGUAL
99
TOK/S · 22% MEM
S
bge-large-en-v1.5 335M0.335B
EMBEDDING·1K CTX· CHAT
90
TOK/S · 23% MEM
S
mxbai-embed-large-v10.335B
EMBEDDING·1K CTX· EMBEDDING
90
TOK/S · 23% MEM
S
Snowflake Arctic Embed L0.335B
EMBEDDING·1K CTX· EMBEDDING
90
TOK/S · 23% MEM
S
LFM2 350M0.35B
LFM·125K CTX· CHAT· TOOL_USE
87
TOK/S · 23% MEM
S
SmolLM2 360M0.36B
SMOLLM·8K CTX· CHAT
84
TOK/S · 24% MEM
S
GPT-2 Medium 345M0.38B
GPT2·1K CTX· CHAT
80
TOK/S · 24% MEM
S
Qwen 2.5 0.5B0.5B
QWEN·32K CTX· CHAT
61
TOK/S · 26% MEM
S
SmolVLM 500M0.5B
SMOLLM·8K CTX· CHAT· VISION
61
TOK/S · 26% MEM
A
Falcon-H1 0.5B0.52B
FALCON·128K CTX· CHAT
58
TOK/S · 27% MEM
A
BGE-M30.568B
EMBEDDING·8K CTX· EMBEDDING
53
TOK/S · 28% MEM
A
Snowflake Arctic Embed L v2.00.568B
EMBEDDING·8K CTX· EMBEDDING· MULTILINGUAL
53
TOK/S · 28% MEM
A
Qwen3-Embedding 0.6B0.6B
EMBEDDING·32K CTX· EMBEDDING· MULTILINGUAL
51
TOK/S · 29% MEM
A
Falcon-H1R Tiny 0.6B0.6B
FALCON·32K CTX· CHAT· REASONING
51
TOK/S · 29% MEM
A
Falcon Perception 0.6B0.6B
FALCON·4K CTX· VISION
51
TOK/S · 29% MEM
A
Qwen 1.5 0.5B0.62B
QWEN·32K CTX· CHAT
49
TOK/S · 29% MEM
A
LFM2 700M0.74B
LFM·125K CTX· CHAT· TOOL_USE
41
TOK/S · 31% MEM
A
Qwen3 0.6B0.75B
QWEN·32K CTX· CHAT· REASONING
40
TOK/S · 32% MEM
B
GPT-2 Large 774M0.81B
GPT2·1K CTX· CHAT
37
TOK/S · 33% MEM
B
Qwen 3.5 0.8B0.87B
QWEN·256K CTX· CHAT· CODING· MULTILINGUAL
35
TOK/S · 34% MEM
B
InternVL3 1B0.94B
OTHER·32K CTX· CHAT· VISION
32
TOK/S · 35% MEM
B
TinyLlama 1.1B1.1B
LLAMA·2K CTX· CHAT
28
TOK/S · 39% MEM
B
MiniCPM5 1B1.08B
MINICPM·128K CTX· CHAT· REASONING· MULTILINGUAL
28
TOK/S · 38% MEM
B
LFM2.5-1.2B-Thinking1.2B
LFM·122K CTX· CHAT· REASONING· TOOL_USE
25
TOK/S · 41% MEM
B
Llama-3.2-1B1.2B
LLAMA·4K CTX· CHAT
25
TOK/S · 41% MEM
B
LFM2 1.2B1.2B
LFM·125K CTX· CHAT· TOOL_USE· MULTILINGUAL
25
TOK/S · 41% MEM
B
Zamba2 1.2B1.2B
OTHER·4K CTX· CHAT
25
TOK/S · 41% MEM
C
EXAONE-4.0-1.2B1.3B
EXAONE·64K CTX· CHAT
23
TOK/S · 43% MEM
C
OPT 1.3B1.3B
OPT·2K CTX· CHAT
23
TOK/S · 43% MEM
C
MiniCPM-V 4.61.3B
OTHER·256K CTX· CHAT· VISION
23
TOK/S · 43% MEM
C
DeepSeek Coder 1.3B1.35B
DEEPSEEK·16K CTX· CODING
22
TOK/S · 44% MEM
C
Phi-1 1.3B1.42B
PHI·2K CTX· CODING
21
TOK/S · 45% MEM
C
Phi-1.5 1.3B1.42B
PHI·2K CTX· CHAT· CODING
21
TOK/S · 45% MEM
C
Falcon-H1 1.5B1.55B
FALCON·128K CTX· CHAT· CODING
20
TOK/S · 48% MEM
▸ NEXT STEP

Get personalized recommendations.

See ranked models with benchmark scores, run commands, and precise speed estimates for your Apple A15 GPU 5-core.

WHAT THIS CARD IS WORTH

A15 GPU 5-core holds 81 of the models in our catalogue and is, in practice, a Q4_K_M card — the largest it takes is Falcon3-3B at Q4_K_M.

TOKENS/SEC PER $100
8B at Q4_K_M, so cards compare like for like
USABLE MEMORY PER $100
what memory costs on this card
THE BIGGEST IT TAKES
Falcon3-3B3.23B · Q4_K_M2.6 GB13 tok/sEST
granite-4.0-h-micro 3.2B3.2B · Q4_K_M2.6 GB13 tok/sEST
Llama-3.2-3B3.2B · Q4_K_M2.7 GB13 tok/sEST
Falcon-H1 3B3.15B · Q5_K_M2.7 GB11 tok/sEST
Qwen 2.5 3B3.1B · Q5_K_M2.6 GB12 tok/sEST
SmolLM3-3B3.1B · Q4_K_M2.5 GB13 tok/sEST
Ministral 3B3B · Q4_K_M2.6 GB14 tok/sEST
StarCoder2 3B3B · Q5_K_M2.5 GB12 tok/sEST
AGAINST CARDS OF SIMILAR MEMORY
M2 (8GB)5 GB$5992.8 tok/s per $100
M3 (8GB)5 GB$5992.8 tok/s per $100
M1 (8GB)5 GB$4992.2 tok/s per $100
RTX 2060 6GB6 GB$15026.7 tok/s per $100
A15 GPU 5-core3 GB

Neighbours in memory rather than in price: memory decides whether a card can do the job at all, so two cards of the same size at different prices is the comparison you are making. Ordered by memory, then bandwidth — not by the value column, which is worked out from bandwidth and price alone and therefore rewards a cheap card whatever its software stack does to that bandwidth in practice. Read it as one input, not as a ranking.

▸ DEVICE UNDER TEST

Apple A15 GPU 5-core — 6 GB unified, 3 GB usable.

APPLE A15 GPU 5-CORE SPEC
BRAND
Apple
UNIFIED MEMORY
6 GB
USABLE BY A MODEL
3 GB
BANDWIDTH
34.1 GB/s
FP16 COMPUTE
1.5 TFLOPS
TDP
6 W
ARCHITECTURE
Apple GPU 5-core
▸ AI CAPABILITY
81/ 449 models @ Q4

With 3 GB of its 6 GB reaching a model and 34.1 GB/s bandwidth, this machine handles models up to 3.1B parameters.

Speed ≈ bandwidth / model_size × efficiency. A 7B model at Q4 runs at ~4 tok/s.

RENT IT — LIVE PRICES
Checking what the clouds are charging…
§ 01TOP MODELS FOR APPLE A15 GPU 5-CORE
81 FIT · SHOWING 20
MODELSIZEVRAM Q4TOK/SAVG
Qwen 2.5 3B3.1B2.4 GB1037.2
SmolLM3-3B3.1B2.4 GB1030.5
Ministral 3B3B2.3 GB1029.6
StarCoder2 3B3B2.3 GB109.5
Granite 4.1 3B3B2.3 GB1016.6
xLAM-2 3B Function-Calling3B2.3 GB10
Jamba 2 3B3B2.3 GB10
Dolly v2 3B2.8B2.2 GB115.6
StableLM Zephyr 3B2.79B2.2 GB1114.9
Zephyr 3B2.79B2.2 GB1114.4
OPT 2.7B2.7B2.1 GB1128.0
Phi-2 2.7B2.7B2.1 GB1124.1
Zamba2 2.7B2.7B2.1 GB1148.0
Granite 3.0 2B2.63B2.1 GB1235.8
gemma-2-2b2.6B2.1 GB1222.9
LFM2 2.6B2.6B2.1 GB1216.3
Granite 3.1 2B2.53B2.0 GB1237.8
Granite 3.3 2B2.53B2.0 GB1220.5
Gemma 1 2B2.51B2.0 GB1220.2
CodeGemma 2B2.51B2.0 GB1222.9