DE ▾

Gehostete unzensierte LLM-API

API-Schlüssel erhalten
pro 1M Input-Token
$0.25
Output-Token / 1M
$1.00
Token-Kontext
100,000

Erste Anfrage in fünf Minuten

Verbinde deinen bestehenden OpenAI-kompatiblen Client in Sekunden mit unserer unzensierten API. Dieses Quickstart-Guide behandelt die Basis-Konfiguration, Standard-Anfragen, Streaming und die Tool-Nutzung mit dem Modell 'uncensored'.

Basis-URL & Authentifizierung

Richte dein OpenAI SDK oder einen beliebigen kompatiblen Client auf unsere Basis-URL ein. Du benötigst keine spezifische Bibliothek; jedes Tool, das einen Standard-API-Schlüssel akzeptiert, funktioniert hier. Rufe deinen Schlüssel aus dem Dashboard ab, nachdem du dich mit Google oder E-Mail angemeldet hast. Der Schlüssel wird sofort angezeigt und ist das einzige Anmeldecredential für alle Anfragen.

Setze die Base URL auf https://api.ollamaapi.top/v1. Verwende für alle Chat-Completions die Modell-ID uncensored. Dieses Modell ist Open-Weight, auf weniger Ablehnungen optimiert und unterscheidet sich von Modellen großer Anbieter. Es ist kein GPT, Claude oder ein anderes proprietäres Modell. Die Authentifizierung erfolgt ausschließlich über den Bearer-Token-Header.

Erste Anfrage

Sende eine Standard-Chat-Completion-Anfrage, um die Konnektivität zu testen. Der Endpunkt akzeptiert JSON-Payloads mit messages, model und optionalen Parametern wie temperature oder max_tokens. Die Modell-ID ist immer uncensored. Die Antwort enthält strukturiertes JSON mit dem Inhalt des Assistenten und den Token-Nutzungsdaten.

Wenn die Anfrage erfolgreich ist, erhältst du eine 200 OK-Antwort. Bei Authentifizierungsfehlern erhältst du einen 401-Fehler. Wenn du kein Guthaben hast, erhältst du einen 402-Fehler. Diese Fehler sind kostenlos, sodass du nur für erfolgreiche Token-Nutzungen zahlst. Verwende dieses Beispiel, um deine Konfiguration zu überprüfen, bevor du sie in deine Anwendung integrierst.

curl https://api.ollamaapi.top/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Python SDK

Verwende die offizielle OpenAI-Python-Bibliothek oder einen kompatiblen Client. Initialisiere den Client mit deiner Basis-URL und deinem API-Schlüssel. Stelle das Modell auf uncensored. Übergebe deine Nachrichten als Liste von Wörterbüchern, die role und content enthalten. Die Bibliothek übernimmt die Serialisierung und Antwortanalyse automatisch.

Streaming-Antworten werden über den Parameter stream unterstützt. Dies ermöglicht die Verarbeitung von Token, während sie generiert werden, was für lange Ausgaben oder Echtzeit-UI-Updates nützlich ist. Der letzte Chunk enthält die gesamten Token-Nutzungsdaten für die Abrechnung. Stelle sicher, dass du Ausnahmen korrekt behandelst, da Netzwerkfehler keine Gebühren verursachen.

from openai import OpenAI

client = OpenAI(base_url="https://api.ollamaapi.top/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Node SDK

Install the openai npm package or use any fetch-based wrapper. Configure the client with the base URL https://api.ollamaapi.top/v1 and your API key. The model ID remains uncensored. Pass the request body with messages and optional settings like top_p or seed.

Node.js-Nutzer können async/await-Muster für sauberen Code nutzen. Das Response-Objekt enthält choices, usage und id. Du kannst die Nachricht des Assistenten aus der ersten Auswahl extrahieren. Die Fehlerbehandlung sollte Ratenlimits (429) und unzureichendes Guthaben (402) berücksichtigen. Diese Fehler verbrauchen keine Token, sodass dein Prepaid-Guthaben bis zur Generierung einer erfolgreichen Antwort intakt bleibt.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.ollamaapi.top/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Streaming-Antworten

Aktiviere das Streaming, indem du stream: true in deiner Anfrage festlegst. Die API gibt einen Server-Sent Events (SSE)-Stream zurück. Jeder Chunk enthält teilweise Inhalte, sodass du Token anzeigen kannst, während sie generiert werden. Dies reduziert die wahrgenommene Latenz für Nutzer und verbessert das Erlebnis bei der Generierung von Text in langer Form.

Der letzte Chunk im Stream enthält die vollständigen Token-Nutzungsdaten. Du kannst dies nutzen, um den Verbrauch in Echtzeit zu verfolgen. Beachte, dass das Streaming das Preismodell nicht ändert; du zahlst weiterhin pro 1M Input- und Output-Token. Fehler während des Streamings sind ebenfalls kostenlos. Wenn die Verbindung abbricht, kannst du die Anfrage fortsetzen oder neu starten, ohne Strafgebühren.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Grenzen, Fehler & Kontext

Das Kontextfenster umfasst insgesamt 100.000 Token, sowohl für den Prompt als auch für die Completion. Die maximale Ausgabe pro Anfrage beträgt 32.000 Token (2.048, wenn max_tokens nicht gesetzt ist). Überschreitest du das Kontextfenster, schlägt die Anfrage fehl. Zu den Fehlern gehören 401 für ungültige Schlüssel, 402 für unzureichendes Guthaben und 429 für Ratenlimits. Das Ratenlimit liegt bei 300 Anfragen pro Minute und 8 parallelen Anfragen pro Schlüssel. Anfragekörper sind auf 8 MB begrenzt. Fehler sind kostenlos, das heißt, du zahlst nicht für fehlgeschlagene Anfragen oder Ablehnungen. Guthaben verfällt nie, und kein Abonnement ist erforderlich.

API-Spezifikation

Eine Tabelle mit jedem Limit, jeder Funktion und jedem Preis.

MerkmalWert
API-FormatOpenAI-kompatibel: jedes OpenAI-SDK funktioniert – nur Base-URL und Schlüssel ändern
Base-URLhttps://api.ollamaapi.top/v1
AuthentifizierungAuthorization: Bearer YOUR_KEY
EndpunktePOST /v1/chat/completions · GET /v1/models
Modell-IDuncensored
Max. Ausgabebis zum Rest des 100.000-Token-Fensters; max_tokens optional (kein separates Limit)
JSON-Modusresponse_format: {"type": "json_object"}
Parametertemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Function Callingja – tools, tool_choice; Antworten mit tool_calls, auch im Stream; Ergebnisse als role: tool
Streamingja – Server-Sent Events, der letzte Chunk enthält die Token-Nutzung
Kontextfenster100.000 Tokens (Eingabe + Ausgabe)
Ratenlimit300 Anfragen pro Minute und Schlüssel
Parallelität8 gleichzeitige Anfragen pro Schlüssel
Antwort-HeaderX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Anfragegrößebis 8 MB
Bonus+5 % ab $50, +10 % ab $100
Gültigkeitbezahltes Guthaben verfällt nie, kein Abo
AbrechnungPrepaid-Guthaben nach echter Nutzung; Fehler und Ablehnungen sind kostenlos
Testguthaben$0,50 für 7 Tage, ohne Karte · Testschlüssel: 2 parallele Anfragen, 60 pro Minute; volle Limits (8 und 300) nach erster Aufladung
Preis$0,25 pro 1 Mio. Eingabe-Tokens · $1,00 pro 1 Mio. Ausgabe-Tokens
AufladenUSDT (TRC20) oder USDC (Base), jeder ganze Betrag von $10 bis $500
AnmeldungGoogle oder E-Mail und Passwort
Schlüsselein aktiver Schlüssel pro Konto; ein neuer ersetzt den alten
InhalteInhalte für Erwachsene erlaubt; sexuelle Inhalte mit Minderjährigen werden abgelehnt

Fehler und Lösungen

Fehler kommen als JSON mit festem type; fehlgeschlagene oder abgelehnte Anfragen kosten nichts.

CodeTypBedeutung
400bad_requestungültiges JSON, leere Nachrichten, falscher Parameter oder Kontext zu lang
401missing_key · invalid_key · key_revokedSchlüssel fehlt, ist falsch oder wurde ersetzt
402no_creditkein Guthaben – aufladen, dann geht es sofort weiter
403content_blockedsexuelle Inhalte mit Minderjährigen – abgelehnt, nicht berechnet
404not_foundunbekannter Endpunkt
413request_too_largeAnfrage größer als 8 MB
429rate_limited · concurrencyüber 300/Min. oder 8 parallel – kurz warten
503upstream_busyModell ausgelastet – in Sekunden erneut versuchen

Fragen und Antworten

Unterstützt diese API Function Calling?

Ja, die API unterstützt Function Calling über die Parameter <code>tools</code> und <code>tool_choice</code>. Du kannst Tools in deiner Anfrage definieren, und das Modell gibt strukturiertes JSON für die Tool-Nutzung zurück. Diese Funktion funktioniert mit allen Standard-OpenAI-kompatiblen Clients.

Was passiert, wenn ich das Kontextfenster überschreite?

Wenn die Gesamtzahl der Token (Prompt + Completion) 100.000 überschreitet, schlägt die Anfrage mit einem Fehler fehl. Dieser Fehler ist kostenlos, sodass du für den Versuch nicht belastet wirst. Du kannst den Parameter <code>max_tokens</code> anpassen oder deinen Prompt kürzen, um innerhalb der Grenzen zu bleiben.

Ist das Testguthaben wiederverwendbar?

Nein, das Testguthaben von $0,50 ist 7 Tage gültig und kann nur einmal pro Konto verwendet werden. Es verfällt nicht nach der Nutzung, aber wenn es nicht verwendet wird, verfällt es nach 7 Tagen. Es wird keine Kreditkarte benötigt, um das Testguthaben zu beanspruchen.

Dein Schlüssel ist nur ein Formular entfernt

Erstelle ein Konto, kopiere den Schlüssel, ändere die Basis-URL. Das ist die gesamte Einrichtung.

API-Schlüssel erhalten