Saltar al contenido principal

Herramientas

Organizadas por caso de uso. Todas las herramientas son gratuitas o tienen un plan gratuito, salvo las marcadas con 💰.


Desarrollo con Azure AI

HerramientaDescripciónEnlace
Azure AI Foundry PortalCentro principal para crear proyectos de IA, explorar el catálogo de modelos, ejecutar evaluaciones y desplegar agentesai.azure.com
Azure AI CLI (az ai)Aprovisiona hubs, proyectos y conexiones de IA desde la línea de comandosDocs
azure-ai-projects SDKSDK unificado de Python para AI Foundry: agentes, evaluaciones y conexionesPyPI
Azure AI Evaluation SDKEjecuta evaluaciones de calidad y seguridad sobre salidas de IA de forma programáticaPyPI
Prompt flowOrquestación de aplicaciones con LLM: construir, probar, evaluar y desplegarGitHub
Semantic KernelSDK open-source para orquestar modelos de IA, plugins y memoria (Python / C# / Java)GitHub
AutoGenFramework de conversaciones multiagente de Microsoft ResearchGitHub
Azure OpenAI Structured Outputsresponse_format: {strict: true} garantiza JSON ajustado al esquema desde el LLM; úsalo con Pydantic para un parsing de intención deterministaDocs
Azure AI Foundry Agent Evaluators9 evaluadores integrados para agentes de producción: Task Completion, Task Adherence, Tool Call Accuracy, Tool Input Accuracy, Tool Selection, Tool Output Utilization, Task Navigation Efficiency, Intent Resolution y Tool Call SuccessDocs
Azure Content Safety — Prompt ShieldsBloqueo en tiempo real de ataques de jailbreak del usuario y de prompt injection indirecto (XPIA) procedente de documentos antes de que el LLM los veaDocs
Azure Content Safety — Groundedness ProMás estricto que groundedness estándar: usa los modelos de seguridad hospedados de Microsoft, devuelve True/False y no requiere un despliegue de LLM. Ideal para finanzas y saludDocs
Azure APIM Semantic CachingCachea consultas semánticamente similares al LLM en el gateway para reducir costo y latencia. ⚠️ No es una herramienta de confiabilidad: la documentación advierte que puede devolver respuestas desactualizadas. Usa score-threshold="0.05" y TTLsDocs
Microsoft Defender for Cloud — AI WorkloadsAlertas y recomendaciones de seguridad específicas para cargas de IA: detecta prompt injection, exfiltración de datos y uso indebido en producciónDocs
VS Code AI Foundry ToolkitTracing local con OpenTelemetry para agentes de Azure AI Foundry, ideal para depurar sin depender de viajes al cloudDocs

Herramientas de Claude y Anthropic

HerramientaDescripciónEnlace
Claude APIAPI principal para messages, uso de herramientas, visión y streamingDocs
Anthropic Agent SDKCrea agentic loops, sistemas multiagente y hooksDocs
Claude CodeAgente de programación impulsado por IA con configuración CLAUDE.md, comandos personalizados e integración CI/CDDocs
Claude Code HooksMás de 25 hooks de ciclo de vida para sesiones de agentes: PreToolUse, PostToolUse, PostToolUseFailure, PostToolBatch, UserPromptSubmit, PreCompact y Stop. ⚠️ Son hooks de Claude Code (CLI), no de la Anthropic Messages APIDocs
Extended Thinkingbudget_tokens controla la profundidad del razonamiento antes de responder; el modo adaptive (Opus 4.8+) decide por sí mismo cuándo hace falta razonamiento profundo. Úsalo en decisiones de alto impacto para detectar contradicciones antes de las tool callsDocs
MCP SDKCrea servidores de Model Context Protocol para ampliar Claude con fuentes de datos en vivo; la arquitectura adecuada para externalizar registros de conceptos de negocio, alias de entidades y resolvedores temporalesGitHub
Anthropic AcademyCursos oficiales sobre agentes, prompt engineering y uso de herramientasacademy.anthropic.com

Infraestructura y routing para LLM

HerramientaDescripciónEnlace
LiteLLMAI Gateway open-source con soporte para 100+ LLMs: centraliza routing, aplica guardrails, retry/fallback logic, virtual keys, spend tracking y load balancing. Soporta A2A Protocol para llamadas entre agentesGitHub
Azure API ManagementGateway empresarial para Azure OpenAI: rate limiting, load balancing entre múltiples endpoints, medición de tokens y semantic cachingDocs

Red teaming y seguridad

HerramientaDescripciónEnlace
PyRITPython Risk Identification Toolkit de Microsoft para IA; automatiza el red teamingGitHub
GarakEscáner de vulnerabilidades para LLM: prueba jailbreaks, alucinaciones y fuga de datosGitHub
PromptBenchBenchmark de robustez adversarial para LLMsGitHub
Azure AI Content SafetyAPI para detectar contenido dañino: violencia, odio, autolesiones y contenido sexualPortal
Purview AI HubDescubre, clasifica y gobierna el uso de IA en M365 y AzureDocs
CounterfitHerramienta de pruebas de seguridad para modelos de AI/MLGitHub

Evaluación y observabilidad

HerramientaDescripciónEnlace
Azure AI Foundry EvaluationsEvaluadores integrados: groundedness, coherence, fluency, relevance y safetyDocs
Azure AI Foundry TracingTracing nativo con OpenTelemetry para agentes: spans paso a paso, tool calls, retries y costos. Exporta a Application InsightsDocs
RAGASRetrieval-Augmented Generation Assessment: faithfulness, relevancia de respuesta y context recallGitHub
PromptfooHerramienta CLI para evaluación de LLM, red teaming y pruebas de regresiónGitHub
LangSmith 💰Observabilidad de LLM, tracing y gestión de datasetssmith.langchain.com
LangfuseObservabilidad open-source para LLM: seguimiento completo de sesiones, workflows de contexto y opción self-hostedlangfuse.com
Arize PhoenixObservabilidad open-source para ML y LLM: métricas de alucinación, trazabilidad de retrieval en RAG y compatibilidad nativa con OpenTelemetryGitHub
Braintrust 💰Pipeline trace-to-eval con scorers LLM personalizados y revisión human-in-the-loopbraintrust.dev
Galileo 💰Guardrails de alucinación para producción: bloqueo inline con Luna-2 y escalabilidad al 100% del tráficogalileo.ai
DeepEvalFramework open-source de evaluación con más de 50 métricas: RAG, agentes, safety y multi-turnGitHub
Confident AI 💰Evaluación integral de agentes: task completion, calidad de razonamiento y eficiencia de costosconfident-ai.com
Patronus AIEvaluación para dominios regulados: finanzas, copyright y toolkit de detección open-sourcepatronus.ai
Maxim AI 💰Observabilidad full-stack para agentes: simulación, depuración en tiempo real, eval loop y seguimiento de contextogetmaxim.ai
AgentOpsMonitoreo ligero de agentes: 400+ frameworks, métricas de confiabilidad y replay de sesionesagentops.ai
Azure MonitorIntegración de Application Insights para telemetría de cargas de IA y exportación con OpenTelemetryDocs

Confiabilidad agéntica y cómputo determinista

Herramientas para construir agentes de producción que sean auditables, deterministas y resistentes a la alucinación y a la degradación del contexto.

HerramientaDescripciónEnlace
tiktokenLibrería de conteo de tokens de OpenAI para medir el uso exacto de la ventana de contexto por modelo (GPT-4, GPT-4o, etc.) antes de enviar al LLMGitHub
DuckDBBase de datos OLAP embebida: ejecuta SQL sobre DataFrames, Parquet y CSVs con latencia de subsegundo. Ideal para cómputo financiero determinista en pipelines de IAduckdb.org
Pydantic v2Cumplimiento de esquemas para salidas de LLM: define BaseModel para el JSON esperado, valida tras cada tool call y repara automáticamente salidas inválidasdocs.pydantic.dev
Guardrails.aiFramework de validación de salida con rails para type checking, enforcement de formato, detección de PII y lógica de retry en salidas de LLMguardrailsai.com
InstructorSalidas estructuradas de LLM con Pydantic; fuerza a modelos de OpenAI / Anthropic a devolver objetos tipados válidosGitHub
LangChain ConversationTokenBufferMemoryRecorte de memoria consciente de tokens: poda automáticamente el historial de conversación para mantenerse dentro del presupuesto de contextoDocs
MLflowSeguimiento de experimentos, versionado de modelos y pipelines de evaluación; registra ejecuciones deterministas de agentes con linaje completo de parámetrosmlflow.org
Opik (Comet)Plataforma open-source de evaluación de LLM con guardrails en tiempo real para pruebas de regresión y detección de prompt injectioncomet.com/opik
PrefectOrquestación de workflows para pipelines deterministas de IA: run IDs, políticas de retry y logs completos de ejecuciónprefect.io
Great ExpectationsFramework de validación de datos para afirmar contratos de datos antes de alimentar un LLM con datos financierosgreatexpectations.io

Infraestructura y despliegue

HerramientaDescripciónEnlace
Azure BicepIaC para hubs de AI Foundry, proyectos y private endpointsDocs
Terraform Azure ProviderAprovisiona infraestructura de IA con HCLRegistry
Azure Developer CLI (azd)Flujo de trabajo end-to-end para desarrolladores: aprovisionar y desplegar apps de IADocs
GitHub ActionsCI/CD para evaluación de modelos de IA, pipelines de fine-tuning y despliegue de aplicacionesDocs
Azure Container AppsHosting serverless de contenedores para microservicios y agentes de IADocs

Productividad y desarrollo

HerramientaDescripciónEnlace
VS Code + AI ToolkitPlayground de modelos de Azure AI, fine-tuning y despliegue desde VS CodeMarketplace
GitHub CopilotProgramador en pareja impulsado por IA para código, documentación y generación de pruebasgithub.com/features/copilot
REST Client (VS Code)Prueba llamadas API inline en archivos .httpMarketplace
BrunoCliente API open-source (alternativa a Postman, amigable con git)usebruno.com
draw.ioDiagramación gratuita para diseños de arquitecturaapp.diagrams.net

Sugiere una herramienta

¿Falta algo útil? Abre un issue o escribe a lesalgad@microsoft.com.