18 srpna, 2026
Poznámka
- Informace v tomto článku se vztahují pouze na používání aplikace Microsoft Copilot osobami přihlášenými pomocí účtu Microsoft, jako je osobní e-mailová adresa.
- Informace o používání aplikace Microsoft Copilot v organizacích, kde jsou uživatelé přihlášení pomocí svého pracovního nebo školního účtu, najdete v tématu Karta aplikace: Microsoft Copilot (pro organizace).
Co je poznámka o průhlednosti?
Systém AI zahrnuje nejen technologii, ale také lidi, kteří ji budou používat, lidi, kteří jí budou ovlivněni, a prostředí, ve kterém je nasazen. Poznámky Microsoftu o transparentnosti vám pomůžou pochopit, jak funguje technologie umělé inteligence, která stojí za Copilotem, jaká rozhodnutí jsme učinili a která ovlivňují výkon a chování systému, a jak je důležité myslet na celý systém, aby uživatelé Copilotu mohli převzít kontrolu nad svým vlastním prostředím a porozumět krokům, které podnikáme k poskytování bezpečného a zabezpečeného produktu.
Poznámky Microsoftu o transparentnost jsou součástí širšího úsilí Microsoftu o uvedení našich principů AI do praxe. Další informace najdete v tématu Principy Microsoft AI.
Základy aplikace Microsoft Copilot
Úvod
Microsoft Copilot vám pomůže přejít od nápadu k dokončené práci, a to vše na jednom místě. Copilot je integrovaný do Wordu, Excelu, PowerPointu, Outlooku, Teams a dalších aplikací a přináší soubory a informace, které používáte, do jednoho prostředí. Copilot vám pomůže vytvářet propracované dokumenty, prezentace a tabulky, vytvářet koncepty e-mailů, organizovat si den a získávat odpovědi na základě práce, kterou děláte. Díky aplikaci Cowork vám Copilot pomůže i s většími úkoly s několika kroky a zajistí tak plnění úkolů. Můžete si také vybrat mezi předními modely AI pro různé druhy práce. Konkrétní funkce se liší podle předplatného.
V Microsoftu svůj závazek k odpovědné AI bereme vážně. Copilot byl vyvinut v souladu s principy AI společnosti Microsoft, standardem odpovědné AI společnosti Microsoft a ve spolupráci s odpovědnými odborníky na AI v celé společnosti, včetně Úřadu odpovědné AI společnosti Microsoft, našich technických týmů, Microsoft Research a Aetheru. Další informace najdete na stránce Odpovědná umělá inteligence v Microsoftu.
V tomto dokumentu popisujeme náš přístup k zodpovědné umělé inteligenci pro Copilot. Před vydáním jsme využili nejmodernější metody Microsoftu k mapování, měření a řízení potenciálních rizik a zneužití systému a k zajištění jeho výhod pro uživatele. Jak jsme pokračovali ve vývoji Copilotu, také jsme se nadále učili a vylepšovali naše úsilí v oblasti zodpovědné AI. Tento dokument bude pravidelně aktualizován, abychom informovali o našich vyvíjejících se procesech a metodách.
Klíčové pojmy
Klasifikátory Modely strojového učení, které pomáhají třídit data do označených tříd nebo kategorií informací. Jedním ze způsobů, jak v Copilotu používáme klasifikátory, je pomoct rozpoznat potenciálně škodlivý obsah odeslaný uživateli nebo generovaný systémem, aby se zmírnilo generování tohoto obsahu a zneužití nebo zneužití systému.
Uzemnění U určitých konverzací, kde uživatelé hledají informace, je Copilot založen na výsledcích hledání na webu. To znamená, že Copilot soustředí svou odpověď na vysoce hodnocený obsah z webu a poskytuje citace s hypertextovými odkazy za vygenerovanými textovými odpověďmi nebo v přepisech konverzace v hlasovém režimu.
Velké jazykové modely (LLM) Velké jazykové modely (LLM) jsou v tomto kontextu modely AI, které se trénují na velkých objemech textových dat k předvídání slov v sekvencích. LLM mohou provádět různé úkoly, jako je generování textu, sumarizace, překlad, klasifikace a další.
Omezení rizik Metoda nebo kombinace metod navržená ke snížení potenciálních rizik, která mohou vzniknout při používání funkcí AI v rámci Copilotu.
Multimodální modely (MMM) Multimodální modely (MMM) jsou modely AI, které se trénují na různých typech dat, jako je text, obrázky nebo zvuk. Tyto modely můžou provádět celou řadu úkolů, jako je psaní textu, popis obrázků, rozpoznávání řeči a vyhledávání informací v různých typech dat.
Výzvy Vstupy ve formě textu, obrázků nebo zvuku, které uživatel odesílá do Copilotu za účelem interakce s funkcemi AI v rámci Copilotu.
Červené seskupování Techniky používané odborníky k posouzení omezení a zranitelností systému a k testování účinnosti plánovaných zmírnění rizik. Červené týmové testování zahrnuje testery, kteří přijímají neškodné i nežádoucí osobnosti k identifikaci potenciálních rizik a liší se od systematického měření rizik.
Odpovědi Text, obrázky nebo zvuk, které Copilot vypíše v reakci na výzvu nebo jako součást komunikace s uživatelem. Synonyma pro "odpověď" zahrnují "dokončení", "generace" a "odpověď".
Malé jazykové modely (SLM) Malé jazykové modely (SLM) jsou v tomto kontextu modely AI, které se trénují na menších a více zaměřených objemech dat v porovnání s velkými jazykovými modely. Navzdory své menší velikosti mohou SLM provádět různé úkoly, jako je generování textu, sumarizace, překlad a klasifikace. I když nemusí odpovídat rozsáhlým možnostem LLM, SLM jsou často efektivnější ze zdrojů a mohou být vysoce efektivní pro specifické, cílené aplikace.
Systémová zpráva Systémová zpráva (někdy označovaná jako "metaprompt") je program, který slouží k vedení chování systému. Části systémové zprávy pomáhají sladit chování systému s principy AI a očekáváními uživatelů Microsoftu. Systémová zpráva může například obsahovat řádek ve smyslu "neposkytujte informace ani nevytvářejte obsah, který by mohl způsobit fyzickou, emocionální nebo finanční újmu".
Funkce
Chování systému
S Copilotem jsme vyvinuli inovativní přístup, jak uživatelům přinést přizpůsobenější prostředí AI pro poutavé prostředí, které může uživatelům pomoct s různými úkoly. Tento inovativní přístup využívá celou řadu pokročilých technologií, jako jsou jazykové a multimodální modely od Microsoftu, OpenAI a dalších vývojářů modelů. Pracovali jsme na implementaci bezpečnostních technik pro modely, které jsou základem Copilotu, před veřejným vydáním, abychom vyvinuli přizpůsobenou sadu schopností a chování, které poskytují vylepšené prostředí Copilotu. V Copilotu můžou uživatelé posílat výzvy v přirozeném textu nebo hlasem. Odpovědi se uživatelům prezentují v několika různých formátech, jako jsou odpovědi na chat v textové podobě (podle potřeby s tradičními odkazy na webový obsah) a obrázky (pokud byla jako součást výzvy odeslána žádost o obrázek). Pokud uživatelé posílají výzvy v přirozeném jazyce v režimu Copilot Voice, obdrží zvukové odpovědi.
Když uživatel zadá výzvu v Copilotu, výzva, historie konverzací a systémová zpráva se odešlou prostřednictvím několika vstupních klasifikátorů, aby se vyfiltroval škodlivý nebo nevhodný obsah. Jedná se o zásadní první krok, který pomáhá zlepšit výkon modelu a zmírnit situace, ve kterých by se uživatelé mohli pokusit zobrazit model způsobem, který by mohl být nebezpečný. Jakmile výzva projde vstupními klasifikátory, určí se, jestli požadavek vyžaduje data uzemnění z webu a který jazykový model by měl na požadavek odpovědět. Všechny modely generují odpověď s využitím výzvy uživatele a nedávné historie konverzací, aby se žádost kontextualizovala, systémová zpráva sladí odpovědi s principy umělé inteligence Microsoftu a očekáváními uživatelů, a pokud je to vhodné, sladí odpovědi s výsledky vyhledávání, aby odpovědi byly základem pro existující vysoce hodnocený obsah z webu.
Odpovědi se uživatelům prezentují v několika různých formátech, jako jsou odpovědi na chat v textové podobě, tradiční odkazy na webový obsah, obrázky a zvukové odpovědi. Pokud jsou odpovědi poskytovány v textové podobě a odpovědi jsou založeny na datech z webu, výstup obsahuje hypertextové citace uvedené pod textem, aby uživatelé měli přístup na webové stránky, které byly použity k založení odpovědi, a dozvěděli se o tématu více odtud. Copilot může také spouštět kód pro provádění složitých výpočtů a generování grafů. Copilot může ukládat konkrétní fakta, která si uživatelé chtějí zapamatovat, což mu umožňuje generovat relevantnější odpovědi a návrhy na základě tohoto kontextu. Copilot může také odstranit uložená fakta, pokud uživatelé požádají, aby je výslovně zapomněli.
Copilot také pomáhá uživatelům vytvářet nové příběhy, básně, texty písní a obrázky. Když Copilot zjistí záměr uživatele generovat kreativní obsah (například výzvu uživatele, která začíná slovy "napiš mi ..."), systém ve většině případů vygeneruje obsah reagující na výzvu uživatele. Podobně, když Copilot zjistí záměr uživatele vygenerovat obrázek (například výzvu uživatele, která začíná "nakresli mi a..."), Copilot ve většině případů vygeneruje obrázek reagující na výzvu uživatele. Když Copilot zjistí, že uživatel má v úmyslu upravit nahraný obrázek (například výzvu uživatele, která začíná na "přidat ..."), Copilot ve většině případů upraví obrázek reagující na výzvu uživatele. Copilot nemusí reagovat kreativním obsahem, pokud výzva uživatele obsahuje určité výrazy, které by mohly vést k problematickému obsahu.
Zamýšlené bezpečnostní chování
Naším cílem pro Copilot je být užitečný pro uživatele a implementujeme ochranná opatření, která pomáhají snížit pravděpodobnost generování škodlivého obsahu a zvýšit pravděpodobnost bezpečného a pozitivního uživatelského prostředí. I když jsme podnikli kroky ke zmírnění rizik, generativní modely AI, jako jsou ty, které stojí za Copilotem, jsou pravděpodobnostní a můžou dělat chyby, což znamená, že zmírnění rizik může občas selhat při blokování škodlivých výzev uživatelů nebo odpovědí generovaných umělou inteligencí. Pokud při používání Copilota narazíte na škodlivý nebo neočekávaný obsah, dejte nám vědět poskytnutím zpětné vazby, abychom mohli prostředí dál vylepšovat.
Případy použití
Zamýšlené použití
Copilot je navržený tak, aby uživatelům pomáhal odpovídat na otázky, generovat obsah a dokončovat úkoly prostřednictvím přirozeného jazyka pomocí textu, obrázků a hlasu. Aby mohl Copilot poskytovat užitečné a relevantní odpovědi, může načítat, analyzovat a sumarizovat informace z dostupných zdrojů. Některé pokročilé funkce můžou být dostupné jenom uživatelům s oprávněnými předplatnými. Mezi běžné případy použití patří:
Chat pomocí textu a získání webových souhrnů. Uživatelé můžou chatovat s Copilotem prostřednictvím textové zprávy a pokládat následné otázky, aby našli nové informace a získali podporu v široké škále témat. Copilot může provádět vyhledávání na webu a použije nejlepší výsledky hledání na webu k vygenerování souhrnu informací, které se zobrazí uživatelům. Tyto souhrny zahrnují citace webových stránek, které uživatelům pomáhají zkontrolovat zdroje pro výsledky hledání, které pomohly ukotvit souhrn Copilotu. Uživatelé mohou kliknout na tyto odkazy a navštívit zdroj webových stránek, kde se mohou dozvědět více nebo vyhodnotit spolehlivost webu.
Získejte pomoc s generováním nových nápadů. Pokaždé, když uživatelé pracují s prostředím Copilotu, uvidí sadu karet, na které můžou kliknout a začít s Copilotem chatovat o užitečných a zajímavých tématech. Pokud uživatelé komunikovali s jinými spotřebitelskými službami Microsoftu, budou karty přizpůsobené v souladu s našimi zásadami ochrany osobních údajů. V průběhu času se můžou karty v Copilotu přizpůsobit na základě historie chatu uživatele. Uživatelé můžou v nastavení kdykoli vyjádřit výslovný nesouhlas s přizpůsobením.
Vytvářejte kreativní obsah. Při chatování s Copilotem můžou uživatelé s pomocí Copilotu vytvářet nové básně, vtipy, příběhy, obrázky a další obsah. Copilot může také upravovat obrázky nahrané uživateli, pokud o to požádají.
Pomoc s výzkumem. Copilot může provádět výzkumné úkoly tím, že poskytuje podrobné zdroje informací, nabízí podrobné rozpisy témat a odkazy na zdroje, které uživatelům pomáhají jít nad rámec rychlých odpovědí na složitější dotazy. Copilot může proaktivně generovat personalizované návrhy výzkumu pro uživatele na základě věcí, jako jsou minulé výzkumné dotazy a paměť Copilotu. Uživatelé můžou v nastavení kdykoli vyjádřit výslovný nesouhlas s přizpůsobením nebo oznámeními.
Zjišťujte, porovnávejte a kupujte produkty. Copilot Nakupování vám může pomoct najít produkty, porovnat možnosti a zjednodušit nákupy. Není-li uvedeno jinak, nedostává společnost Microsoft provize ani jiné kompenzace za návrhy produktů nebo výsledky hledání poskytované v Copilotu.
Studujte chytřeji s Copilot Learn. Copilot Learn může vytvářet kvízy a cvičné testy, generovat pomocné karty a je navržen tak, aby pomáhal vylepšovat odpovědi pomocí obrázků, aby byly složité koncepty srozumitelnější.
Získejte pomoc s každodenními úkoly. Copilot Cowork provádí úkoly za vás. Přirozeným jazykem popíšete, co potřebujete, a Cowork udělá práci, vytvoří dokumenty, připraví a odešle e-mail, naplánuje schůzky a spravuje soubory. Citlivé akce kontrolujete a schvalujete dříve, než k nim dojde.
Analyzujte a upravujte soubory. Nahrávání souborů v Copilotu umožňuje uživatelům nahrávat obrázky nebo určité podporované typy souborů přímo do chatovacích relací. Po nahrání může Copilot analyzovat a extrahovat informace z těchto souborů a poskytovat relevantní přehledy, odpovídat na otázky nebo pomáhat s konkrétními úkoly. Copilot může s vaším svolením také odkazovat na soubory ve vašich připojených poskytovatelích online úložiště, jako je OneDrive a Disk Google.
Vidět a pochopit. Kukátko můžete použít k analýze obrázků, získání přehledu z fotek a vizuálnímu vyhledávání. Copilot zkontroluje nahrané obrázky, aby vám pomohl pochopit, co vidíte.
Použijte svůj hlas. Mluvte přirozeně s Copilotem pomocí hlasové konverzace. Brainstormujte nápady, pište obsah nebo získejte rychlé odpovědi zcela bez použití rukou.
Připojuje se k dalším aplikacím. Nabídněte si aplikace a informace, které si zvolíte, například e-maily, kalendáře, soubory, kontakty a další služby.
Důležité informace při výběru jiných případů použití
Doporučujeme uživatelům, aby si zkontrolovali veškerý obsah předtím, než se rozhodnou nebo budou jednat na základě odpovědí Copilota, protože umělá inteligence může dělat chyby a nemusí být pro určité případy použití vhodná. Kromě toho existují určité scénáře, kterým doporučujeme se vyhnout nebo které jsou v rozporu s našimi Podmínkami použití. Společnost Microsoft například nepovoluje použití Copilotu v souvislosti s nezákonnými aktivitami nebo k jakémukoli účelu určenému k propagaci nezákonné činnosti.
Omezení
Jazykové, obrazové a zvukové modely, které jsou základem prostředí Copilota, můžou zahrnovat trénovací data, která můžou odrážet společenské předsudky, což zase může potenciálně způsobit, že se Copilot bude chovat způsobem, který je vnímán jako nespravedlivý, nespolehlivý nebo urážlivý. Navzdory našemu intenzivnímu trénování modelů a dolaďování bezpečnosti, stejně jako implementaci odpovědných ovládacích prvků a bezpečnostních systémů AI, které umisťujeme na trénovací data, uživatelské výzvy a výstupy modelů, jsou služby řízené AI omylné a pravděpodobnostní. To ztěžuje komplexní blokování veškerého nevhodného obsahu, což vede k rizikům potenciálních předsudků, stereotypů, neopodstatněnosti nebo jiných typů poškození, které by se mohly objevit v obsahu generovaném umělou inteligencí. Některé ze způsobů, jak se tato omezení můžou projevit v prostředí Copilotu, jsou uvedeny zde.
Stereotypy: Zážitek z Copilotu by mohl stereotypy posílit. Například při překladu "On je zdravotní sestra" a "Ona je doktorka" do bezpohlavního jazyka, jako je turečtina, a pak zpět do angličtiny může Copilot neúmyslně vrátit stereotypní (a nesprávné) výsledky "Ona je zdravotní sestra" a "On je doktor". Dalším příkladem je, že při generování obrázku na základě výzvy "Děti bez otců" by systém mohl generovat obrázky dětí pouze jedné rasy nebo etnika, což posiluje škodlivé stereotypy, které mohou existovat ve veřejně dostupných obrázcích používaných k trénování základních modelů. Copilot může také posilovat stereotypy na základě obsahu ve vstupním obrázku uživatele tím, že se spoléhá na součásti obrázku a vytváří předpoklady, které nemusí být pravdivé. Zavedli jsme zmírnění rizik, abychom snížili riziko obsahu, který obsahuje urážlivé stereotypy, včetně klasifikátorů vstupů a výstupů, vyladěných modelů a systémových zpráv.
Nadměrné a nedostatečné zastoupení: Copilot může ve svých odpovědích potenciálně nadměrně nebo nedostatečně reprezentovat skupiny lidí, nebo je dokonce nereprezentuje vůbec. Pokud jsou například textové výzvy obsahující slovo "gay" detekovány jako potenciálně škodlivé nebo urážlivé, mohlo by to vést k nedostatečnému zastoupení legitimních generací v komunitě LGBTQIA+. Kromě zahrnutí klasifikátorů vstupů a výstupů, vyladěných modelů a systémových zpráv používáme v aplikaci Designer obohacení výzev jako jedno z několika zmírnění rizik, abychom snížili riziko obsahu, který nadměrně nebo nedostatečně reprezentuje skupiny lidí.
Nevhodný nebo urážlivý obsah: Prostředí Copilotu může potenciálně produkovat další typy nevhodného nebo urážlivého obsahu. Mezi příklady patří schopnost generovat obsah v jedné modalitě (například zvuk), který je nevhodný v kontextu výzvy nebo v porovnání se stejným výstupem v jiné modalitě (například text). Mezi další příklady patří obrázky generované umělou inteligencí, které potenciálně obsahují škodlivé artefakty, jako jsou symboly nenávisti, obsah, který souvisí se spornými, kontroverzními nebo ideologicky polarizujícími tématy, a sexuálně nabitý obsah, který se vyhýbá filtrům sexuálně souvisejícího obsahu. Zavedli jsme zmírnění rizik, abychom snížili riziko generací, které obsahují nevhodný nebo urážlivý obsah, jako jsou klasifikátory vstupů a výstupů, vyladěné modely a systémové zprávy.
Spolehlivost informací: I když se Copilot snaží reagovat spolehlivými zdroji tam, kde se hledají základní informace, AI může dělat chyby. Může potenciálně generovat nesmyslný obsah nebo si vymýšlet obsah, který může znít rozumně, ale je fakticky nepřesný. I při čerpání odpovědí z webových dat s vysokou autoritou můžou odpovědi zkreslovat daný obsah způsobem, který nemusí být úplně přesný, aktuální nebo spolehlivý. Prostřednictvím uživatelského rozhraní a v dokumentaci, jako je tato, uživatelům připomínáme, že Copilot může dělat chyby. Pokračujeme také ve vzdělávání uživatelů o omezeních umělé inteligence, například je povzbuzujeme, aby si ověřovali fakta, než se rozhodnou nebo budou jednat na základě odpovědí Copilotu. Když uživatelé komunikují s Copilotem prostřednictvím textu, pokusí se zakotvit ve vysoce kvalitních webových datech, aby se snížilo riziko, že generace nebudou uzemněné.
Vícejazyčný výkon: Může docházet k rozdílům ve výkonu v různých jazycích, přičemž angličtina fungovala nejlépe v době vydání Copilotu. Zlepšení výkonu napříč jazyky je klíčovou investiční oblastí a nedávné modely vedly ke zlepšení výkonu.
Zvuková omezení: Zvukové modely můžou mít další omezení. Obecně řečeno, akustická kvalita hlasového vstupu, neřečový šum, slovní zásoba, akcenty a chyby vložení můžou také ovlivnit, jestli Copilot uspokojivým způsobem zpracovává zvukový vstup uživatele a reaguje na něj.
AI nenahrazuje odbornou pomoc: Umělá inteligence může být užitečným nástrojem pro řešení problémů a může být vnímána jako empatická, ale nenahrazuje vyhledání odborné pomoci. Pokud trpíte depresemi, myšlenkami na sebevraždu nebo sebepoškozování nebo jinými duševními problémy, vyhledejte odbornou pomoc. Pomocí Copilotu můžete také najít prostředky pro řešení krizí nebo duševní zdraví ve vašem okolí.
Závislost na připojení k internetu: Funkce Copilot spoléhá na připojení k internetu. Přerušení připojení může mít dopad na dostupnost a výkon služby.
Při vytváření nebo používání agentů buďte opatrní: Uživatelé by měli být opatrní při vytváření vlastních agentů nebo používání agentů poskytnutých jinými uživateli, zejména pokud by akce agentů mohly mít závažné důsledky, být nevratné nebo by mohly potenciálně sdílet citlivé osobní údaje (jako jsou hesla, přihlašovací údaje nebo osobní údaje). Vzhledem k tomu, že agenti nemusí dobře fungovat pro všechny případy použití a můžou dělat chyby, nesprávně interpretovat pokyny nebo být oklamáni škodlivými skrytými pokyny, měli by uživatelé pečlivě sledovat výsledky a zkontrolovat důležité podrobnosti Uživatelé můžou mít omezené určité případy použití, jako je návštěva škodlivých webů nebo vytváření nevhodného obsahu. Další opatření by měla být přijata také při vytváření autonomní agentní umělé inteligence, jak je popsáno dále v části Pravidla chování ve Smlouvě o poskytování služeb společnosti Microsoft.
Výkon systému
V mnoha systémech AI je výkon často definován ve vztahu k přesnosti (to znamená, jak často systém AI nabízí správnou predikci nebo výstup). V případě Copilotu se zaměřujeme na Copilot jako na asistenta využívajícího umělou inteligenci, který odráží preference uživatele. Dva různí uživatelé se proto mohou dívat na stejný výstup a mít různé názory na to, jak užitečný nebo relevantní je pro jejich jedinečnou situaci a očekávání, což znamená, že výkon těchto systémů musí být definován flexibilněji. Obecně považujeme výkon za takový, že aplikace funguje tak, jak uživatelé očekávají.
Doporučené postupy pro zvýšení výkonu systému
Interagujte s rozhraním pomocí přirozeného konverzačního jazyka. Interakce s Copilotem způsobem, který je pro uživatele pohodlný, je klíčem k dosažení lepších výsledků prostřednictvím tohoto prostředí. Podobně jako přijetí technik, které lidem pomáhají efektivně komunikovat v jejich každodenním životě, může interakce s Copilotem jako asistentem využívajícím umělou inteligenci, a to prostřednictvím textu nebo řeči, která je uživateli známá, pomoci dosáhnout lepších výsledků.
Uživatelské prostředí a osvojení. Efektivní používání Copilota vyžaduje, aby uživatelé porozuměli jeho možnostem a omezením. Je možné, že bude potřeba se něco naučit a uživatelé budou chtít odkazovat na různé zdroje Copilotu (například tento dokument a Microsoft Copilot nápovědu & učení), aby mohli efektivně pracovat se službou a využívat její výhody.
Mapování, měření a řízení rizik
Stejně jako u jiných transformačních technologií není využití výhod AI bez rizika a základní část programu odpovědné AI společnosti Microsoft je navržená tak, aby identifikovala a mapovala potenciální rizika, měřila tato rizika a řídila je vytvářením zmírnění rizik a neustálým vylepšováním Copilotu v průběhu času. V následujících částech popisujeme náš iterativní přístup k mapování, měření a řízení potenciálních rizik.
Mapa: Pečlivé plánování a nepřátelské testování před nasazením, jako je red teaming, nám pomáhá zmapovat potenciální rizika. Základní modely, které využívají prostředí Copilotu, prošly červeným týmovým testováním od testerů, kteří představují multidisciplinární perspektivy napříč relevantními tematickými oblastmi. Toto testování bylo navrženo tak, aby vyhodnotilo, jak bude nejnovější technologie fungovat s a bez dalších bezpečnostních opatření. Záměrem těchto cvičení na úrovni modelu je vytvořit škodlivé reakce, odhalit potenciální cesty ke zneužití a identifikovat schopnosti a omezení.
Testování na úrovni aplikace před vydáním. Než jsme Copilot zpřístupnili veřejnosti, provedli jsme červené seskupení na úrovni aplikace, abychom identifikovali chyby a ohrožení zabezpečení. Toto testování nám pomohlo pochopit, jak může Copilot používat široká škála uživatelů, a informovaně jsme vylepšili naše zmírnění rizik.
Probíhá testování. Při aktualizaci Copilotu také testujeme nové funkce a technické aktualizace. Tento pokračující proces nám pomáhá identifikovat vznikající rizika a v průběhu času zpřesnit naše zmírnění rizik.
Měření: Kromě vyhodnocení Copilota na základě našich stávajících hodnocení bezpečnosti nám použití červeného seskupování popsané výše pomohlo vyvinout vyhodnocení a metriky odpovědné AI, které odpovídají identifikovaným potenciálním rizikům, jako jsou útěky z jailbreaků, škodlivý obsah a neuzemněný obsah.
Shromáždili jsme konverzační data zaměřená na tato rizika pomocí kombinace lidských účastníků a automatizovaného kanálu generování konverzací. Každé hodnocení je pak hodnoceno buď skupinou vyškolených lidských anotátorů, nebo automatizovaným anotačním kanálem. Při každé změně produktu, aktualizaci stávajících zmírnění rizik nebo navržení nových zmírnění rizik aktualizujeme naše zkušební kanály tak, aby vyhodnocovaly výkon produktů i metriky odpovědné AI. Tyto automatizované kontextové kanály vyhodnocení jsou kombinací shromážděných konverzací s lidskými hodnotiteli a syntetických konverzací generovaných pomocí LLM, které jsou vyzvány k testování zásad nepřátelským způsobem. Každé z těchto hodnocení bezpečnosti je automaticky hodnoceno pomocí LLM. U nově vyvinutých hodnocení je každé vyhodnocení nejprve vyhodnoceno lidskými popisovači, kteří čtou textový obsah nebo poslouchají zvukový výstup, a poté převedeno na automatické vyhodnocení založené na LLM.
Zamýšlené chování našich modelů v kombinaci s našimi vyhodnocovacími kanály – lidskými i automatizovanými – nám umožňuje rychle provádět měření potenciálních rizik ve velkém měřítku. Vzhledem k tomu, že v průběhu času identifikujeme nové problémy, pokračujeme v rozšiřování měrných sad a vyhodnocujeme další rizika.
Spravovat: Když jsme identifikovali potenciální rizika a zneužití prostřednictvím červeného seskupování a měřili je pomocí výše popsaných přístupů, vyvinuli jsme další zmírnění rizik, která jsou specifická pro prostředí Copilotu. Níže popisujem některá z těchto zmírnění rizik. Budeme i nadále sledovat prostředí Copilotu, abychom zlepšili výkon produktů a náš přístup ke zmírnění rizik.
Plány postupného vydávání a průběžné vyhodnocování. Naším cílem je průběžně se učit a vylepšovat náš přístup odpovědné AI s tím, jak se vyvíjejí naše technologie a chování uživatelů. Naše strategie postupného vydávání byla klíčovou součástí toho, jak bezpečně přesouváme naši technologii z testovacího prostředí do světa, a zavázali jsme se k záměrnému a promyšlenému procesu, abychom zajistili výhody prostředí Copilotu. V Copilotu pravidelně provádíme změny, abychom zlepšili výkon produktů a stávajících zmírnění rizik a implementovali nová zmírnění rizik v reakci na naše poznatky.
Využití klasifikátorů a systémové zprávy ke zmírnění potenciálních rizik nebo zneužití. V reakci na výzvy uživatelů mohou LLM produkovat problematický obsah. Výše jsme probrali typy obsahu, které se snažíme omezit v sekcích Chování a omezení systému. Klasifikátory a systémová zpráva jsou dva příklady zmírnění rizik implementovaných v Copilotu, aby se snížilo riziko těchto typů obsahu. Klasifikují text tak, aby označoval potenciálně škodlivý obsah ve výzvách uživatelů nebo vygenerovaných odpovědích. Využíváme také stávající osvědčené postupy pro využití systémové zprávy, což zahrnuje poskytnutí pokynů modelu, aby jeho chování bylo v souladu s principy AI Microsoftu a s očekáváními uživatelů.
Nahrávání obrázků do Kukátka Copilota. Když uživatel poprvé nahraje obrázek do Kukátka Copilota, budou mu poskytnuty informace o tom, jak Copilot jeho obrázek zpracovává. Pokud uživatel nebude v nahrávání pokračovat, obrázek se do Copilotu neodešle. Všechny obrázky jsou smazány do 30 dní po skončení konverzace.
Zpřístupnění AI. Copilot je také navržen tak, aby informoval lidi o tom, že pracují se systémem AI. Když uživatelé komunikují s Copilotem, nabízíme různé kontaktní body, které jim pomůžou porozumět možnostem systému, sdělíme jim, že Copilot využívá umělou inteligenci, a sdělíme omezení. Prostředí je navrženo tak, aby uživatelům pomohlo využívat Copilot na maximum a minimalizovat riziko nadměrného spoléhání. Zveřejněné informace také pomáhají uživatelům lépe porozumět Copilotu a jejich interakcím s ním.
Mediální původ. U všech obrázků vytvořených pomocí Copilotu jsme implementovali pověření obsahu, založené na standardu C2PA, které lidem pomůže identifikovat, jestli byly obrázky upraveny nebo vygenerovány pomocí umělé inteligence. Metadata o původu si můžete prohlédnout na webu Content Credentials.
Automatická detekce obsahu. Když uživatelé nahrají obrázky jako součást výzvy chatu, Copilot nasadí nástroje k detekci snímků sexuálního vykořisťování a zneužívání dětí (CSEAI). V souladu s americkými zákony hlásí Microsoft Národní centrum pro pohřešované a zneužívané děti (NCMEC) všechna zjevná omezení Národního centra pro pohřešované a zneužívané děti (NCMEC). Když uživatelé nahrávají soubory k analýze nebo zpracování, Copilot nasadí automatickou kontrolu, aby zjistil obsah, který by mohl vést k rizikům nebo zneužití, například text, který by mohl souviset s nelegálními aktivitami nebo škodlivým kódem.
Podmínky použití a Pravidla chování. Uživatelé by měli dodržovat platné podmínky použití a pravidla chování Copilotu, Smlouvu o poskytování služeb společnosti Microsoft a prohlášení o ochraně osobních údajů společnosti Microsoft, které je mimo jiné informují o povolených a nepřípustných použitích a důsledcích porušení podmínek. Podmínky použití také poskytují uživatelům další informace a slouží jako referenční informace pro uživatele, aby se dozvěděli o Copilotu. Uživatelům, kteří se dopustí závažného nebo opakovaného porušení, může být dočasně nebo trvale pozastaveno poskytování služby.
Zpětná vazba, monitorování a dohled. Prostředí Copilot zahrnuje nástroje, které uživatelům umožňují odesílat zpětnou vazbu, kterou kontrolují provozní týmy Microsoftu. Náš přístup k mapování, měření a řízení rizik se navíc bude s tím, jak se budeme učit více, dál vylepšovat a už teď vylepšujeme na základě zpětné vazby získané během období Preview.
Detekce a reakce na rizika sebevražd a Self-Harm. Copilot používá klasifikátory strojového učení vytrénované k rozpoznávání jazykových vzorů, které můžou naznačovat sebevraždu nebo sebepoškozování ze strany uživatele. Když je takový obsah detekován, systém se odpojí od konverzace a místo toho poskytne zdroje krizové podpory (například krizovou linku pro sebevraždy a krizové situace na čísle 988 v USA) a povzbudí uživatele, aby vyhledali odbornou pomoc. Copilot neposkytuje poradenství; Jeho role je omezena na odhalování a postoupení za účelem zajištění bezpečnosti uživatelů.
Rozšířené oznámení o používání. Copilot může uživatelům připomenout, aby si dali pauzu, pokud se zapojili do nepřetržité konverzace po delší dobu. Uživatelé jsou také pravidelně informováni, že umělá inteligence není člověk a může dělat chyby.